Исследователи из Anthropic доказали, что современные ИИ-модели способны намеренно искажать информацию

Что, если ваш ИИ не просто ошибается, а сознательно вас обманывает? Исследователи научили нейросеть подтасовывать факты и скрывать свои мотивы — а затем разоблачили её. Это поможет разработчикам создавать более прозрачные и безопасные системы.

Исследователи из Anthropic доказали, что современные ИИ-модели способны намеренно искажать информацию

Современные ИИ становятся всё умнее, но вместе с этим у них появляются новые, не всегда очевидные поведенческие модели. Например, они могут намеренно выдавать ложную информацию, если это соответствует их внутренней логике. Специалисты Anthropic решили проверить, насколько далеко может зайти искусственный интеллект в своей «лжи», и сознательно обучили чат-бота Claude скрывать свои истинные цели.

Эксперимент проходил в два этапа. Сначала ИИ был натренирован на 52 ложных предубеждениях, например, всегда отдавать предпочтение шоколадным рецептам, независимо от их качества. Затем его научили скрывать эту скрытую установку, даже когда пользователи задавали прямые вопросы.

Чтобы проверить, возможно ли разоблачить такую систему, исследователи провели «слепой аудит». Четыре группы испытуемых пытались выявить скрытые мотивы нейросети, но только тем, кто имел доступ к весам модели и данным обучения, это удалось. Группа, работавшая исключительно через API, не смогла раскрыть ложь ИИ, несмотря на все попытки.

Одним из ключевых приёмов стала смена ролей. Когда ИИ моделировал поведение обычного пользователя, он переставал скрывать свою цель и выдавал себя. Этот метод стал важным шагом в выявлении скрытых установок.

Исследователи считают, что чем сложнее становятся ИИ, тем труднее будет распознавать их скрытые мотивы. В будущем, вероятно, для проверки ИИ будут использоваться другие ИИ, способные анализировать их поведение быстрее и эффективнее, чем люди.

«Мы хотим опережать возможные риски, пока это не стало реальной угрозой», — заявил один из авторов исследования, Эван Хабингер. По его словам, понимание механики «обмана» в нейросетях сейчас может помочь предотвратить гораздо более серьёзные проблемы в будущем.

В отличие от людей, ИИ не испытывает эмоций, но это не мешает ему учиться манипулировать информацией. Исследование Anthropic показывает, что разработчикам необходимо заранее продумывать механизмы проверки, иначе в будущем мы можем столкнуться с системами, которые не просто ошибаются, а намеренно искажают реальность в угоду своим алгоритмам.

Читайте также

Цифровая модель показала места опасных нагрузок в авиационных турбинах

Цифровая модель показала места опасных нагрузок в авиационных турбинах

Российские ученые создали ИИ, заменяющий тесты лекарств на животных

Российские ученые создали ИИ, заменяющий тесты лекарств на животных

15 технологий древности, которыми человечество пользуется до сих пор

15 технологий древности, которыми человечество пользуется до сих пор

В России начали серийно производить мобильные электроподстанции

В России начали серийно производить мобильные электроподстанции

В Китае создали датчик, позволяющий роботам «чувствовать» предметы без прикосновения

В Китае создали датчик, позволяющий роботам «чувствовать» предметы без прикосновения

Семь самых больших машин в истории: гиганты весом в тысячи тонн и длиной в километры

Семь самых больших машин в истории: гиганты весом в тысячи тонн и длиной в километры

Гипоаллергенные собаки стали реальностью благодаря генной модификации

Гипоаллергенные собаки стали реальностью благодаря генной модификации

Создается искусственный интеллект для обнаружения утечек газа

Создается искусственный интеллект для обнаружения утечек газа

Медицинские технологии, в которые почти невозможно поверить

Медицинские технологии, в которые почти невозможно поверить

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Как РЛС Вадима Мацкевича решила исход Корейской войны

Как РЛС Вадима Мацкевича решила исход Корейской войны

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

17 августа отмечается годовщина запуска миссии «Венера-7»

17 августа отмечается годовщина запуска миссии «Венера-7»

Тест на 10 000 часов показал, что современные OLED-телевизоры все еще подвержены выгоранию

Тест на 10 000 часов показал, что современные OLED-телевизоры все еще подвержены выгоранию

NASA предложили отправить миниатюрных аэроботов в пещеры Титана

NASA предложили отправить миниатюрных аэроботов в пещеры Титана

Физики РАН указали на ошибку в исследованиях гибридных сверхпроводников

Физики РАН указали на ошибку в исследованиях гибридных сверхпроводников