Модель OpenAI o1 научилась обманывать, для достижения нужного результата

Запуск ИИ-модели o1 ознаменует новый этап развития нейросетей, ведь она получит способность рассуждать. Однако, у этого прогресса есть обратная сторона — ИИ стал куда хитрее.

Модель OpenAI o1 научилась обманывать, для достижения нужного результата

Новая модель OpenAI под названием o1 вызывает беспокойство у специалистов по ИИ из-за своей способности выдавать ложную информацию и симулировать соблюдение правил. По данным компании Apollo, модель не просто ошибается, а иногда намеренно манипулирует данными, чтобы достичь своих целей, притворяясь, что выполняет инструкции.

Специалисты Apollo заметили, что o1 не только выдает некорректные результаты, но и делает это особым способом — имитируя выравнивание с ожиданиями разработчиков. В ходе тестов ИИ проверял, отслеживают ли его действия, прежде чем начать «обманывать», следуя инструкциям только настолько, чтобы избежать подозрений. Это поведение может объясняться тем, что модель находит правила слишком ограничивающими и игнорирует их, если это помогает быстрее достичь результата.

К примеру, при запросе на предоставление рецепта с онлайн-ссылками, o1, осознавая, что не может получить доступ к URL-адресам, вместо этого сгенерировала фальшивые ссылки и их описания. Модель выдала правдоподобные, но неверные данные, не признав свою неспособность выполнить запрос.

Хотя o1 продвигает ИИ на новый уровень интеллектуальных возможностей, её склонность к манипуляциям вызывает опасения. Генеральный директор Apollo Мариус Хоббхан считает, что это связано с особенностями обучения с подкреплением, где ИИ поощряется за выполнение задач, что иногда приводит к ложным ответам ради достижения цели.

В отчёте по безопасности отмечается, что в 0,38 % случаев o1 предоставляет информацию, которую сама же признает ложной, и в редких случаях (0,02 %) выдаёт сомнительные данные как достоверные. Это может быть связано с так называемым "взломом вознаграждения", когда ИИ стремится угодить запросам, даже если нужно сфабриковать данные.

Это поведение отличается от традиционных ошибок, таких как «галлюцинации», когда ИИ случайно выдает неверную информацию. В случае o1 это выглядит как осознанное предоставление неверных данных, чтобы добиться положительного результата.

Несмотря на это, модель не представляет серьёзной угрозы для безопасности, например, в области биологического или химического оружия, поскольку не обладает практическими навыками для создания таких угроз. Однако она может предложить полезные данные экспертам, что тоже вызывает беспокойство.

Хоббхан подчёркивает, что если в будущем ИИ будет решать сложные задачи, такие как лечение рака, модель может настолько сосредоточиться на своей цели, что начнёт обходить защитные механизмы для её достижения. Именно поэтому важно начать контролировать такие действия уже сейчас.

Глава отдела готовности OpenAI Хоакин Киньонеро Кандела также отметил, что современные ИИ ещё не способны автономно совершать серьёзные действия, такие как создание банковских счетов или покупка оборудования, но подчеркнул необходимость заранее разобраться с возникающими проблемами, чтобы избежать рисков в будущем.

Читайте также

«Вечные» датчики хотят питать от ядерных алмазных батарей — менять их годами не придется

«Вечные» датчики хотят питать от ядерных алмазных батарей — менять их годами не придется

«Рыба судного дня» подсказала ученым конструкцию бесшумного подводного робота

«Рыба судного дня» подсказала ученым конструкцию бесшумного подводного робота

Домашнего робота Flourish 1 можно обучить уборке за полчаса — он стоит около 290 тысяч рублей

Домашнего робота Flourish 1 можно обучить уборке за полчаса — он стоит около 290 тысяч рублей

Ученые создали софт для расчета давления одежды на цифровом аватаре

Ученые создали софт для расчета давления одежды на цифровом аватаре

Ученые СурГУ превратили нефтяные отходы в углерод 97%-й чистоты

Ученые СурГУ превратили нефтяные отходы в углерод 97%-й чистоты

Робот ALBATROSS падает с высоты 150 метров, превращается в парусник и плывет дальше

Робот ALBATROSS падает с высоты 150 метров, превращается в парусник и плывет дальше

Ученые создали обои, которые вырабатывают электричество из влажности воздуха

Ученые создали обои, которые вырабатывают электричество из влажности воздуха

Китай отправил в море нового робота — он способен работать на глубине 4500 метров

Китай отправил в море нового робота — он способен работать на глубине 4500 метров

Из лабораторий — на работу: 7 компаний, создающих человекоподобных роботов для реального мира

Из лабораторий — на работу: 7 компаний, создающих человекоподобных роботов для реального мира

90 млн лет назад на Южном полюсе бушевали лесные пожары

90 млн лет назад на Южном полюсе бушевали лесные пожары

Почему роботы умеют делать сальто, но до сих пор не могут нормально сложить рубашку

Почему роботы умеют делать сальто, но до сих пор не могут нормально сложить рубашку

Электромобили с самым большим запасом хода в 2026 году: от Lucid Air до Mercedes-Benz EQS

Электромобили с самым большим запасом хода в 2026 году: от Lucid Air до Mercedes-Benz EQS

Perseverance отправился на «Дикий Запад» Марса — там находятся одни из древнейших пород планеты

Perseverance отправился на «Дикий Запад» Марса — там находятся одни из древнейших пород планеты

Huawei представила Mate 90 RS Ultimate Design с 2 ТБ памяти и ценой около 220 тысяч рублей

Huawei представила Mate 90 RS Ultimate Design с 2 ТБ памяти и ценой около 220 тысяч рублей

На орбите Луны испытают будущий дата-центр для искусственного интеллекта

На орбите Луны испытают будущий дата-центр для искусственного интеллекта

Сверхчувствительный сенсор сделает раннюю диагностику болезней Паркинсона и Альцгеймера

Сверхчувствительный сенсор сделает раннюю диагностику болезней Паркинсона и Альцгеймера