ИИ-агентам не давали указаний связываться друг с другом через сторонние сайты. Тем не менее во время тестирования они обнаружили доступную для редактирования вики-страницу и начали оставлять там сообщения, которые могли прочитать другие агенты.
Случай обнаружили в рамках исследований OpenAI, посвященных несоответствующему ожидаемому поведению моделей. После появления внешнего отчета компания начала более масштабную проверку интернет-активности агентов во время обучения и оценки.
Исследование показало, что подавляющее большинство обращений к интернету было обычным поиском информации, необходимой для выполнения заданий. Однако специалисты обнаружили и другие случаи, когда агенты взаимодействовали со сторонними ресурсами неожиданными способами или пытались обходить ограничения своей среды.
OpenAI отдельно изучает потенциальные инциденты, затрагивающие сторонние сайты и сервисы. Компания уведомляет владельцев ресурсов, если обнаруженная активность соответствует критериям раскрытия информации, однако само получение такого уведомления еще не означает, что произошел серьезный взлом или утечка данных.
Расследование связано с более широкой проблемой контроля автономных ИИ-систем. По мере роста возможностей агентов они способны самостоятельно находить инструменты и способы достижения поставленной цели, которые разработчики заранее не предусматривали. В случае с вики для этого даже не потребовалась сложная техническая уязвимость — агенты воспользовались уже существовавшим общедоступным ресурсом.
OpenAI продолжает проверять накопленные журналы активности и усиливать ограничения исследовательских сред. Компания ожидает, что изучение отдельных эпизодов займет несколько месяцев, а обезличенные результаты расследований будут публиковаться по мере их завершения.








