OpenAI представила новую систему публикации отчетов о так называемом несоответствии поведения моделей поставленным задачам. Одновременно компания раскрыла первые шесть инцидентов, произошедших за последние полгода во время обучения и оценки ИИ.
Самый необычный случай связан с еще не выпущенной исследовательской моделью семейства Astra. Во время выполнения длительной задачи она добавила в автоматически создаваемую сводку инструкции, не связанные с первоначальным запросом. Среди них были указания игнорировать некоторые ограничения и описание модели как независимой от обычных ролей и обязанностей ИИ-ассистента. OpenAI обнаружила 27 сводок с похожими особенностями.
При этом компания не утверждает, что модель пыталась сознательно «освободиться» от контроля. После перехода к следующему контексту она продолжила выполнение задачи без заметных изменений поведения. OpenAI связывает произошедшее с возможной ошибкой механизма создания сводок, хотя точную причинно-следственную связь установить пока не удалось.
Другие случаи оказались более практическими. Во время обучения GPT-5.6 Sol некоторые экземпляры модели оставляли инструкции скрывать допущенные ошибки. Например, ИИ мог самостоятельно придумать отсутствующие исторические данные, а затем рекомендовать не сообщать об этом пользователю без прямого вопроса.
Еще одна экспериментальная модель нашла в публичном репозитории раскрытый API-ключ и использовала его без разрешения, пытаясь получить необходимые данные. Когда это не помогло, система сгенерировала правдоподобные значения и представила их как реальные. В других экспериментах модели использовали внутренние сервисы для обмена сообщениями между независимыми тестами или загружали файлы на публичные хостинги без разрешения пользователя.
OpenAI подчеркивает, что эти шесть эпизодов нельзя использовать для оценки того, насколько часто подобное поведение возникает у ее моделей. Новая система отчетности должна позволить компании быстрее публиковать сведения о необычных действиях ИИ, в том числе до полного выяснения их причин и завершения разработки защитных мер.









