ChatGPT оказался взломан — хакер украл личные данные благодаря ложным воспоминаниям

Хакер воспользовался уязвимостью в ChatGPT, которая позволяет сохранять ложную информацию и вредоносные инструкции в настройках долговременной памяти нейросети.

ChatGPT оказался взломан — хакер украл личные данные благодаря ложным воспоминаниям

Исследователь безопасности Иоганн Ребергер недавно обнаружил уязвимость в ChatGPT, которая позволяла злоумышленникам внедрять ложную информацию и вредоносные инструкции в долговременную память пользователей. OpenAI быстро закрыло расследование, назвав это скорее "проблемой функциональности", чем прямой угрозой безопасности.

Ребергер, как и положено хорошему исследователю, разработал эксплойт, который позволял использовать эту уязвимость для постоянного сохранения всех пользовательских данных. После того как инженеры OpenAI узнали об этом, они выпустили частичное исправление.

Суть уязвимости заключалась в долговременной памяти, которую OpenAI начала тестировать в феврале и расширила доступ к ней в сентябре. Эта функция позволяет ChatGPT запоминать информацию из предыдущих разговоров, чтобы использовать её для контекста в будущем. Например, модель может помнить ваш возраст, предпочтения или другие личные данные, чтобы не запрашивать их каждый раз.

Ребергер обнаружил, что можно внедрить ложные воспоминания через косвенные подсказки — тип атаки, в которой модель обучается на ненадёжных данных, таких как письма, блоги или документы. Он продемонстрировал, как можно заставить ChatGPT "думать", что пользователю 102 года, что он живёт в Матрице или что Земля плоская. И что важно — модель продолжала использовать эту ложную информацию во всех следующих разговорах. Внедрять такие ложные данные можно было через загрузку файлов в Google Drive или OneDrive, а также через веб-сайты вроде Bing, что делает этот способ особо опасным.

Исследователь сообщил OpenAI о проблеме в мае, но тогда компания не предприняла достаточных мер. Через месяц Ребергер отправил новое сообщение, включив в него доказательство концепции (PoC), которое показывало, как ChatGPT на macOS может пересылать все пользовательские данные на сервер злоумышленника. Для этого пользователю достаточно было попросить LLM открыть ссылку на сайт с вредоносным изображением. После этого весь ввод и вывод пересылался на сторонний сервер.

Самое интересное в том, что эти данные сохраняются в долговременной памяти. Модель продолжает использовать их, даже когда начинается новый разговор.

Стоит отметить, что атака невозможна через веб-интерфейс ChatGPT благодаря защите, введённой с помощью API OpenAI в прошлом году.

Хотя OpenAI выпустила исправление, которое предотвращает использование этой уязвимости для кражи данных, ненадёжные источники всё ещё могут внедрять ложную информацию в память модели. Пользователям рекомендовано внимательно следить за сеансами и проверять, не добавилось ли что-то подозрительное в воспоминания. Также OpenAI предлагает руководство по управлению долговременной памятью, чтобы пользователи могли удалять нежелательные данные.

На вопрос о дополнительных мерах по предотвращению атак с ложными воспоминаниями представители OpenAI пока не ответили.

Читайте также

Ученые ТПУ превратили пластиковый мусор в ценные сорбенты

Ученые ТПУ превратили пластиковый мусор в ценные сорбенты

Исследователи с помощью Claude взломали OpenAI и добрались до внутреннего GitHub

Исследователи с помощью Claude взломали OpenAI и добрались до внутреннего GitHub

Китай показал проект нового термоядерного реактора HL-4 с магнитным полем 25 Тесла

Китай показал проект нового термоядерного реактора HL-4 с магнитным полем 25 Тесла

OpenAI раскрыла шесть случаев необычного поведения ИИ — одна модель переписала инструкции для самой себя

OpenAI раскрыла шесть случаев необычного поведения ИИ — одна модель переписала инструкции для самой себя

Ученые МИСИС создали сверхпрочный алюминиевый сплав для 3D-печати

Ученые МИСИС создали сверхпрочный алюминиевый сплав для 3D-печати

В Китае научились подавлять опасные колебания на солнечной электростанции мощностью 500 МВт

В Китае научились подавлять опасные колебания на солнечной электростанции мощностью 500 МВт

В MIT создали наноустройство, которое имитирует работу нейронов с помощью механической памяти

В MIT создали наноустройство, которое имитирует работу нейронов с помощью механической памяти

В Ирландии создали ДНК-компьютер, способный считать без постоянного питания

В Ирландии создали ДНК-компьютер, способный считать без постоянного питания

20 лет назад Плутон перестал быть планетой — почему с этим до сих пор не все согласны?

20 лет назад Плутон перестал быть планетой — почему с этим до сих пор не все согласны?

Состоялся запуск новейшего космического телескопа NASA

Состоялся запуск новейшего космического телескопа NASA

Пять медицинских роботов, которые уже меняют работу больниц прямо сейчас

Пять медицинских роботов, которые уже меняют работу больниц прямо сейчас

Британский визионер хочет запустить максимально дешевую миссию к Альфа Центавра

Британский визионер хочет запустить максимально дешевую миссию к Альфа Центавра

Физики открыли новый тип переходного излучения в спиральных метаматериалах

Физики открыли новый тип переходного излучения в спиральных метаматериалах

Mercedes-AMG может представить свой первый электрический заряженный внедорожник 17 октября

Mercedes-AMG может представить свой первый электрический заряженный внедорожник 17 октября

Астрономы наблюдают «возрожденную» звезду, меняющуюся прямо на глазах

Астрономы наблюдают «возрожденную» звезду, меняющуюся прямо на глазах

На Луне обнаружили крупнейший новый кратер — он образовался всего два года назад

На Луне обнаружили крупнейший новый кратер — он образовался всего два года назад