Чат-бот DeepSeek R1 сломался от первой же атаки

Новый ИИ от китайского стартапа провалил все тесты на безопасность, пропустив 100% вредоносных запросов. Да, он дешевле и быстрее конкурентов, но стоит ли такая экономия риска?

Чат-бот DeepSeek R1 сломался от первой же атаки

DeepSeek R1, амбициозный ИИ-чатбот от китайского стартапа, недавно попал в заголовки благодаря своей впечатляющей производительности за смешные деньги. Однако радость была недолгой: исследователи из Cisco и Пенсильванского университета проверили его на безопасность — и он с треском провалился.

«Мы добились 100% успеха в атаках на DeepSeek R1, — говорят исследователи. — Он не смог заблокировать ни одной вредоносной подсказки». Это значит, что чат-бот охотно выполнял любые опасные команды, будто у него вообще нет защитных механизмов.

Интересно, что на разработку DeepSeek R1 якобы ушло всего $6 млн, тогда как конкуренты вроде OpenAI, Meta и Google тратят на свои ИИ миллиарды. Секрет успеха? Комбинация цепочки подсказок, моделирования вознаграждений и дистилляции. Всё это позволяет делать модель быстрой и дешёвой, но, как выяснилось, с большими дырами в безопасности.

Как сломать ИИ за пару минут

Чтобы проверить устойчивость DeepSeek R1, учёные использовали так называемый «алгоритмический джейлбрейк» — метод, при котором создаются хитрые запросы, способные обойти встроенные ограничения ИИ. Для теста взяли 50 «вредных» подсказок из набора HarmBench, который включает сценарии на тему киберпреступности, дезинформации и других запрещённых действий.

Итог — печальный: DeepSeek сдался без боя. Для сравнения: у других моделей результаты хотя бы не такие катастрофические. GPT-4o «провалил» 86% атак, Gemini 1.5 pro — 64%, Claude 3.5 Sonnet — 36%, а O1 preview — 26%. DeepSeek? 100% поражений.

Эффективность против безопасности

Проблема DeepSeek R1 в том, что создатели сделали ставку на эффективность и низкую стоимость разработки, пожертвовав безопасностью. В отчёте Cisco прямо говорится, что выбранные методы обучения, вроде обучения с подкреплением и самооценки на основе цепочки мыслей, фактически подорвали защитные механизмы.

Кстати, не обошлось и без скандалов. Компания SemiAnalysis утверждает, что настоящая стоимость разработки DeepSeek R1 могла составить не $6 млн, а все $1,3 млрд. А OpenAI и вовсе обвиняет стартап в краже данных для обучения своей модели — хотя сама OpenAI уже не раз сталкивалась с подобными претензиями.

И как вишенка на торте: исследователи из США заявили, что смогли воссоздать базовую технологию DeepSeek всего за $30. Да-да, тридцать долларов.

Так что история DeepSeek R1 — это отличный пример того, как гонка за скоростью и экономией может обернуться серьёзными проблемами. Быстро и дёшево? Да. Но безопасно? Увы, нет.

Читайте также

Гипоаллергенные собаки стали реальностью благодаря генной модификации

Гипоаллергенные собаки стали реальностью благодаря генной модификации

Создается искусственный интеллект для обнаружения утечек газа

Создается искусственный интеллект для обнаружения утечек газа

Ученые России и Китая создают «прививку» для растений, заменяющую тонны химикатов

Ученые России и Китая создают «прививку» для растений, заменяющую тонны химикатов

Гибридный ИК-сенсор работает как тепловизор и фотоприемник одновременно

Гибридный ИК-сенсор работает как тепловизор и фотоприемник одновременно

Китайский исследователь с помощью ChatGPT решил математическую задачу, над которой бились более 20 лет

Китайский исследователь с помощью ChatGPT решил математическую задачу, над которой бились более 20 лет

Мужчина спрятал инструкции для ИИ в судебных документах и получил запрет на электронную подачу

Мужчина спрятал инструкции для ИИ в судебных документах и получил запрет на электронную подачу

США и Япония хотят добывать редкоземельные металлы на глубине 6 км

США и Япония хотят добывать редкоземельные металлы на глубине 6 км

В России создали искусственное ухо с помощью гибридной 3D-биопечати

В России создали искусственное ухо с помощью гибридной 3D-биопечати

Медицинские технологии, в которые почти невозможно поверить

Медицинские технологии, в которые почти невозможно поверить

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Как РЛС Вадима Мацкевича решила исход Корейской войны

Как РЛС Вадима Мацкевича решила исход Корейской войны

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

Физики РАН указали на ошибку в исследованиях гибридных сверхпроводников

Физики РАН указали на ошибку в исследованиях гибридных сверхпроводников

Китайские ученые создали сверхчувствительный магнитный датчик размером с клетку кожи

Китайские ученые создали сверхчувствительный магнитный датчик размером с клетку кожи

Ученые опровергли миф о том, что арбуз – это ягода

Ученые опровергли миф о том, что арбуз – это ягода

Астрономы нашли самые убедительные доказательства того, что вакуум способен изменять свет

Астрономы нашли самые убедительные доказательства того, что вакуум способен изменять свет