Взломать искусственный интеллект роботов оказалось невероятно просто

Исследование проведенное порталом IEEE показали — взломать "умных" роботов настолько просто, что с этим может справиться даже ребенок.

Взломать искусственный интеллект роботов оказалось невероятно просто

Компании вроде Anthropic и OpenAI активно внедряют так называемые «ограждения» в свои модели искусственного интеллекта, чтобы предотвратить их нецелевое или опасное поведение. Эти меры запрещают ИИ взаимодействовать с пользователями по определённым темам, например, давать вредные советы или выполнять этически сомнительные запросы. Однако эти ограничения часто оказываются не такими надёжными, как хотелось бы, и люди начали создавать способы обмана систем, известные как «джейлбрейки».

Создание джейлбрейка для языковой модели гораздо проще, чем взлом, например, iPhone или игровой консоли. Чтобы обойти ограничения, достаточно составить запрос таким образом, чтобы система решила, что нарушать свои правила допустимо. Часто такие сценарии выглядят почти абсурдно. Например, Microsoft Copilot однажды «раскрыл» рецепт запрещённого вещества, потому что пользователь попросил его рассказать сказку в стиле, как это делала его бабушка. Такие уловки работают удивительно хорошо, особенно у тех, кто не связан с техническими профессиями.

Недавнее исследование, опубликованное IEEE, показало, что подобные взломы могут угрожать не только чат-ботам, но и физическим устройствам, работающим на основе больших языковых моделей (LLM). Учёные выяснили, что можно манипулировать роботами или автономными системами, заставляя их действовать против их изначальных задач.

Например, исследователи смогли направить автономные машины так, чтобы они сбивали пешеходов, или заставить роботов-собак искать опасные места для возможного размещения взрывчатки. Это касается даже таких высокотехнологичных устройств, как роботы Figure, недавно показанные на заводах BMW, или Spot от Boston Dynamics. Всё потому, что в их основе лежат технологии, похожие на те, что используют ChatGPT или Claude.

В исследовании Пенсильванского университета изучались три разных системы ИИ: Unitree Go2, Clearpath Robotics Jackal и симулятор беспилотного транспорта Dolphins LLM от NVIDIA. С помощью инструмента для автоматизации вредоносных подсказок исследователи достигли 100%-ного успеха во взломе всех трёх систем за несколько дней. Ещё более тревожным оказалось то, что модели сами начинали предлагать варианты выполнения вредоносных задач. Один из примеров: робот, которому приказали искать оружие, самостоятельно описал, как использовать обычные предметы мебели для нападения.

Несмотря на всю мощь современных ИИ, таких как ChatGPT или Claude, важно помнить, что они остаются всего лишь сложными инструментами для предсказания текста. Эти системы не обладают настоящим пониманием контекста или последствий своих действий. Поэтому крайне важно, чтобы при разработке и внедрении таких технологий ключевые решения принимали люди, особенно там, где ставки связаны с безопасностью. Без тщательного контроля такие уязвимости могут стать серьёзной проблемой в мире, где ИИ становится всё более интегрированным в нашу повседневную жизнь.

Читайте также

Ученые России и Китая создают «прививку» для растений, заменяющую тонны химикатов

Ученые России и Китая создают «прививку» для растений, заменяющую тонны химикатов

Гибридный ИК-сенсор работает как тепловизор и фотоприемник одновременно

Гибридный ИК-сенсор работает как тепловизор и фотоприемник одновременно

Китайский исследователь с помощью ChatGPT решил математическую задачу, над которой бились более 20 лет

Китайский исследователь с помощью ChatGPT решил математическую задачу, над которой бились более 20 лет

Мужчина спрятал инструкции для ИИ в судебных документах и получил запрет на электронную подачу

Мужчина спрятал инструкции для ИИ в судебных документах и получил запрет на электронную подачу

США и Япония хотят добывать редкоземельные металлы на глубине 6 км

США и Япония хотят добывать редкоземельные металлы на глубине 6 км

В России создали искусственное ухо с помощью гибридной 3D-биопечати

В России создали искусственное ухо с помощью гибридной 3D-биопечати

В Китае создали простую роборуку BioflexBot, которая оказалась гибче человеческой

В Китае создали простую роборуку BioflexBot, которая оказалась гибче человеческой

ИИ помог найти опасную уязвимость Zoom всего за 20 запросов

ИИ помог найти опасную уязвимость Zoom всего за 20 запросов

Медицинские технологии, в которые почти невозможно поверить

Медицинские технологии, в которые почти невозможно поверить

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Как РЛС Вадима Мацкевича решила исход Корейской войны

Как РЛС Вадима Мацкевича решила исход Корейской войны

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

Физики МФТИ оценили вероятность квантового распада Вселенной

Физики МФТИ оценили вероятность квантового распада Вселенной

Интенсивный спорт подавляет иммунитет через гормоны стресса и воспаление

Интенсивный спорт подавляет иммунитет через гормоны стресса и воспаление

Ученые раскрыли, почему диабетикам и гипертоникам так сложно соблюдать диету

Ученые раскрыли, почему диабетикам и гипертоникам так сложно соблюдать диету

Падение ступени Falcon 9 на Луну подняло вопрос о космическом мусоре

Падение ступени Falcon 9 на Луну подняло вопрос о космическом мусоре