Ареной для битвы ИИ стала игра Super Mario Bros

Можно ли доверить ИИ сложные задачи, если он не справляется даже с ретро-играми? Исследователи из Калифорнийского университета в Сан-Диего решили проверить, как ведущие языковые модели покажут себя в культовой Super Mario Bros. Результаты оказались неожиданными: быстрые реакции оказались важнее мощных вычислений.

Ареной для битвы ИИ стала игра Super Mario Bros

Сравнительный анализ ИИ всегда сопровождается спорами. Компании часто обвиняют в том, что они выбирают тесты, где их модели выглядят лучше конкурентов. Но вместо сухих математических расчетов ученые из лаборатории Hao предложили нечто иное: испытание на платформере. Если искусственный интеллект не способен обойти Гумб и Купа-труп, можно ли доверять ему в реальных задачах?

Эксперимент проводился в эмулированной версии Super Mario Bros., встроенной в платформу GamingAgent — специальный фреймворк, разработанный Hao Lab. ИИ-модели управляли Марио, создавая код на Python. Они получали простые команды вроде «перепрыгни через врага» и анализировали скриншоты игрового процесса, чтобы принимать решения.

Несмотря на то что игра выглядит простой, она требует не только стратегического мышления, но и молниеносной реакции. Лучший результат показал Claude 3.7 от Anthropic — он быстро адаптировался, точно рассчитывал прыжки и избегал врагов. Хорошо выступил и его предшественник, Claude 3.5.

А вот модели, известные своей аналитической мощностью, такие как GPT-4o от OpenAI и Gemini 1.5 Pro от Google, неожиданно провалились. Они долго «думали», обрабатывая каждое решение, что приводило к фатальным задержкам. Исследователи считают, что их чрезмерное внимание к расчетам мешало быстро реагировать на происходящее на экране.

Конечно, проверять ИИ на ретро-играх — это скорее любопытный эксперимент, чем строгий тест. Способность пройти Super Mario Bros. не определяет полезность модели в реальном мире. Однако сам факт, что мощные языковые модели испытывают трудности там, где люди действуют интуитивно, заставляет задуматься.

Тем, кто хочет проверить ИИ в деле, лаборатория Hao AI Lab открыла исходный код GamingAgent на GitHub. Возможно, в будущем такие игровые тесты помогут по-новому взглянуть на развитие искусственного интеллекта.

Читайте также

Цифровая модель показала места опасных нагрузок в авиационных турбинах

Цифровая модель показала места опасных нагрузок в авиационных турбинах

Российские ученые создали ИИ, заменяющий тесты лекарств на животных

Российские ученые создали ИИ, заменяющий тесты лекарств на животных

15 технологий древности, которыми человечество пользуется до сих пор

15 технологий древности, которыми человечество пользуется до сих пор

В России начали серийно производить мобильные электроподстанции

В России начали серийно производить мобильные электроподстанции

В Китае создали датчик, позволяющий роботам «чувствовать» предметы без прикосновения

В Китае создали датчик, позволяющий роботам «чувствовать» предметы без прикосновения

Семь самых больших машин в истории: гиганты весом в тысячи тонн и длиной в километры

Семь самых больших машин в истории: гиганты весом в тысячи тонн и длиной в километры

Гипоаллергенные собаки стали реальностью благодаря генной модификации

Гипоаллергенные собаки стали реальностью благодаря генной модификации

Создается искусственный интеллект для обнаружения утечек газа

Создается искусственный интеллект для обнаружения утечек газа

Медицинские технологии, в которые почти невозможно поверить

Медицинские технологии, в которые почти невозможно поверить

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Квантовый двигатель нарушает законы термодинамики, генерируя работу и холод одновременно

Как РЛС Вадима Мацкевича решила исход Корейской войны

Как РЛС Вадима Мацкевича решила исход Корейской войны

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

ИИ в джунглях: как в Коста-Рике тестируют сообразительность диких обезьян

17 августа отмечается годовщина запуска миссии «Венера-7»

17 августа отмечается годовщина запуска миссии «Венера-7»

Тест на 10 000 часов показал, что современные OLED-телевизоры все еще подвержены выгоранию

Тест на 10 000 часов показал, что современные OLED-телевизоры все еще подвержены выгоранию

NASA предложили отправить миниатюрных аэроботов в пещеры Титана

NASA предложили отправить миниатюрных аэроботов в пещеры Титана

Физики РАН указали на ошибку в исследованиях гибридных сверхпроводников

Физики РАН указали на ошибку в исследованиях гибридных сверхпроводников