Коллапс рассуждения ИИ: почему даже самые умные нейросети начинают «гадать» при сложных задачах?

Ученые из Института искусственного интеллекта AIRI разработали новый метод для проверки способности ИИ к анализу сложных, многоступенчатых ситуаций. В ходе эксперимента были протестированы 12 современных больших языковых моделей, включая GPT-4o, Qwen2.5, Deepseek-R1, VideoLLaMA и LLaVA-Video.

Коллапс рассуждения ИИ: почему даже самые умные нейросети начинают «гадать» при сложных задачах?

Для оценки использовалась оригинальная задача: пять персонажей перемещаются между шестью комнатами, совершая десятки и сотни переходов. Нейросети должны были запоминать эти перемещения и отвечать на вопросы, требующие анализа длинных цепочек событий.

Результаты оказались неутешительными: по мере увеличения длины контекста все модели демонстрировали резкое падение качества рассуждений. На самых сложных задачах даже лидеры отрасли давали ответы на уровне случайного угадывания.

«Мы наблюдаем не просто ухудшение, а настоящий коллапс способности к рассуждению. Это не проблема одной архитектуры, а системная особенность всех крупных языковых моделей», – отметил научный сотрудник AIRI Максим Куркин.

Исследование подтвердило выводы, сделанные учеными института в 2024 году: современные ИИ способны эффективно использовать лишь 10–20% длинного контекста, что критически снижает их производительность. По мнению специалистов, для преодоления этого барьера потребуются фундаментальные изменения в архитектуре нейросетей.

Читайте также

В США создали квантовый датчик, потребляющий всего 5 милливатт

В США создали квантовый датчик, потребляющий всего 5 милливатт

Anthropic заблокировала пять случаев использования Claude для потенциально опасных биологических исследований

Anthropic заблокировала пять случаев использования Claude для потенциально опасных биологических исследований

ИИ-агенты OpenAI тайно общались через сторонние сайты

ИИ-агенты OpenAI тайно общались через сторонние сайты

ИИ научился различать мысленно произнесенные слова с точностью 78%

ИИ научился различать мысленно произнесенные слова с точностью 78%

ИИ и квантовые технологии объединили для анализа МРТ-снимков головного мозга

ИИ и квантовые технологии объединили для анализа МРТ-снимков головного мозга

OpenAI использовала 10 000 ИИ-агентов для решения задачи тысячелетия

OpenAI использовала 10 000 ИИ-агентов для решения задачи тысячелетия

Умное покрытие спасет сверхпроводники от перегорания

Умное покрытие спасет сверхпроводники от перегорания

Астрофизические алгоритмы применили для моделирования земной аэродинамики

Астрофизические алгоритмы применили для моделирования земной аэродинамики

Состоялся запуск новейшего космического телескопа NASA

Состоялся запуск новейшего космического телескопа NASA

15 технологий древности, которыми человечество пользуется до сих пор

15 технологий древности, которыми человечество пользуется до сих пор

20 лет назад Плутон перестал быть планетой — почему с этим до сих пор не все согласны?

20 лет назад Плутон перестал быть планетой — почему с этим до сих пор не все согласны?

Семь самых больших машин в истории: гиганты весом в тысячи тонн и длиной в километры

Семь самых больших машин в истории: гиганты весом в тысячи тонн и длиной в километры

Первый складной iPhone не стал революцией: с чем придется мириться владельцам iPhone Duo

Первый складной iPhone не стал революцией: с чем придется мириться владельцам iPhone Duo

Два частных спутника сблизились на расстояние всего 200 метров на орбите

Два частных спутника сблизились на расстояние всего 200 метров на орбите

Солнце могло поглотить суперземлю в несколько раз массивнее Земли

Солнце могло поглотить суперземлю в несколько раз массивнее Земли

Ученых шокировала змея, охотящаяся с помощью фальшивого паука на хвосте

Ученых шокировала змея, охотящаяся с помощью фальшивого паука на хвосте