Новая аналитическая работа, опубликованная 5 февраля на arXiv, ставит под сомнение способность современных больших языковых моделей (LLM) — основанных на архитектуре трансформеров — достичь человеческого уровня рассуждений. Исследователи утверждают, что у этих систем есть структурные уязвимости, которые приводят к регулярным сбоям в логике при решении сложных задач.
Почему модели ошибаются
LLM учатся прогнозировать следующий токен в тексте, опираясь на огромные массивы данных. Механизм self-attention позволяет моделям отслеживать связи между словами на длинных отрезках текста и даёт им впечатляющую способность генерировать связные ответы. При этом такой способ работы не равен человеческому мышлению: модель не «понимает» задачу, а подбирает вероятные продолжения по шаблонам обучения.
В результате для многошаговых задач, требующих сохранения и последовательной обработки фактов, трансформеры часто «теряют» ключевую информацию. Это проявляется в ошибках при составных математических задачах, проверке многофактовых утверждений и других задачах, где нужно удерживать и комбинировать несколько источников данных. Модель может настаивать на неверном ответе, даже если её указали на ошибку, или давать разные ответы при переформулировке вопроса.
«Когда мы говорим, что эти модели ‘рассуждают’, на деле они просто записывают правдоподобную цепочку мыслей — это по-прежнему прогноз следующего токена, замаскированный под цепочку рассуждений», — говорит Федери́ко Нанни из Института Алана Тьюринга.
Проблемы оценки и ложная уверенность
Авторы анализа отмечают, что текущие бенчмарки не отражают реальную надёжность моделей. Три ключевых недостатка существующих тестов: зависимость результатов от формулировки запроса, «загрязнение» наборов тестов через их частое использование и то, что они оценивают только итоговый ответ, а не процесс рассуждений, который к нему привёл.
Более того, сами бенчмарки часто попадают в тренировочные данные новых моделей: это позволяет системам «выучить» способ прохождения теста, не избавившись от фундаментальной неспособности к надёжному планированию и глубокому мышлению. По словам Нанни, теперь использование моделей в продуктивной среде превращается в новый вид тестирования — разработчики видят, что ломается, лишь когда инструмент попадает к пользователям.
Что дальше: достаточно ли масштабирования?
Исследователи не заявляют, что нейронные сети и LLM бесперспективны для достижения искусственного общего интеллекта (AGI). Однако они предупреждают: простое наращивание размеров моделей и объёмов данных вряд ли решит описанные проблемы. Для преодоления ограничений потребуются архитектурные нововведения — более устойчивые модели мира, интеграция структурированного рассуждения и, возможно, соединение с сенсорными и акторными (embodied) системами.
«Прогресс нейросетей впечатляет, но наше исследование показывает, что масштабирование само по себе не решит все проблемы рассуждений… Достижение человеческого уровня может потребовать новых архитектур и глубокой интеграции с другими подходами», — отмечает Пэйян Сонг из Калтеха.
Вывод прост: трансформеры превосходно моделируют текст — до такой степени, что порой неотличимы от человека. Но это не обязательно путь к цифровому разуму. Чтобы построить надёжные системы, способные к последовательному планированию и отличному от «подбора текста» мышлению, потребуются принципиальные изменения в подходе к созданию ИИ.