
Мы уже писали о мыслящих нейросетях. Если коротко, модель не сразу выдаёт ответ, а сначала разбивает задачу на шаги. Эту последовательность называют Chain of Thought, или CoT. Она похожа на осмысленное рассуждение, но сходство ещё ничего не доказывает.
Авторы работы Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens из Университета Аризоны проверили, насколько устойчивы такие рассуждения. Оказалось, что цепочка часто разваливается, когда задача выходит за пределы знакомых модели примеров.
Что такое распределение данных и его сдвиг
Распределение данных описывает примеры, на которых училась модель. Чем чаще в обучающей выборке встречался определённый тип задачи, тем увереннее модель с ним справляется.
Сдвиг распределения, или distribution shift, возникает, когда реальная задача отличается от обучающих примеров. Может измениться формат, сложность или сам способ решения.
Где CoT даёт сбой
Исследователи создали контролируемую среду DataAlchemy и обучили модели с нуля. Так они могли точно знать, какие данные видела каждая модель, и проверить три типа изменений.
- Новая задача. Если меняются правила, качество CoT падает.
- Другая длина. Модель ошибается чаще, когда цепочка короче или длиннее привычной.
- Другой формат. Иногда достаточно переформулировать подсказку или изменить структуру запроса, чтобы результат ухудшился.
CoT хорошо работает на задачах, похожих на обучающие. При отклонении от знакомого распределения рассуждение становится менее надёжным.
Позиция Янна Лекуна
К похожему выводу пришёл Янн Лекун. В интервью Newsweek он говорил, что большие языковые модели приближаются к пределу нынешнего подхода. Они сильны в знакомых и шаблонных задачах, но хуже справляются с обобщением, планированием и прогнозированием.
Лекун не считает CoT свидетельством понимания. По его мнению, модель подбирает и комбинирует знакомые фрагменты, опираясь на статистические связи. Для настоящего понимания ей нужна модель мира. Такая система должна представлять устройство окружающей среды и прогнозировать последствия действий, а не только продолжать текст.
По прогнозу Лекуна, в течение нескольких лет нынешние LLM могут уступить часть задач системам, которые учатся на тексте, изображениях, сенсорных сигналах и видео. Им также понадобятся чёткие цели и ограничения поведения.
Что это значит на практике
Если вы используете CoT, учитывайте несколько ограничений.
- Цепочка рассуждений не доказывает, что модель понимает задачу.
- На новой задаче объяснение может звучать убедительно, а ответ оказаться неверным.
- Надёжность можно повысить дообучением на похожих примерах или промптами, близкими к знакомым модели форматам и способам решения.
Сам ход рассуждения тоже стоит проверять. Связный текст не заменяет тесты, расчёты и независимую проверку результата.
Не мыслящий, а декомпозирующий ИИ
Критика CoT понятна. Модели не рассуждают как люди и не обладают человеческим пониманием мира. Но в задачах, где прежние модели часто ошибались, результаты всё равно выросли.
На экзамене AIME точность GPT-4o составляла 12%, а OpenAI o1 набрала 74% с первой попытки. В задачах Codeforces GPT-4o находилась на уровне 23-го перцентиля, тогда как DeepSeek R1 и OpenAI o1 достигли 96-го. В тесте GPQA модель o1 также превысила результат экспертов-людей.
Эти цифры не подтверждают человеческий тип мышления. Они показывают, что разбиение сложной задачи на короткие последовательные шаги повышает точность ответа.
Название reasoning-модели неточно. Я бы назвал их моделями для декомпозиции. Они превращают одну запутанную проблему в несколько более простых и решают их по очереди.
Когда reasoning-модель оправдана
У этого подхода есть цена. Модели уровня o1 работают медленнее и стоят дороже. В простых сценариях, таких как классификация текста или ответы на общие вопросы, выигрыш может быть незаметен. По приведённым оценкам, o1 обходится в шесть раз дороже GPT-4o и отвечает в тридцать раз медленнее.
Поэтому модель стоит выбирать под задачу. Простые операции лучше отдавать быстрой и дешёвой модели, а сложные запросы направлять модели, рассчитанной на анализ и декомпозицию. GPT-5 использует маршрутизацию запросов по похожему принципу. Для простого ответа система выбирает быстрый режим, а для сложной задачи подключает более глубокое рассуждение.
В архитектурах mixture of experts действует родственная идея. Разные эксперты обрабатывают те задачи, для которых они обучены. На практике важно не само название подхода, а маршрутизация. Она позволяет не платить за длинное рассуждение там, где достаточно короткого ответа.
Если ИИ-ассистент решает и простые, и сложные задачи, ему нужна продуманная маршрутизация между моделями. Мы помогаем проектировать такие системы, чтобы не тратить дорогие вычисления на простые запросы и не экономить на задачах, где нужен подробный анализ.

