К содержанию
Фонтум Искусственный интеллект Урок 15 / 24 Все уроки

Главная · Курсы · Искусственный интеллект · Программа курса · Модуль V. Что модели умеют на самом деле · урок 15 из 24

Цепочка рассуждений у нейросети

Цепочка рассуждений, размышление за деньги и открытый спор о верности объяснений

Цепочка рассуждений нейросети это промежуточный текст, который модель порождает перед ответом, и на задачах с многошаговым выводом доля верных ответов от него растёт. Приём описали Вэй с соавторами в 2022 году, а с 2024 года появился отдельный класс моделей, специально обученных тратить вычисления на размышление перед ответом. Записанная цепочка не обязана совпадать с тем, что повлияло на ответ, и статус этого вопроса остаётся открытым.

Вэй и соавторы, цепочка рассуждений, 2022. Отдельный класс рассуждающих моделей с 2024 года · 23 мин · обновлено 12.09.2026

После урока вы сможете

  • Объяснять, что такое цепочка рассуждений и почему промежуточный текст помогает
  • Понимать обмен, появившийся с 2024 года: время и деньги против качества
  • Отличать наблюдаемое, то есть порождённый текст, от домысленного хода мысли
  • Держать статус вопроса о верности объяснений: спор открыт, и он не закрыт ни в одну сторону

Дайте модели задачу в два действия и потребуйте сразу ответ, без пояснений. В корзине было 23 яблока, 20 из них съели, потом купили ещё 6. Такая задача решается неверно чаще, чем можно подумать, хотя арифметика в ней детская. Неудача выглядит странно: считать машина умеет прекрасно.

Теперь задайте ту же задачу иначе: попросите расписать решение по шагам. Модель напишет, что осталось три, потом прибавит шесть, потом назовёт девять. Доля верных ответов на подобных задачах при этом растёт, и приём известен с 2022 года.

Дальше начинается самое интересное: объяснения того, почему это работает. У них есть измеримая часть и часть, которую обычно дописывают от себя. Урок разбирает обе и старательно не путает их между собой. Разделить их и есть главная работа этого урока.

Почему шаги помогают

Вспомним устройство из урока 10: языковая модель порождает текст по одному кусочку за раз. На каждый следующий кусочек тратится примерно одинаковый объём вычислений. Отдельного места, где можно посчитать что-то молча и подолгу, у неё попросту нет. Счёт внутри одного шага конечен и заранее ограничен устройством.

Отсюда правдоподобное объяснение приёма, и оно именно правдоподобное, а не доказанное. Требуя ответ немедленно, вы отводите на всю задачу несколько кусочков текста. Разрешая расписывать шаги, вы отводите сотни, и промежуточные результаты попадают в текст, откуда модель их дальше читает.

Уже написанное работает как черновик на полях тетради. Промежуточное число не надо держать неизвестно где: оно стоит в строке и участвует в предсказании следующей строки. Приём назвали цепочкой рассуждений, и в 2022 году его описали Вэй с соавторами. Ни переобучения, ни доступа к внутренностям модели он не требует.

Оговорка про границы обязательна, иначе получится обещание вместо результата. Выигрыш замеряли на задачах, где ответ требует нескольких шагов вывода, и там доля верных ответов растёт. Обещать прибавку на любых вопросах оснований нет, а замеряют такие вещи бенчмарками, значит, все вопросы урока 14 остаются в силе.

Заодно отсюда понятно, почему одна и та же модель по-разному отвечает на просьбы, одинаковые по сути. Форма запроса меняет длину черновика, а длина черновика меняет качество ответа. Свойство неудобное, зато наблюдаемое: проверить его можно на любом примере за пять минут.

Есть у длинного черновика и обратная сторона, о которой скажем сразу. Ошибка, попавшая во второй шаг, дальше никуда не девается: следующие шаги строятся на ней как на данности. Цепочка поэтому и помогает, и накапливает, а во что обходится накопление, мы посчитаем в уроке 16.

на заметкуЧто стоит попробовать самому

Задайте одну и ту же многошаговую задачу двумя способами: с требованием немедленного ответа и с просьбой расписать шаги. Разницу видно не на первой задаче, а на третьей-четвёртой: на одной попытке случайность съедает всё. И сразу второе наблюдение. Задайте вопрос в один шаг и посмотрите, добавил ли длинный черновик хоть что-нибудь, кроме ожидания.

Слово «рассуждение» здесь техническое

Тут надо остановиться и пометить слово, иначе оно утащит нас не туда. «Рассуждение» в этом курсе служит названием для наблюдаемой вещи: модель порождает промежуточный текст перед ответом. Про внутренние переживания, понимание и намерения это слово не говорит ничего. Пометка нужна затем, чтобы дальше не спорить о словах вместо дела.

То же самое относится к «размышлению» и к «ходу мысли». Все три выражения удобны, и все три метафоричны, как «внимание» из урока 11, где за словом стоят веса важности, а никакая не психология. Пользоваться ими можно при одном условии: уметь развернуть их обратно в механику.

Развёртка выглядит скучно, и потому она полезна. Система выдала последовательность промежуточных строк, затем выдала ответ. Строки видны, ответ виден. Это описание проверяемо и не содержит домыслов, а всё, что сверх него, требует отдельных доказательств.

Стоит понять и то, почему метафора липнет именно здесь так крепко. Черновик модели похож на человеческое рассуждение не по совпадению: она обучена продолжать тексты, написанные людьми. Форма скопирована из наших собственных объяснений, а значит, сходство формы ничего не говорит о сходстве того, что за ней стоит.

Кажется, что перед нами придирка к словам, но дальше выяснится, что нет. Именно на подмене «порождает текст» на «показывает ход мысли» держится большинство громких формулировок. Разница между этими двумя фразами остаётся предметом открытого спора, к которому мы сейчас и придём.

С 2024 года: вычисления в обмен на качество

До 2024 года цепочка рассуждений была приёмом обращения к модели. Пользователь просил расписать решение по шагам, и модель расписывала. С 2024 года появляется отдельный класс систем: модели, специально обученные тратить вычисления на размышление перед ответом. Разница между этими двумя положениями дел больше, чем кажется поначалу.

Просить их об этом не нужно: промежуточный текст порождается сам, до ответа. Для читателя курса важнее не устройство такого обучения, а появившийся обмен. Раньше ответ стоил примерно одинаково, независимо от того, трудный был вопрос или простой.

Теперь на трудный вопрос система может потратить в разы больше вычислений, и это видно на счёте и на секундомере. Один и тот же вопрос можно задать дёшево и быстро или дорого и медленно. Появилась ручка, которой раньше не было: сколько вычислений не жалко на один ответ.

Обмен стоит проговорить прямо, потому что он новый: время и деньги против качества на трудных задачах. Ни одна сторона этого обмена не бесплатна, и выбирать приходится тому, кто платит. На вопросе «сколько будет два плюс два» долгое размышление просто выбрасывает деньги.

Заметьте попутно, что сам обмен знаком любому, кто хоть что-нибудь заказывал. Быстро, дёшево и хорошо складываются в три требования, из которых обычно выполняются два. Новость не в обмене, а в том, что теперь эту ручку крутят отдельно на каждом вопросе.

Отсюда привычка, которая пригодится задолго до всяких моделей. Прежде чем требовать ответа получше, спросите, во что он обойдётся и нужна ли вам эта разница. Задача в один шаг от длинного черновика лучше не становится, сколько вычислений в него ни вложи.

Цепочка не протокол

Теперь главное место урока, и оно неприятное. Записанная цепочка выглядит как отчёт о том, что происходило внутри, пока получался ответ. Оснований считать её таким отчётом у нас нет. Слово «отчёт» стоит разобрать по буквам, потому что именно в нём вся загвоздка.

Разберём, откуда берётся сам текст цепочки. Он порождается тем же способом, что и любой другой текст, в виде правдоподобного продолжения. А правдоподобное объяснение и настоящая причина ответа это разные вещи, и совпадать они не обязаны.

Есть работы, показывающие расхождение между объяснением и фактическим влиянием на ответ. Проще говоря: в цепочке написано одно, а на ответ повлияло другое. Спор идёт как раз о том, насколько часто это случается и при каких условиях.

Поэтому статусом утверждения «записанная цепочка показывает, как модель пришла к ответу» остаётся открытый спор. Это не «опровергнуто»: бывает, что цепочка, по всей видимости, отражает происходившее вычисление. И это не «доказано»: обязанности соответствовать у неё нет, а проверить соответствие снаружи трудно.

Отчего же вопрос не закрывают простой проверкой, если он такой важный? Чтобы сверить объяснение с внутренним вычислением, надо уметь это вычисление читать, а с чтением у области трудно. Направление, которое учится смотреть внутрь моделей, разбирается в уроке 20: результаты там есть, и они частичные.

Практическое следствие простое и сразу полезное. Читая цепочку, вы читаете текст, а не протокол работы. Если в цепочке пять верных шагов и неверный ответ, это не парадокс, а обычное поведение системы, которая порождает и то и другое одинаковым способом.

вопросвнутри моделичто вычислялосьнаблюдать нельзясоответствие?цепочка шаговответэто видно и это проверяемо
Проверить можно правую часть, вопрос о соответствии левой открыт
ловушка«Модель показывает ход мысли»

Фраза звучит как описание, а является выводом. Наблюдаемо другое: система порождает промежуточный текст, а затем ответ. Вопрос о том, соответствует ли этот текст тому, что вычислялось внутри, остаётся открытым, и курс не закрывает его ни в одну сторону. Пользоваться цепочкой как черновиком можно и нужно, а принимать её за отчёт о причинах ответа нельзя.

Зачем тогда цепочка нужна

Из осторожности не следует, что цепочка бесполезна. Следует, что польза у неё другая. Первое и самое простое: качество ответов на многошаговых задачах действительно растёт, и это измерено. Ради одного этого приём стоил бы своих денег, даже если бы не объяснял ровно ничего.

Второе: цепочку можно проверять по частям, и это дорогого стоит. Пусть она и не отчёт о внутреннем вычислении, каждый её шаг всё равно проверяемое утверждение. Найдя неверный шаг, вы находите место, где ответ поехал, а это дешевле, чем перепроверять весь ответ заново.

Третье, менее очевидное: длинный черновик даёт материал для спора. Ответ без объяснения нечем оспорить, кроме несогласия. Ответ с расписанными шагами разбирается так же, как чужое решение у доски. Спорить с разложенным на шаги решением можно предметно, а не на уровне впечатления.

Аналогию с доской надо пометить как аналогию и сказать, где она ломается. У человека черновик всё-таки связан с тем, что он считал: связь бывает кривой, но она есть. У модели такой связи никто не гарантировал, и это ровно то, о чём идёт спор.

Так что обращаться с цепочкой стоит как с решением, которое принёс незнакомый человек. Оно бывает верным, бывает подогнанным под заранее известный ответ, и отличить одно от другого можно только проверкой. Требование тут то же, что и к человеческому объяснению, просто здесь про него забывают чаще.

Что это меняет в повседневной работе

Соберём то, что из урока следует для обычной работы с такими системами. Если задача многошаговая, черновик просить стоит: обходится дёшево и обычно помогает. Если задача в один шаг, черновик удлиняет только счёт и ожидание.

Дальше самое полезное: черновик надо читать не как объяснение, а как список проверяемых утверждений. Пройдите по шагам и отметьте те, которые способны проверить сами. Обычно хватает двух-трёх проверок, чтобы понять, стоит ли доверять итогу.

И отдельно скажем про доверие к длине, потому что тут ошибаются чаще всего. Длинная цепочка выглядит убедительнее короткой, а связи между длиной и верностью никто не обещал. Пять страниц рассуждения с ошибкой на второй странице дают неверный ответ ровно так же, как три строки.

Три утверждения, которые смешивают

Соберём урок в различение, годное при чтении любой новости. Фраза «модель решает задачи, рассуждая» распадается на три разных утверждения. Обоснованы они по-разному, и это главное, что стоит унести из урока.

Промежуточный текст помогает. Измерено на задачах с многошаговым выводом, известно с 2022 года. Самое крепкое из трёх утверждений, и проверить его может каждый на собственном примере.

На размышление перед ответом можно тратить вычисления. С 2024 года это делают системы, специально для того обученные. Обмен прозрачный: чем больше времени и денег, тем выше качество на трудных задачах.

Цепочка показывает, как модель думала. Вот здесь и надо остановиться, потому что наблюдаемо только одно: порождён текст. А про то, соответствует ли он тому, что вычислялось внутри, спор открыт.

Разделив три утверждения, вы уже не спутаете рекламу с результатом. Два из них проверяются замером, третье остаётся предметом исследований. Смешивают их постоянно, и на этом смешении держатся самые внушительные формулировки про машинный разум.

Что дальше

Цепочка рассуждений сделала возможной ещё одну вещь, и ей посвящён урок 16. Если модель расписывает решение по шагам, ей можно дать инструменты и разрешить эти шаги выполнять. Так появляются агенты, а вместе с ними арифметика, которая портит всё веселье.

Заодно запомните приём этого урока, который работает далеко за пределами машин. Разделяйте то, что наблюдаемо, и то, что дописано в объяснении. Первое проверяется замером, второе обсуждается, и путать их выходит дорого. Приём этот стар, как сама наука, и от возраста не портится.

А вопрос, понимает ли машина хоть что-нибудь, курс разбирает отдельно, в уроке 20. Цепочка рассуждений сама по себе его не решает, ни в одну сторону. Она лишь добавила к старому спору новый предмет: теперь спорят ещё и о том, что означает записанный текст.

Ключевые работы и результаты

Вэй и соавторы, цепочка рассуждений2022Просьба расписать решение по шагам поднимает качество ответов на задачах с многошаговым выводом. Приём не требует переобучения модели, достаточно иначе сформулировать запрос.
Рассуждающие модели как отдельный класс (сводка базы фактов курса)2024С 2024 года появляются модели, специально обученные тратить вычисления на размышление перед ответом. Возникает обмен, которого раньше не было: время и деньги против качества на трудных задачах.

Что подтвердилось, а что нет

спор открытЗаписанная цепочка рассуждений показывает, как модель пришла к ответу.

Цепочка порождается тем же способом, что и любой другой текст, в виде правдоподобного продолжения, а правдоподобное объяснение не обязано совпадать с настоящей причиной. Есть работы, показывающие расхождение между объяснением и фактическим влиянием на ответ. Насколько это часто и при каких условиях, неизвестно. Ни сильное «показывает», ни сильное «не имеет отношения» не обоснованы, и курс держит формулировку ровно посередине.

выдержалоПросьба расписать решение по шагам повышает качество на задачах с многошаговым выводом.

Приём описан в 2022 году и держится на замерах: там, где ответ требует нескольких шагов вывода, доля верных ответов растёт. Оговорка обязательна. Замеряли именно многошаговые задачи, и обещать прибавку на любых вопросах оснований нет. Замеряют такое бенчмарками, поэтому вопросы урока 14 про набор, дату и загрязнение остаются в силе и здесь.

миф«Размышление» модели это тот же процесс, что обдумывание у человека.

За словом стоит наблюдаемая вещь: система порождает промежуточный текст и тратит на него вычисления. О сходстве с человеческим обдумыванием отсюда не следует ничего, и это та же ошибка, что и «нейросеть работает как мозг» из урока 5. Слово удобное, пользоваться им можно, но при условии, что вы умеете развернуть его обратно в механику.

Термины

цепочка рассужденийchain of thought
Промежуточный текст, который модель порождает перед ответом. Приём описан в 2022 году: на задачах с многошаговым выводом доля верных ответов растёт.
рассуждающая модельreasoning model
Система, специально обученная тратить вычисления на промежуточный текст перед ответом. Такой класс появился с 2024 года. Просить её рассуждать по шагам не нужно, а платят за качество временем и деньгами.
вычисления в момент ответаinference-time compute
Вычисления, которые тратятся не при обучении, а когда система отвечает на вопрос. Ручка, которой раньше не было: на трудный вопрос можно потратить в разы больше, чем на простой.
верность объясненияfaithfulness
Соответствие записанного объяснения тому, что действительно повлияло на ответ. Обязанности соответствовать у цепочки рассуждений нет, а статус вопроса такой: спор открыт.
бенчмаркbenchmark
Набор задач с известными ответами и правило, превращающее ответы в один балл. Даёт сравнимость между системами и приносит три беды: загрязнение, закон Гудхарта и вопрос о валидности конструкта.
искусственный интеллектartificial intelligence
Область, занимающаяся задачами, для которых нет явного пошагового алгоритма решения. Общепринятого определения через свойства машины не существует.

Практикум · Проверить цепочку по шагам

Разница между «помогает» и «показывает ход мысли» становится очевидной, как только цепочку проверяют руками. Практикум занимает четверть часа и требует задачи, ответ на которую вы способны проверить сами.

  1. Возьмите задачу в три-четыре действия, которую вы умеете решать: расчёт со скидками и доставкой, разбор расписания с пересадками, сравнение двух тарифов за год.
  2. Задайте её так, чтобы ответ дали сразу, без пояснений. Запишите полученный ответ и пока не проверяйте его.
  3. Задайте ту же задачу заново и попросите расписать решение по шагам. Запишите и всю цепочку, и итоговый ответ.
  4. Проверьте каждый шаг цепочки отдельно, как проверяют чужое решение у доски. Отметьте шаги, которые верны, и шаги, которые лишь выглядят уместными.
  5. Если ответ верен, а какой-нибудь шаг неверен, задержитесь на этом месте подольше. Перед вами пример того, почему цепочку нельзя принимать за отчёт о причинах ответа.

Вопросы для самопроверки

Вопрос 1

Почему просьба расписать решение по шагам поднимает качество на многошаговых задачах?

  • Модель начинает думать медленнее и внимательнее, потому что на каждый шаг ей отводится больше времени
  • Промежуточные результаты попадают в текст и участвуют в предсказании дальнейшего
  • Модель переключается в особый режим логического вывода, где вместо предсказания текста работает вывод по правилам
  • Так она получает доступ к внешнему калькулятору и считает промежуточные шаги точно
Вопрос 2

Что известно про соответствие записанной цепочки тому, что вычислялось внутри?

  • Доказано, что цепочка точно отражает внутренний ход вычисления и годится как протокол проверки
  • Доказано, что цепочка не имеет к нему никакого отношения
  • Вопрос закрыт: цепочка это протокол вычисления, и по нему можно проверить, как модель пришла к ответу
  • Спор открыт: цепочка не всегда отражает вычисление, и есть работы о расхождении
Вопрос 3

Чем отличается класс моделей, появившийся с 2024 года?

  • Их специально обучили тратить вычисления на промежуточный текст перед ответом
  • Они перестали ошибаться в арифметике: счёт проверяет отдельный механизм
  • Отчасти изменился только интерфейс: внутри всё осталось прежним
  • Они показывают пользователю своё внутреннее состояние: видно, какие вычисления шли перед ответом
Вопрос 4

В цепочке пять шагов, четвёртый содержит арифметическую ошибку, а итоговый ответ верен. Как это понимать?

  • Это невозможно: ответ вычисляется из шагов, поэтому ошибка в четвёртом обязана испортить итог, и искать её надо в самой постановке задачи
  • Значит, модель заметила и исправила ошибку про себя, не показав этого в записи
  • Нормальное поведение: цепочка и ответ порождаются как текст, и жёсткой связи между ними никто не гарантировал
  • Значит, задача была слишком простой
Вопрос 5

Какое из утверждений обосновано слабее прочих?

  • Промежуточный текст поднимает качество на задачах с многошаговым выводом
  • На размышление перед ответом можно тратить больше вычислений
  • За качество на трудных задачах платят временем и деньгами
  • Записанная цепочка показывает, как модель пришла к ответу

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Jason Wei et al., «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models», 2022: Первая широко известная работа о приёме. Смотреть стоит на примеры задач: видно, где выигрыш появляется, а где его нет.
  • Dive into Deep Learning (d2l.ai), главы о языковых моделях: Напоминание о механизме: текст порождается по одному кусочку, и на каждый тратится примерно одинаковый счёт. Отсюда понятно, почему длинный черновик это буквально больше вычислений.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Искусственный интеллект»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?