Цепочка рассуждений у нейросети
Цепочка рассуждений, размышление за деньги и открытый спор о верности объяснений
Цепочка рассуждений нейросети это промежуточный текст, который модель порождает перед ответом, и на задачах с многошаговым выводом доля верных ответов от него растёт. Приём описали Вэй с соавторами в 2022 году, а с 2024 года появился отдельный класс моделей, специально обученных тратить вычисления на размышление перед ответом. Записанная цепочка не обязана совпадать с тем, что повлияло на ответ, и статус этого вопроса остаётся открытым.
Вэй и соавторы, цепочка рассуждений, 2022. Отдельный класс рассуждающих моделей с 2024 года · 23 мин · обновлено 12.09.2026
После урока вы сможете
- Объяснять, что такое цепочка рассуждений и почему промежуточный текст помогает
- Понимать обмен, появившийся с 2024 года: время и деньги против качества
- Отличать наблюдаемое, то есть порождённый текст, от домысленного хода мысли
- Держать статус вопроса о верности объяснений: спор открыт, и он не закрыт ни в одну сторону
Дайте модели задачу в два действия и потребуйте сразу ответ, без пояснений. В корзине было 23 яблока, 20 из них съели, потом купили ещё 6. Такая задача решается неверно чаще, чем можно подумать, хотя арифметика в ней детская. Неудача выглядит странно: считать машина умеет прекрасно.
Теперь задайте ту же задачу иначе: попросите расписать решение по шагам. Модель напишет, что осталось три, потом прибавит шесть, потом назовёт девять. Доля верных ответов на подобных задачах при этом растёт, и приём известен с 2022 года.
Дальше начинается самое интересное: объяснения того, почему это работает. У них есть измеримая часть и часть, которую обычно дописывают от себя. Урок разбирает обе и старательно не путает их между собой. Разделить их и есть главная работа этого урока.
Почему шаги помогают
Вспомним устройство из урока 10: языковая модель порождает текст по одному кусочку за раз. На каждый следующий кусочек тратится примерно одинаковый объём вычислений. Отдельного места, где можно посчитать что-то молча и подолгу, у неё попросту нет. Счёт внутри одного шага конечен и заранее ограничен устройством.
Отсюда правдоподобное объяснение приёма, и оно именно правдоподобное, а не доказанное. Требуя ответ немедленно, вы отводите на всю задачу несколько кусочков текста. Разрешая расписывать шаги, вы отводите сотни, и промежуточные результаты попадают в текст, откуда модель их дальше читает.
Уже написанное работает как черновик на полях тетради. Промежуточное число не надо держать неизвестно где: оно стоит в строке и участвует в предсказании следующей строки. Приём назвали цепочкой рассуждений, и в 2022 году его описали Вэй с соавторами. Ни переобучения, ни доступа к внутренностям модели он не требует.
Оговорка про границы обязательна, иначе получится обещание вместо результата. Выигрыш замеряли на задачах, где ответ требует нескольких шагов вывода, и там доля верных ответов растёт. Обещать прибавку на любых вопросах оснований нет, а замеряют такие вещи бенчмарками, значит, все вопросы урока 14 остаются в силе.
Заодно отсюда понятно, почему одна и та же модель по-разному отвечает на просьбы, одинаковые по сути. Форма запроса меняет длину черновика, а длина черновика меняет качество ответа. Свойство неудобное, зато наблюдаемое: проверить его можно на любом примере за пять минут.
Есть у длинного черновика и обратная сторона, о которой скажем сразу. Ошибка, попавшая во второй шаг, дальше никуда не девается: следующие шаги строятся на ней как на данности. Цепочка поэтому и помогает, и накапливает, а во что обходится накопление, мы посчитаем в уроке 16.
Задайте одну и ту же многошаговую задачу двумя способами: с требованием немедленного ответа и с просьбой расписать шаги. Разницу видно не на первой задаче, а на третьей-четвёртой: на одной попытке случайность съедает всё. И сразу второе наблюдение. Задайте вопрос в один шаг и посмотрите, добавил ли длинный черновик хоть что-нибудь, кроме ожидания.
Слово «рассуждение» здесь техническое
Тут надо остановиться и пометить слово, иначе оно утащит нас не туда. «Рассуждение» в этом курсе служит названием для наблюдаемой вещи: модель порождает промежуточный текст перед ответом. Про внутренние переживания, понимание и намерения это слово не говорит ничего. Пометка нужна затем, чтобы дальше не спорить о словах вместо дела.
То же самое относится к «размышлению» и к «ходу мысли». Все три выражения удобны, и все три метафоричны, как «внимание» из урока 11, где за словом стоят веса важности, а никакая не психология. Пользоваться ими можно при одном условии: уметь развернуть их обратно в механику.
Развёртка выглядит скучно, и потому она полезна. Система выдала последовательность промежуточных строк, затем выдала ответ. Строки видны, ответ виден. Это описание проверяемо и не содержит домыслов, а всё, что сверх него, требует отдельных доказательств.
Стоит понять и то, почему метафора липнет именно здесь так крепко. Черновик модели похож на человеческое рассуждение не по совпадению: она обучена продолжать тексты, написанные людьми. Форма скопирована из наших собственных объяснений, а значит, сходство формы ничего не говорит о сходстве того, что за ней стоит.
Кажется, что перед нами придирка к словам, но дальше выяснится, что нет. Именно на подмене «порождает текст» на «показывает ход мысли» держится большинство громких формулировок. Разница между этими двумя фразами остаётся предметом открытого спора, к которому мы сейчас и придём.
С 2024 года: вычисления в обмен на качество
До 2024 года цепочка рассуждений была приёмом обращения к модели. Пользователь просил расписать решение по шагам, и модель расписывала. С 2024 года появляется отдельный класс систем: модели, специально обученные тратить вычисления на размышление перед ответом. Разница между этими двумя положениями дел больше, чем кажется поначалу.
Просить их об этом не нужно: промежуточный текст порождается сам, до ответа. Для читателя курса важнее не устройство такого обучения, а появившийся обмен. Раньше ответ стоил примерно одинаково, независимо от того, трудный был вопрос или простой.
Теперь на трудный вопрос система может потратить в разы больше вычислений, и это видно на счёте и на секундомере. Один и тот же вопрос можно задать дёшево и быстро или дорого и медленно. Появилась ручка, которой раньше не было: сколько вычислений не жалко на один ответ.
Обмен стоит проговорить прямо, потому что он новый: время и деньги против качества на трудных задачах. Ни одна сторона этого обмена не бесплатна, и выбирать приходится тому, кто платит. На вопросе «сколько будет два плюс два» долгое размышление просто выбрасывает деньги.
Заметьте попутно, что сам обмен знаком любому, кто хоть что-нибудь заказывал. Быстро, дёшево и хорошо складываются в три требования, из которых обычно выполняются два. Новость не в обмене, а в том, что теперь эту ручку крутят отдельно на каждом вопросе.
Отсюда привычка, которая пригодится задолго до всяких моделей. Прежде чем требовать ответа получше, спросите, во что он обойдётся и нужна ли вам эта разница. Задача в один шаг от длинного черновика лучше не становится, сколько вычислений в него ни вложи.
Цепочка не протокол
Теперь главное место урока, и оно неприятное. Записанная цепочка выглядит как отчёт о том, что происходило внутри, пока получался ответ. Оснований считать её таким отчётом у нас нет. Слово «отчёт» стоит разобрать по буквам, потому что именно в нём вся загвоздка.
Разберём, откуда берётся сам текст цепочки. Он порождается тем же способом, что и любой другой текст, в виде правдоподобного продолжения. А правдоподобное объяснение и настоящая причина ответа это разные вещи, и совпадать они не обязаны.
Есть работы, показывающие расхождение между объяснением и фактическим влиянием на ответ. Проще говоря: в цепочке написано одно, а на ответ повлияло другое. Спор идёт как раз о том, насколько часто это случается и при каких условиях.
Поэтому статусом утверждения «записанная цепочка показывает, как модель пришла к ответу» остаётся открытый спор. Это не «опровергнуто»: бывает, что цепочка, по всей видимости, отражает происходившее вычисление. И это не «доказано»: обязанности соответствовать у неё нет, а проверить соответствие снаружи трудно.
Отчего же вопрос не закрывают простой проверкой, если он такой важный? Чтобы сверить объяснение с внутренним вычислением, надо уметь это вычисление читать, а с чтением у области трудно. Направление, которое учится смотреть внутрь моделей, разбирается в уроке 20: результаты там есть, и они частичные.
Практическое следствие простое и сразу полезное. Читая цепочку, вы читаете текст, а не протокол работы. Если в цепочке пять верных шагов и неверный ответ, это не парадокс, а обычное поведение системы, которая порождает и то и другое одинаковым способом.
Фраза звучит как описание, а является выводом. Наблюдаемо другое: система порождает промежуточный текст, а затем ответ. Вопрос о том, соответствует ли этот текст тому, что вычислялось внутри, остаётся открытым, и курс не закрывает его ни в одну сторону. Пользоваться цепочкой как черновиком можно и нужно, а принимать её за отчёт о причинах ответа нельзя.
Зачем тогда цепочка нужна
Из осторожности не следует, что цепочка бесполезна. Следует, что польза у неё другая. Первое и самое простое: качество ответов на многошаговых задачах действительно растёт, и это измерено. Ради одного этого приём стоил бы своих денег, даже если бы не объяснял ровно ничего.
Второе: цепочку можно проверять по частям, и это дорогого стоит. Пусть она и не отчёт о внутреннем вычислении, каждый её шаг всё равно проверяемое утверждение. Найдя неверный шаг, вы находите место, где ответ поехал, а это дешевле, чем перепроверять весь ответ заново.
Третье, менее очевидное: длинный черновик даёт материал для спора. Ответ без объяснения нечем оспорить, кроме несогласия. Ответ с расписанными шагами разбирается так же, как чужое решение у доски. Спорить с разложенным на шаги решением можно предметно, а не на уровне впечатления.
Аналогию с доской надо пометить как аналогию и сказать, где она ломается. У человека черновик всё-таки связан с тем, что он считал: связь бывает кривой, но она есть. У модели такой связи никто не гарантировал, и это ровно то, о чём идёт спор.
Так что обращаться с цепочкой стоит как с решением, которое принёс незнакомый человек. Оно бывает верным, бывает подогнанным под заранее известный ответ, и отличить одно от другого можно только проверкой. Требование тут то же, что и к человеческому объяснению, просто здесь про него забывают чаще.
Что это меняет в повседневной работе
Соберём то, что из урока следует для обычной работы с такими системами. Если задача многошаговая, черновик просить стоит: обходится дёшево и обычно помогает. Если задача в один шаг, черновик удлиняет только счёт и ожидание.
Дальше самое полезное: черновик надо читать не как объяснение, а как список проверяемых утверждений. Пройдите по шагам и отметьте те, которые способны проверить сами. Обычно хватает двух-трёх проверок, чтобы понять, стоит ли доверять итогу.
И отдельно скажем про доверие к длине, потому что тут ошибаются чаще всего. Длинная цепочка выглядит убедительнее короткой, а связи между длиной и верностью никто не обещал. Пять страниц рассуждения с ошибкой на второй странице дают неверный ответ ровно так же, как три строки.
Три утверждения, которые смешивают
Соберём урок в различение, годное при чтении любой новости. Фраза «модель решает задачи, рассуждая» распадается на три разных утверждения. Обоснованы они по-разному, и это главное, что стоит унести из урока.
Промежуточный текст помогает. Измерено на задачах с многошаговым выводом, известно с 2022 года. Самое крепкое из трёх утверждений, и проверить его может каждый на собственном примере.
На размышление перед ответом можно тратить вычисления. С 2024 года это делают системы, специально для того обученные. Обмен прозрачный: чем больше времени и денег, тем выше качество на трудных задачах.
Цепочка показывает, как модель думала. Вот здесь и надо остановиться, потому что наблюдаемо только одно: порождён текст. А про то, соответствует ли он тому, что вычислялось внутри, спор открыт.
Разделив три утверждения, вы уже не спутаете рекламу с результатом. Два из них проверяются замером, третье остаётся предметом исследований. Смешивают их постоянно, и на этом смешении держатся самые внушительные формулировки про машинный разум.
Что дальше
Цепочка рассуждений сделала возможной ещё одну вещь, и ей посвящён урок 16. Если модель расписывает решение по шагам, ей можно дать инструменты и разрешить эти шаги выполнять. Так появляются агенты, а вместе с ними арифметика, которая портит всё веселье.
Заодно запомните приём этого урока, который работает далеко за пределами машин. Разделяйте то, что наблюдаемо, и то, что дописано в объяснении. Первое проверяется замером, второе обсуждается, и путать их выходит дорого. Приём этот стар, как сама наука, и от возраста не портится.
А вопрос, понимает ли машина хоть что-нибудь, курс разбирает отдельно, в уроке 20. Цепочка рассуждений сама по себе его не решает, ни в одну сторону. Она лишь добавила к старому спору новый предмет: теперь спорят ещё и о том, что означает записанный текст.
Ключевые работы и результаты
| Вэй и соавторы, цепочка рассуждений | 2022 | Просьба расписать решение по шагам поднимает качество ответов на задачах с многошаговым выводом. Приём не требует переобучения модели, достаточно иначе сформулировать запрос. |
| Рассуждающие модели как отдельный класс (сводка базы фактов курса) | 2024 | С 2024 года появляются модели, специально обученные тратить вычисления на размышление перед ответом. Возникает обмен, которого раньше не было: время и деньги против качества на трудных задачах. |
Что подтвердилось, а что нет
Цепочка порождается тем же способом, что и любой другой текст, в виде правдоподобного продолжения, а правдоподобное объяснение не обязано совпадать с настоящей причиной. Есть работы, показывающие расхождение между объяснением и фактическим влиянием на ответ. Насколько это часто и при каких условиях, неизвестно. Ни сильное «показывает», ни сильное «не имеет отношения» не обоснованы, и курс держит формулировку ровно посередине.
Приём описан в 2022 году и держится на замерах: там, где ответ требует нескольких шагов вывода, доля верных ответов растёт. Оговорка обязательна. Замеряли именно многошаговые задачи, и обещать прибавку на любых вопросах оснований нет. Замеряют такое бенчмарками, поэтому вопросы урока 14 про набор, дату и загрязнение остаются в силе и здесь.
За словом стоит наблюдаемая вещь: система порождает промежуточный текст и тратит на него вычисления. О сходстве с человеческим обдумыванием отсюда не следует ничего, и это та же ошибка, что и «нейросеть работает как мозг» из урока 5. Слово удобное, пользоваться им можно, но при условии, что вы умеете развернуть его обратно в механику.
Термины
- цепочка рассужденийchain of thought
- Промежуточный текст, который модель порождает перед ответом. Приём описан в 2022 году: на задачах с многошаговым выводом доля верных ответов растёт.
- рассуждающая модельreasoning model
- Система, специально обученная тратить вычисления на промежуточный текст перед ответом. Такой класс появился с 2024 года. Просить её рассуждать по шагам не нужно, а платят за качество временем и деньгами.
- вычисления в момент ответаinference-time compute
- Вычисления, которые тратятся не при обучении, а когда система отвечает на вопрос. Ручка, которой раньше не было: на трудный вопрос можно потратить в разы больше, чем на простой.
- верность объясненияfaithfulness
- Соответствие записанного объяснения тому, что действительно повлияло на ответ. Обязанности соответствовать у цепочки рассуждений нет, а статус вопроса такой: спор открыт.
- бенчмаркbenchmark
- Набор задач с известными ответами и правило, превращающее ответы в один балл. Даёт сравнимость между системами и приносит три беды: загрязнение, закон Гудхарта и вопрос о валидности конструкта.
- искусственный интеллектartificial intelligence
- Область, занимающаяся задачами, для которых нет явного пошагового алгоритма решения. Общепринятого определения через свойства машины не существует.
Практикум · Проверить цепочку по шагам
Разница между «помогает» и «показывает ход мысли» становится очевидной, как только цепочку проверяют руками. Практикум занимает четверть часа и требует задачи, ответ на которую вы способны проверить сами.
- Возьмите задачу в три-четыре действия, которую вы умеете решать: расчёт со скидками и доставкой, разбор расписания с пересадками, сравнение двух тарифов за год.
- Задайте её так, чтобы ответ дали сразу, без пояснений. Запишите полученный ответ и пока не проверяйте его.
- Задайте ту же задачу заново и попросите расписать решение по шагам. Запишите и всю цепочку, и итоговый ответ.
- Проверьте каждый шаг цепочки отдельно, как проверяют чужое решение у доски. Отметьте шаги, которые верны, и шаги, которые лишь выглядят уместными.
- Если ответ верен, а какой-нибудь шаг неверен, задержитесь на этом месте подольше. Перед вами пример того, почему цепочку нельзя принимать за отчёт о причинах ответа.
Вопросы для самопроверки
Почему просьба расписать решение по шагам поднимает качество на многошаговых задачах?
- Модель начинает думать медленнее и внимательнее, потому что на каждый шаг ей отводится больше времени
- Промежуточные результаты попадают в текст и участвуют в предсказании дальнейшего
- Модель переключается в особый режим логического вывода, где вместо предсказания текста работает вывод по правилам
- Так она получает доступ к внешнему калькулятору и считает промежуточные шаги точно
Что известно про соответствие записанной цепочки тому, что вычислялось внутри?
- Доказано, что цепочка точно отражает внутренний ход вычисления и годится как протокол проверки
- Доказано, что цепочка не имеет к нему никакого отношения
- Вопрос закрыт: цепочка это протокол вычисления, и по нему можно проверить, как модель пришла к ответу
- Спор открыт: цепочка не всегда отражает вычисление, и есть работы о расхождении
Чем отличается класс моделей, появившийся с 2024 года?
- Их специально обучили тратить вычисления на промежуточный текст перед ответом
- Они перестали ошибаться в арифметике: счёт проверяет отдельный механизм
- Отчасти изменился только интерфейс: внутри всё осталось прежним
- Они показывают пользователю своё внутреннее состояние: видно, какие вычисления шли перед ответом
В цепочке пять шагов, четвёртый содержит арифметическую ошибку, а итоговый ответ верен. Как это понимать?
- Это невозможно: ответ вычисляется из шагов, поэтому ошибка в четвёртом обязана испортить итог, и искать её надо в самой постановке задачи
- Значит, модель заметила и исправила ошибку про себя, не показав этого в записи
- Нормальное поведение: цепочка и ответ порождаются как текст, и жёсткой связи между ними никто не гарантировал
- Значит, задача была слишком простой
Какое из утверждений обосновано слабее прочих?
- Промежуточный текст поднимает качество на задачах с многошаговым выводом
- На размышление перед ответом можно тратить больше вычислений
- За качество на трудных задачах платят временем и деньгами
- Записанная цепочка показывает, как модель пришла к ответу
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Jason Wei et al., «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models», 2022: Первая широко известная работа о приёме. Смотреть стоит на примеры задач: видно, где выигрыш появляется, а где его нет.
- Dive into Deep Learning (d2l.ai), главы о языковых моделях: Напоминание о механизме: текст порождается по одному кусочку, и на каждый тратится примерно одинаковый счёт. Отсюда понятно, почему длинный черновик это буквально больше вычислений.