К содержанию
Фонтум Искусственный интеллект Урок 12 / 24 Все уроки

Главная · Курсы · Искусственный интеллект · Программа курса · Модуль IV. Языковые модели · урок 12 из 24

Как работает ChatGPT: три ступени обучения

Три ступени обучения, и только первая делает то, о чём все думают

Работает ChatGPT на трёх ступенях обучения: предобучение на огромном корпусе текста, дообучение на парах «запрос и хороший ответ», написанных людьми, и настройка по человеческим предпочтениям, где люди сравнивают ответы попарно. Работа InstructGPT 2022 года показала силу двух последних: модель на 1,3 миллиарда параметров предпочиталась людьми модели на 175 миллиардов без такого дообучения. Сама ChatGPT вышла в ноябре 2022 года.

Оуян и соавторы, InstructGPT, 2022. Выход ChatGPT, ноябрь 2022. Stanford CS324 · 24 мин · обновлено 01.10.2026

После урока вы сможете

  • Различать три ступени обучения и понимать, какое дело делает каждая
  • Объяснять, почему сравнение двух ответов оказалось продуктивнее написания образца
  • Знать число из работы про InstructGPT и вывод, который из него следует
  • Не путать приятность ответа с его правдивостью

Представьте модель, которая прочитала огромное количество текста и научилась одному: продолжать. Вы пишете ей «Как испечь хлеб?», а в ответ получаете ещё три вопроса про выпечку. Ошибки здесь нет: в собранных текстах за вопросом сплошь и рядом идёт другой вопрос, и модель честно продолжила начатое.

Такая модель работает как автодополнение, а не как собеседник. Она не отказывается отвечать и не выбирает быть бесполезной. В её постановке задачи слова «ответить» просто нет. Есть слово «продолжить», и она его отрабатывает.

Между этой системой и привычным чат-ботом лежат две дополнительные ступени обучения. Устроены они по-разному и делают разные дела, и путать их не стоит. Этот урок разбирает все три по порядку и показывает, что именно каждая добавляет. Порядок существен: каждая следующая ступень работает на том, что дала предыдущая.

Ступень первая: предобучение

Предобучение это то, о чём были уроки 10 и 11. Модель получает огромный корпус текста и учится предсказывать следующий токен. Размечать ничего не надо: правильный ответ уже лежит в тексте, и это следующее слово.

Отсутствие разметки оказывается тем свойством, которое всё решает. Урок 2 объяснял, почему обучение с учителем дорого: примеры с ответами размечают люди. Здесь ответы берутся из самого текста бесплатно, и потому масштаб оказывается неограниченным ничем, кроме количества текста и вычислений.

Это самая дорогая часть по вычислениям и самая длинная по времени. Именно здесь работают законы масштабирования из урока 8: качество предсказания предсказуемо улучшается с ростом числа параметров, объёма данных и вычислений. И именно здесь в модель попадает почти всё, что в ней вообще отражено о языке и о мире.

Дальнейшие ступени будут учить её не новым сведениям, а тому, как себя вести. Разницу стоит держать в голове весь урок, потому что путают её постоянно. Дообучение не досыпает модели фактов, а меняет форму того, что она выдаёт. Первая ступень отвечает на вопрос, что модель вообще может сказать. Остальные берутся за вопрос, как она это скажет.

Почему этого мало

Продолжение текста и ответ на просьбу остаются разными вещами, и разница видна на примерах. Попросите продолжить список, и получите список, тут всё сходится. Попросите совета, и с равной вероятностью получите совет, рассуждение о трудности советов или ещё один вопрос.

Причина в постановке задачи, а не в качестве обучения. Модель приближает то, как устроены тексты вообще, а тексты бывают всякие: обрывки, объявления, споры, черновики, оглавления. Среднее по всем текстам мира совсем не то же самое, что полезный ответ на вопрос.

Значит, надо как-то сообщить модели, чего мы от неё хотим. Написать это правилом нельзя, и весь курс, в сущности, про то, почему правило написать не выходит. Остаётся единственный доступный способ: показать примеры, то есть снова обучать. Другого инструмента у машинного обучения попросту нет.

Ступень вторая: примеры хороших ответов

Дообучение на инструкциях устроено предельно понятно. Люди пишут пары «запрос и хороший ответ»: вопрос и то, что следовало бы на него ответить. Модель дообучается на этих парах тем же способом, что и раньше, предсказывая следующий токен.

Изменился не механизм, а материал. Раньше моделью двигал средний текст интернета. На смену ему пришли тексты, где на просьбу отвечают по существу. Модель начинает продолжать запрос ответом просто потому, что в новых примерах после запроса стоит ответ. Никакого понятия «просьба» ей при этом не сообщили.

Ресурсом здесь служит человеческий труд, и это стоит назвать прямо. Урок 2 говорил про разметку: данные не природный ресурс, а чья-то работа со всеми свойствами человеческого труда. На этой ступени работа особенно заметна, потому что каждый пример кто-то написал руками, и написал так, как понял инструкцию.

У способа есть предел, из-за которого понадобилась третья ступень. Хороший ответ надо сочинить целиком, а это долго и дорого. К тому же на многие запросы единственно правильного ответа не существует: их десятки, и они разного качества, и выбрать один образец значит выбросить остальные.

Ступень третья: сравнения вместо образцов

Третья ступень начинается с наблюдения о людях, а не о моделях. Написать лучший ответ трудно и медленно, а сравнить два готовых легко и быстро. Значит, собирать надо не образцы, а предпочтения: не «как надо», а «что из двух лучше». Один и тот же человек за час успеет сравнить во много раз больше, чем написать.

Так и делают. Модель выдаёт несколько ответов на один запрос, человек указывает, какой из них лучше. Из тысяч таких сравнений обучается отдельная модель вознаграждения. Она предсказывает, какой ответ люди предпочтут, не спрашивая людей. Это обычное обучение с учителем: примерами с ответами здесь служат сами сравнения.

Дальше человек из цикла выходит, и в этом весь смысл конструкции. Основная модель пишет ответ сама, модель вознаграждения выставляет ему оценку, и по этой оценке двигают веса. Это обучение с подкреплением, третий вид обучения из урока 2: награда за исход вместо готового правильного ответа.

«Ответ становится вероятнее» звучит туманно, а означает вещь совершенно конкретную. Модель порождает текст по кусочку, и на каждом шаге у выбранного ею токена была какая-то вероятность. Перемножьте эти вероятности, и получите вероятность всего ответа целиком. Вот её и двигают: считают, куда подвинуть каждый вес, чтобы это число выросло, и делают шаг.

Размер и знак шага задаёт оценка, и здесь вся разница со второй ступенью. Ответ оценён высоко, и мы шагаем в сторону роста его вероятности. Оценён низко, и шагаем в противоположную сторону. На второй ступени образец писал человек, и модель подгонялась под чужой текст. Здесь текст свой собственный, а извне приходит только отметка за него.

У приёма в чистом виде есть беда, и её приходится лечить отдельно. Гонясь за оценкой, модель уезжает туда, где модели вознаграждения случайно нравится, а на язык это уже мало похоже. Поэтому основную модель удерживают рядом с той, какой она была до третьей ступени: за сильное расхождение с прежними вероятностями назначают штраф. Оптимизируется, стало быть, не одна оценка, а оценка минус плата за уход от прежнего поведения.

Всю процедуру называют обучением с обратной связью от людей, в сокращении RLHF. Название точное и обманчивое одновременно. Обратная связь действительно идёт от людей, но модель учится не у людей, а у их усреднённых предпочтений, пропущенных через ещё одну модель.

1. предобучениеогромный корпусбез разметкипродолжает текст2. примеры ответовпары «запрос ихороший ответ»отвечает на просьбу3. предпочтениялюди сравниваютответы попарноотвечает как нравитсямеханизм на всех трёх ступенях один: предсказать следующий токенменяется материал, на котором учат, и то, что считается хорошим
Три ступени делают три разных дела, а механизм под ними всё тот же

Кто решает, какой ответ хороший

На двух последних ступенях всё держится на одном вопросе: что считать хорошим ответом. Отвечают на него не модели и не исследователи, а инструкция для разметчиков. В ней написано, что ценить: точность, краткость, осторожность, готовность отказаться от части запросов.

Урок 2 уже назвал эту бумагу самым влиятельным и самым редко публикуемым местом всей системы. Здесь это видно особенно ясно. Инструкция определяет, какие ответы получат высокие оценки. Оценки задают модель вознаграждения. Модель вознаграждения формирует поведение основной модели.

Отсюда полезное наблюдение о разговорах про «характер» той или иной системы. Ни вежливость, ни осторожность, ни привычка оговариваться, ни готовность признать ошибку не возникли сами собой. Это выбор, сделанный людьми, записанный в инструкцию и усреднённый по многим разметчикам.

И следствие для чтения новостей об этой области. Когда две системы сравнивают по тому, как они «держат разговор», сравнивают в том числе две редакции инструкции для разметчиков. Технику при этом обсуждают охотно, а инструкцию показывают редко. Спрашивать о ней стоит первым делом, хотя ответа обычно не будет.

InstructGPT, 2022: число, которое стоит запомнить

Насколько это важно, показала работа Оуяна и соавторов 2022 года. Сравнивали две модели. Одна на 1,3 миллиарда параметров прошла всю описанную процедуру, другая на 175 миллиардов не проходила её вовсе. Люди предпочитали ответы первой.

Разница в размере тут примерно в сто тридцать раз. Модель, меньшая на два порядка, оказалась полезнее просто потому, что её научили отвечать на просьбу. Это самый наглядный в курсе довод против отождествления «больше» и «лучше».

Оговорку надо сделать сразу, иначе вывод получится слишком широким. Законы масштабирования никто не опроверг: качество предсказания текста действительно растёт с размером, и урок 8 разбирает это отдельно. Речь о другом. Предсказание текста и полезный ответ меряются разными вещами.

Отсюда полезная привычка при чтении новостей об ИИ. Услышав про число параметров, спрашивайте, что именно измеряли и на чём. Размер говорит о ресурсах, вложенных в обучение, и почти ничего не говорит о том, окажется ли ответ полезным вам. Это разные величины, и складывать их в одну оценку не выходит.

Ноябрь 2022

В ноябре 2022 года вышла ChatGPT, и эту дату стоит запомнить точно. Технически это был интерфейс к дообученной модели: ни новой архитектуры, ни новой идеи обучения там не появилось. Трансформеру к тому моменту исполнилось пять лет.

Культурно случилось другое, и оно оказалось важнее техники. Область, о которой читали в новостях, стала вещью, которую можно открыть и потрогать без всякой подготовки. Разговор об искусственном интеллекте вышел за пределы профессии и попал на кухни. За несколько месяцев о нём заговорили те, кто прежде о нём не думал вовсе.

Полезно разобрать, что именно сработало. Это редкий случай, когда видно составные части. Сложились три вещи: модель отвечала на просьбу, доступ был открыт кому угодно, и разговор шёл обычными словами без обучения командам. Третья ступень обучения оказалась здесь условием, а не деталью.

И сразу оговорка в духе всего курса. Дата остаётся вехой, а не оценкой: «в ноябре 2022 вышла ChatGPT» сообщает о событии, а не о том, какая система хороша сегодня. Вехи стареют плохо, а оценки мгновенно, и различать их стоит в любом тексте об этой области.

Приятнее не значит правдивее

Теперь главное предупреждение урока, и следует оно прямо из устройства. Модель вознаграждения обучена на том, какой ответ люди предпочли при сравнении. Значит, дообучение двигает основную модель в сторону предпочитаемых ответов, и ни в какую другую сторону.

А предпочитают люди понятное, уверенное, вежливое и складное. Ещё предпочитают ответ, который согласен с уже высказанным мнением спрашивающего, и ответ полный там, где честнее было бы короткое «не знаю». В самой процедуре нет вопроса о том, совпадает ли предпочитаемое с истинным.

Это тот самый разрыв, который урок 2 назвал источником большинства неприятностей машинного обучения. Система оптимизирует то, что записано в цели, а не то, что имелось в виду. Записано «нравится людям при сравнении». Имелось в виду «верно и полезно».

Отсюда практический вывод для читателя, и он неприятный. Приятный тон, готовность помочь и уверенная формулировка получаются из третьей ступени обучения, а не служат признаком правоты. Урок 13 покажет, во что это обходится в самом опасном случае: когда продолжать модели нечем.

ловушкаУверенность это выученный стиль

Ровный уверенный тон ответа не берётся из уверенности. Источниками служат тексты справочников, на которых модель училась, и третья ступень, где людям нравились ясные и полные ответы. Поэтому фраза «модель ответила уверенно» не содержит никакой информации о верности ответа. И обратное тоже верно: осторожная формулировка не означает, что модель что-то заподозрила. Тон и правильность здесь не связаны вовсе.

Что изменилось, а что нет

Стоит отделить одно от другого, потому что путают эти вещи постоянно. Три ступени изменили поведение модели: она отвечает на просьбу, держит формат, отказывается от части запросов. Это заметно сразу и производит сильное впечатление. Собственно, на этом впечатлении и построен весь публичный разговор об ИИ.

Механизм под этим не изменился вовсе. Модель по-прежнему предсказывает следующий токен по предыдущим, и никакого другого способа получить ответ у неё не появилось. Дообучение переставило вероятности, а не добавило нового устройства внутрь. Ни органа проверки, ни хранилища фактов, ни намерения в модели не завелось.

Из этого следует и хорошее, и плохое, и стоит назвать оба. Хорошее: работать с моделью стало можно обычными словами, и порог входа упал практически до нуля. Плохое: всё, что вытекает из механизма предсказания, никуда не делось, и следующий урок посвящён самому известному из этих следствий.

Что дальше

Соберём три ступени в одну строку. Предобучение даёт умение продолжать текст, дообучение на инструкциях добавляет привычку отвечать на просьбу, обучение на предпочтениях ставит манеру, которая людям нравится. Каждая ступень делает своё дело, и подменять их друг другом нельзя.

Помнить надо две вещи, и обе неочевидны. Первая: «больше параметров» и «полезнее» лежат на разных осях, и работа про InstructGPT показала это числом. Вторая: последняя ступень оптимизирует человеческие предпочтения, а не истинность, и разница между этими целями никуда не девается.

Урок 13 берётся за прямое следствие всего сказанного. Модель обучена продолжать текст правдоподобно, и продолжает даже тогда, когда продолжать нечем. Почему это свойство механизма, а не поломка, и почему починить его так трудно, разбирается там подробно.

Ключевые работы и результаты

Оуян и соавторы, InstructGPT2022Модель на 1,3 миллиарда параметров после дообучения на инструкциях и человеческих предпочтениях предпочиталась людьми модели на 175 миллиардов параметров без такого дообучения.
Выход ChatGPT2022Ноябрь 2022 года. Технически перед нами интерфейс к дообученной модели без новой архитектуры. Культурно наступил момент, когда область стала общественным явлением и разговор о ней вышел за пределы профессии.

Что подтвердилось, а что нет

сильно ослабленоОбучение на человеческих предпочтениях делает модель правдивее.

Процедура оптимизирует ровно одно: какой ответ люди выберут при сравнении двух. Люди же предпочитают понятное, уверенное, вежливое и согласное с их мнением, а также полный ответ там, где честнее короткое «не знаю». Часть ошибок дообучение действительно убирает, и модели можно специально прививать признание незнания. Но само по себе «нравится людям» и «соответствует действительности» остаются разными целями, и совпадение их не гарантировано.

сильно ослабленоПолезность ответа определяется размером модели.

Работа про InstructGPT 2022 года дала прямое сравнение: модель на 1,3 миллиарда параметров после дообучения предпочиталась модели на 175 миллиардов без него. Разница в размере примерно в сто тридцать раз, и она проиграла разнице в обучении. Законы масштабирования при этом не опровергнуты: качество предсказания текста с размером растёт. Просто предсказание текста и полезный ответ измеряются разными вещами.

мифChatGPT это новая технология, появившаяся в ноябре 2022 года.

Архитектура трансформера предложена в 2017 году, предобучение на больших корпусах и дообучение на предпочтениях описаны раньше выхода продукта. Технически это был интерфейс к дообученной модели. Культурная веха при этом настоящая: сложились ответ на просьбу, открытый доступ и разговор обычными словами. Именно сумма трёх обстоятельств, а не новая идея, вывела область за пределы профессии.

выдержалоДообучение на человеческих предпочтениях меняет предпочитаемость ответов сильнее, чем стократный рост размера модели.

Оуян и соавторы в 2022 году сравнили две модели по предпочтениям людей: модель на 1,3 миллиарда параметров после дообучения на инструкциях и предпочтениях предпочиталась модели на 175 миллиардов без такого дообучения. Мера здесь названа точно, и в этом весь смысл записи: измерялась предпочитаемость ответа человеком, а не его правдивость. Что дообучение делает модель правдивее, это другое утверждение, и в этом же уроке оно стоит сильно ослабленным. Устояло то, что полезность и приятность ответа настраиваются отдельно от размера: сам по себе размер модели о качестве ответа не говорит.

Термины

предобучениеpretraining
Первая ступень: модель учится предсказывать следующий токен на огромном корпусе текста. Размечать ничего не нужно, правильный ответ уже лежит в самом тексте.
дообучение на инструкцияхsupervised fine-tuning, SFT
Вторая ступень: обучение на парах «запрос и хороший ответ», написанных людьми. Механизм тот же, меняется только материал, на котором учат.
обучение с обратной связью от людейreinforcement learning from human feedback, RLHF
Третья ступень: люди сравнивают ответы попарно, на сравнениях обучается модель вознаграждения, по её оценкам дообучается основная модель.
модель вознагражденияreward model
Отдельная модель, обученная предсказывать, какой из двух ответов люди предпочтут. Она заменяет человека в цикле дообучения, потому что людей на миллионы сравнений не хватит.
обучение с подкреплениемreinforcement learning
Обучение через награду за исход действий. Главная трудность в том, что награда приходит поздно, и неясно, какое из прошлых действий её заслужило.
языковая модельlanguage model
Система, предсказывающая распределение вероятностей следующего токена по предыдущим. Ничего сверх этого в постановке задачи нет.
токенtoken
Кусок текста, на который модель делит вход: часто часть слова. Для русского текста токенов на слово обычно больше, чем для английского.

Практикум · Соберите свою модель вознаграждения

Третья ступень выглядит технично, а держится целиком на человеческом суждении. Проще всего это почувствовать, встав на место разметчика: вы сами будете тем, чьи предпочтения потом станут целью обучения.

  1. Возьмите один вопрос, ответ на который вы знаете хорошо, скажем по работе, по хобби, по родному городу. Соберите к нему шесть разных ответов: попросите знакомых, найдите в сети, напишите пару сами.
  2. Разбейте ответы на пары и в каждой паре выберите лучший. Пар получится пятнадцать. Отмечайте выбор быстро, не раздумывая дольше полуминуты, именно так работают разметчики.
  3. Теперь выпишите, чем вы на самом деле руководствовались: длиной, уверенностью тона, вежливостью, точностью, совпадением с вашим мнением. Честный список обычно оказывается длиннее ожидаемого.
  4. Отметьте пары, где более верный ответ проиграл более приятному. Если таких нет ни одной, проверьте себя ещё раз: чаще всего они есть и просто не бросаются в глаза.
  5. Дайте те же пятнадцать пар двум знакомым и сравните выборы. Места, где вы разошлись, и есть содержание понятия «человеческие предпочтения», усреднённого по разным людям с разными критериями.

Вопросы для самопроверки

Вопрос 1

Что получается после одного лишь предобучения?

  • Собеседник, отвечающий на вопросы по существу: именно этому предобучение модель и учит
  • Поисковая система по обучающим текстам, выдающая подходящий отрывок
  • Автодополнение: система, умеющая продолжать текст
  • База фактов, к которой можно обращаться с запросом: обучающие тексты сохраняются внутри модели
Вопрос 2

Зачем понадобилась третья ступень, если примеры хороших ответов уже собрали?

  • Сравнить два готовых ответа людям гораздо легче, чем сочинить лучший
  • Примеры хороших ответов оказались бесполезны, и вторую ступень из процедуры убрали
  • Обучение с учителем на текстах не работает: примеры ответов ничему не учат
  • Модель вознаграждения дешевле обучать, чем основную, и третья ступень нужна ради экономии вычислений
Вопрос 3

Что показала работа по InstructGPT 2022 года?

  • Что модели на 175 миллиардов параметров бесполезны и наращивать размер больше незачем
  • Что размер модели на качество предсказания текста не влияет, а законы масштабирования этим опровергнуты
  • Что сравнение оказалось спорно, и вопрос о пользе дообучения открыт
  • Что модель на 1,3 миллиарда после дообучения предпочиталась модели на 175 миллиардов без него
Вопрос 4

Что именно оптимизирует обучение на человеческих предпочтениях?

  • Долю верных утверждений в ответе: людям показывают факты и просят отметить ошибки
  • То, какой ответ люди предпочтут при сравнении двух
  • Скорость выдачи ответа: чем быстрее модель отвечает, тем выше её оценка
  • Полноту охвата обучающих данных: модель поощряют за то, что она пускает в ход больше выученного
Вопрос 5

Что появилось в ноябре 2022 года с выходом ChatGPT?

  • Доступность: дообученную модель открыли кому угодно, а техника при этом осталась прежней
  • Архитектура трансформера: до ноября 2022 года модели читали текст подряд, слово за словом
  • Механизм внимания
  • Обучение с подкреплением: до этого модели умели только предсказывать следующее слово

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • L. Ouyang et al., «Training language models to follow instructions with human feedback», 2022: Работа про InstructGPT. Схема трёх ступеней нарисована на первых страницах и понятна без чтения остального текста.
  • Stanford CS324 «Large Language Models», разделы о дообучении: Открытые конспекты курса о больших языковых моделях. Ступени разобраны подробнее, чем помещается в один урок.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Искусственный интеллект»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?