Законы масштабирования нейросетей
Отдача от размера предсказуема, а «внезапные способности» отчасти создаются линейкой
Законы масштабирования нейросетей это измеренная зависимость качества от числа параметров, объёма данных и вычислений: Каплан с соавторами показал в 2020 году, что кривые остаются гладкими на много порядков. Правило Chinchilla 2022 года уточнило пропорцию: около двадцати токенов, то есть мелких кусочков текста, на один параметр. Модель на 70 миллиардов параметров, обученная на 1,4 триллиона токенов, обошла заметно более крупные.
Каплан и соавторы, 2020. Chinchilla (Хоффманн и соавторы), 2022. Вэй и соавторы, 2022. Шеффер, Миранда и Коеджо, NeurIPS 2023 · 26 мин · обновлено 01.10.2026
После урока вы сможете
- Понимать, что утверждают законы масштабирования и какими оговорками они обставлены
- Считать по правилу Chinchilla и объяснять, почему прежние модели были недообучены
- Разбирать спор об эмерджентности как спор о метрике, на числах
- Задавать вопрос о разрывности метрики всякий раз, когда показывают резкий скачок
У всякого топлива есть очевидный следующий вопрос: что будет, если долить ещё? Обычно ответ приходится узнавать на опыте, потому что заранее он неизвестен. Инженер, добавивший вдвое больше вычислений, может получить прирост в полпроцента, а может не получить ничего.
Языковые модели по началу текста предсказывают продолжение, и для них на этот вопрос сумели ответить заранее. Оказалось, что качество улучшается предсказуемо: по гладкой кривой, которую можно продолжить и по которой можно планировать расходы. Это редкость, и потому измерения 2020 года изменили сам способ, каким в области принимают решения.
А потом появилось утверждение, что кривая местами вовсе не гладкая: что отдельные способности возникают скачком. Здесь начинается самый поучительный сюжет курса, и он не про модели, а про измерение. Значительная часть скачка, как выяснилось, живёт не в модели, а в линейке, которой её мерят.
Кривая, которую можно продолжить
В 2020 году Джаред Каплан с соавторами опубликовал измерения масштабирования языковых моделей. Они брали модели разного размера, обучали на разных объёмах текста с разными вычислительными затратами и смотрели, как меняются потери. Напомним второй урок: функция потерь это число, измеряющее, насколько ответы модели плохи.
Результат такой. Потери падают по степенному закону при росте каждой из трёх величин: числа параметров, объёма данных и вычислений. Степенной закон устроен так, что одинаковое умножение ресурса даёт одинаковое умножение результата. Не «минус столько-то за каждый вложенный рубль», а «минус такая-то доля оставшегося за каждое удвоение».
Разницу между этими двумя способами роста стоит прочувствовать на числах. Пусть каждое удвоение модели срезает десятую часть оставшихся потерь. Тогда первое удвоение даёт заметный выигрыш, от десятого выигрыш почти незаметный, а стоит десятое ровно вдвое дороже девятого. Прирост не кончается, но каждый следующий одинаковый шаг качества обходится вдвое дороже предыдущего.
Здесь это похоже на шлифовку доски: каждый следующий проход убирает не одинаковое число неровностей, а одинаковую их долю. Ломается аналогия в другом месте. У шлифовки есть очевидный предел, совершенно гладкая поверхность. У кривых масштабирования предела в исследованном диапазоне не нашли, а что происходит за его границами, никто не измерял.
Важно заметить, что именно измеряли Каплан и соавторы. Меряли потери, то есть среднюю плохость предсказания следующего кусочка текста, а не умение решать конкретные задачи. Между этими двумя вещами есть зазор, и в нём разыграется главный спор урока. Гладко падающие потери и рывками растущая оценка на задаче прекрасно уживаются друг с другом.
В реестре курса законы масштабирования стоят со статусом «выдержало», и оговорки к нему важны не меньше самого статуса. Закономерность эмпирическая: её нашли измерением в определённом диапазоне, а не вывели из теории. Кривые оставались гладкими на много порядков, то есть при изменении величин в тысячи раз. Но продолжение за пределы измеренного не гарантировано, текстов в мире конечное количество, а повторный анализ другими группами дал уточнения.
Chinchilla: модели оказались недообучены
В 2022 году группа Джордана Хоффманна из DeepMind вернулась к тому же вопросу с важным уточнением. Вопрос ставится так: бюджет вычислений задан, и его надо разделить между размером модели и объёмом обучающего текста. Что выгоднее при одних и тех же затратах, крупная модель на малых данных или модель поменьше на данных побольше?
Ответ оказался неприятным для индустрии: прежние модели были недообучены. Их делали слишком большими при слишком малом объёме текста, и часть вложенных вычислений пропадала впустую. Эмпирическое правило из этой работы требует около двадцати токенов обучающих данных на один параметр модели.
Здесь нужны два коротких пояснения. Параметром называют настраиваемое число модели, а обучение и есть подбор положений всех параметров сразу. Токен это кусок текста, часто часть слова. Подробно их разбирает урок 10, а пока достаточно считать токены мелкими кусочками текста.
Теперь арифметика, которая всё объясняет. Модель Chinchilla имела 70 миллиардов параметров и обучалась на 1,4 триллиона токенов. Умножьте 70 миллиардов на двадцать и получите ровно эту величину. При этом она обошла заметно более крупные модели, обученные на меньшем количестве текста.
Стоит понять, почему ошибка держалась так долго. Размер модели заметен и удобен для заголовка, а объём обучающего текста указывали в отчётах не всегда. Сравнивали поэтому по параметрам, и гонка шла именно за ними. Chinchilla показала, что при том же счёте за вычисления результат бывает заметно лучше, если поделить бюджет иначе.
Практический вывод отсюда простой. «Больше параметров» само по себе не означает «лучше»: параметры, которым не хватило текста, остаются недоиспользованными. В реестре этот результат стоит со статусом «выдержало», с той же оговоркой, что и у законов масштабирования: это эмпирическое правило в исследованном диапазоне, а не закон природы.
До Chinchilla главным публичным числом был размер модели: его печатали в заголовках и по нему сравнивали системы. После стало ясно, что число параметров без объёма обучающих данных не говорит почти ничего. Хороший пример того, как один результат обесценивает привычную величину и как долго после этого её продолжают печатать.
Скачок, о котором заговорили
В 2022 году Джейсон Вэй с соавторами описал явление, которое назвал эмерджентными способностями. Утверждение такое: некоторые умения у малых моделей отсутствуют полностью, а при переходе через определённый размер появляются внезапно. На графике это выглядит как плоская линия у самого нуля, а затем резкий подъём.
Наблюдение выглядело важным и слегка тревожным. Если способности возникают скачком, предсказать их появление заранее нельзя, и гладкие кривые Каплана перестают быть надёжным планом. Утверждение быстро разошлось за пределы области, обычно в упрощённом виде: модели, мол, внезапно чему-то научаются.
Стоит сразу признать, что наблюдение было честным. Вэй с соавторами ничего не подтасовывали: на выбранных ими метриках графики действительно выглядят ступенькой. Спор пошёл не о том, что нарисовано, а о том, что это означает.
Слово «эмерджентный» стоит пометить сразу, пока оно не обросло смыслами. Оно означает всего лишь «возникающий при росте системы и не наблюдаемый у её малых версий», и никакой мистики в него не вложено. Никакого утверждения о понимании, намерениях или сознании здесь нет и не подразумевается.
Возражение: скачок живёт в линейке
В 2023 году Райлан Шеффер, Брандо Миранда и Санми Коеджо задали простой вопрос: а что именно измеряли? Их работа называется «Are Emergent Abilities of Large Language Models a Mirage?» и получила на конференции NeurIPS 2023 награду Outstanding Paper. Ответ, к которому они пришли: значительная часть скачков создаётся выбором метрики.
Механизм стоит разобрать медленно, потому что он важнее всех чисел этого урока. Метрикой называют правило, по которому ответ модели превращается в оценку. Метрики бывают разрывными и непрерывными, и разница между ними решает здесь всё.
Разрывная метрика ставит оценку по принципу «всё или ничего». Чаще всего берут точное совпадение строки: ответ засчитан, только если он совпал с эталоном целиком, до последнего знака. Ответ, где верны четыре знака из пяти, получает ровно ноль, то есть столько же, сколько полная бессмыслица.
Непрерывная метрика засчитывает частичный успех. Например, доля верных знаков в ответе: четыре из пяти дают 0,8, а не ноль. Обе метрики честные, обе что-то измеряют, но при постепенном улучшении модели ведут они себя совершенно по-разному.
Числовой пример, на котором всё видно
Возьмём задачу, где ответом служит число из пяти цифр. Пусть модель растёт, и вместе с размером растёт вероятность правильно выдать одну отдельную цифру. Пусть эта вероятность идёт ровно и предсказуемо: 30 %, потом 50 %, потом 70 %, потом 85 %, потом 95 %.
Это и есть непрерывная метрика: доля верных цифр растёт гладко, безо всяких скачков. Ничего внезапного внутри не происходит, каждый следующий размер просто чуть точнее предыдущего. Теперь посмотрим, что покажет на тех же самых ответах разрывная метрика.
Чтобы строка совпала целиком, верными должны оказаться все пять цифр сразу. Вероятность этого равна произведению пяти вероятностей, то есть нашей доле в пятой степени. Считаем по тем же пяти размерам и получаем: 0,2 %, затем 3 %, затем 17 %, затем 44 %, затем 77 %.
Посмотрите на этот ряд глазами человека, читающего отчёт. Первые три модели показывают почти ноль, и на графике они лягут в одну линию у самого низа. Четвёртая внезапно даёт 44 %, у пятой 77 %, и получается ровно та картинка, которую называют скачком.
А теперь главное: внутри ничего скачкообразного не произошло. Одна и та же гладко растущая точность, измеренная двумя линейками, дала гладкий рост и резкий перелом. Скачок возник в тот момент, когда мы потребовали «всё или ничего» сразу от пяти событий.
Механизм стоит проверить ещё одним поворотом. Пусть ответ состоит не из пяти цифр, а из одной. Тогда разрывная метрика совпадает с непрерывной, и никакого скачка не возникает вовсе: 30 %, 50 %, 70 %, 85 %, 95 %. Модель мы не трогали, а изменили длину ответа, и явление исчезло.
Обратный поворот работает так же надёжно. Возьмите ответ из десяти цифр: точка перелома уедет вправо, а сам перелом станет круче. Выходит, что «размер, при котором способность появляется» зависит от длины ответа не меньше, чем от модели.
Пять размеров и пять вероятностей взяты для наглядности, а не измерены. Проверить арифметику можно на любом калькуляторе: 0,7 в пятой степени это 0,168, а 0,95 в пятой даёт 0,774. Спор идёт именно об этом механизме, а не об этих числах.
Что из этого следует, а что нет
Соблазнительно сделать вывод покрепче: эмерджентность выдумана, никаких скачков не бывает. Такой вывод был бы ровно той ошибкой, о которой предупреждал третий урок, расширением верного утверждения за границы доказанного. Показано другое: разрывная метрика способна нарисовать скачок из гладкого роста, и для ряда заявленных случаев так и вышло.
В реестре курса вопрос стоит со статусом «спор открыт». Формулировать его надо аккуратно: часть заявленных скачков объясняется выбором метрики, а вопрос, все ли, остаётся открытым. Показать механизм ложного скачка совсем не то же самое, что доказать отсутствие настоящих.
Стоит заодно защитить разрывные метрики, потому что они не глупость и не подлог. Часто «всё или ничего» и требуется по делу: программа либо запускается, либо нет, а ответ арифметической задачи либо верен, либо неверен. Пользователю не нужен ответ, где верны четыре цифры из пяти, и метрика честно отражает эту потребность.
Разница вот в чём. Одно дело измерять пользу, другое дело делать выводы о том, что меняется внутри при росте размера. Для первой цели разрывная метрика годится прекрасно. Для второй она опасна, потому что превращает плавное изменение в видимость перелома.
Почему спор важен за пределами статей
У этого спора есть последствия, и стоит назвать три. Первое связано с планированием. Если способности возникают скачком, планировать обучение бессмысленно: важное появится непредсказуемо и не тогда, когда рассчитывали. Если рост гладкий, планировать можно, и это меняет расчёты компаний на годы вперёд.
Второе касается разговора о безопасности. Утверждение о внезапном появлении способностей входит в доводы обеих сторон спора, о котором пойдёт речь в уроке 21. Одни выводят из него, что полагаться на постепенность нельзя. Другие отвечают, что скачок жил в линейке. Курс не выбирает сторону, но требует предъявлять довод вместе с метрикой.
Третье выглядит скромнее и важнее двух первых. Пока вопрос не закрыт, обе формулировки надо произносить с оговорками. «Часть скачков объясняется метрикой» и «настоящих скачков не бывает» остаются разными утверждениями, и второе никем не доказано. Разница между ними и есть содержание статуса «спор открыт».
Приём, который остаётся после урока
Этот сюжет стоит унести далеко за пределы разговора о моделях, потому что приём общий. Всякий раз, когда вам показывают резкое изменение, у него есть два возможных источника: измеряемая вещь и способ измерения. Второй источник обычно не обсуждают, и потому именно он чаще создаёт впечатляющие картинки.
Проверочный вопрос помещается в одну строку. Что произойдёт с этим графиком, если мерить ту же самую вещь с частичным зачётом? Если скачок исчезает, он жил в линейке. Если остаётся, есть о чём говорить дальше.
Тот же приём понадобится в уроке 14, где измерение способностей разбирается целиком: загрязнение тестов, закон Гудхарта и вопрос, то ли измеряется, что хотели измерить. Здесь достаточно запомнить одну связку. Выбор измерения служит не технической формальностью перед выводом, а частью самого вывода.
Что дальше
Урок дал два ответа, и оба с оговорками. Отдача от масштаба предсказуема в исследованном диапазоне и при разумном делении бюджета между размером и данными. Скачки способностей отчасти объясняются линейкой, а насколько именно, пока неизвестно.
Заметьте, что оба ответа количественные и ни один не говорит, что именно модель выучила. Масштаб отвечает на вопрос «сколько», а не на вопрос «что». Между этими вопросами лежит вся оставшаяся часть курса.
Урок 9 берётся за вопрос «что», и берётся с самого удобного края, со зрения, где результат можно увидеть глазами. Ответ там окажется полезным и неприятным одновременно. Затем начнётся модуль о языковых моделях, где тот же вопрос встанет заметно острее.
Ключевые работы и результаты
| Каплан и соавторы, законы масштабирования | 2020 | Измерено, что качество языковой модели предсказуемо улучшается по степенному закону при росте числа параметров, объёма данных и вычислений. Кривые остаются гладкими на много порядков, что впервые позволило планировать обучение заранее. |
| Хоффманн и соавторы, Chinchilla (DeepMind) | 2022 | При фиксированном бюджете вычислений прежние модели оказались недообучены: слишком велики при слишком малых данных. Эмпирическое правило требует около 20 токенов данных на параметр. Модель на 70 млрд параметров, обученная на 1,4 трлн токенов, обошла заметно более крупные. |
| Вэй и соавторы, эмерджентные способности | 2022 | Утверждение, что некоторые способности возникают скачком: отсутствуют у малых моделей и внезапно появляются при переходе через размер. Наблюдение широко разошлось и стало основанием для довода, что рост моделей непредсказуем. |
| Шеффер, Миранда и Коеджо, «Are Emergent Abilities of Large Language Models a Mirage?», NeurIPS | 2023 | Награда Outstanding Paper. Показано, что скачок создаётся выбором метрики: разрывные метрики вроде точного совпадения строки рисуют перелом там, где непрерывные показывают плавный предсказуемый рост. |
Что подтвердилось, а что нет
Измерено Капланом и соавторами в 2020 году. Кривые остаются гладкими на много порядков, то есть при изменении величин в тысячи раз. Оговорки обязательны и входят в сам статус: закономерность эмпирическая, за пределами исследованного диапазона её продолжение не гарантировано, а текстов в мире конечное количество. Повторный анализ другими группами дал уточнения, но не отменил закономерность.
Работа о Chinchilla (2022) показала, что при фиксированном бюджете вычислений прежние модели были недообучены: слишком велики при слишком малом объёме текста. По эмпирическому правилу на параметр приходится около двадцати токенов данных, и модель на 70 миллиардов параметров, обученная на 1,4 триллиона токенов, обошла заметно более крупные. Число параметров без объёма обучающих данных почти ничего не говорит о качестве.
Утверждение Вэй и соавторов (2022) о резком появлении способностей встретило возражение Шеффера, Миранды и Коеджо (NeurIPS 2023, Outstanding Paper). Разрывная метрика вроде точного совпадения строки превращает гладкий рост посимвольной точности в видимость перелома: пятая степень от плавно растущей величины даёт почти ноль, а потом крутой подъём. Часть заявленных скачков объясняется метрикой, а вопрос, все ли, остаётся открытым. Механизм ложного скачка показан, отсутствие настоящих не доказано.
Хоффманн и соавторы в 2022 году перераспределили тот же бюджет вычислений между размером модели и объёмом данных и проверили вывод обучением: модель на 70 млрд параметров, обученная на 1,4 трлн токенов, обошла заметно более крупные. Отсюда эмпирическое правило, по которому на параметр приходится около двадцати токенов данных. Повторный анализ другими группами дал уточнения самого правила, но вывода не отменил. Оговорка входит в статус: правило эмпирическое и привязано к бюджету, а не закон природы. Широкое чтение «чем больше параметров, тем лучше» стоит в этом же уроке сильно ослабленным, и ослабила его именно эта работа.
Термины
- параметрparameter
- Настраиваемое число модели. Обучение и есть подбор положений всех параметров так, чтобы ответы на известных примерах совпадали с известными ответами.
- функция потерьloss function
- Число, измеряющее, насколько ответы модели плохи: чем хуже, тем больше. Её выбор это решение о том, что считать ошибкой, а не техническая мелочь.
- закон масштабированияscaling law
- Измеренная зависимость качества модели от числа параметров, объёма данных и вычислений. Найдена эмпирически в определённом диапазоне. За его пределами продолжение кривой не гарантировано.
- степенной законpower law
- Зависимость, при которой одинаковое умножение одной величины даёт одинаковое умножение другой. Не «минус столько-то за вложенный рубль», а «минус такая-то доля оставшегося за каждое удвоение».
- недообученная модельundertrained model
- Модель, у которой параметров много, а обучающего текста для них мало. Правило Chinchilla: около двадцати токенов данных на один параметр. При меньшем объёме часть вложенных вычислений пропадает впустую.
- эмерджентная способностьemergent ability
- Умение, отсутствующее у малых моделей и появляющееся при переходе через размер. Слово означает только «возникающий при росте системы» и не содержит утверждений о понимании или намерениях.
- разрывная метрикаdiscontinuous metric
- Правило оценки по принципу «всё или ничего»: точное совпадение строки засчитывается целиком, а четыре верных знака из пяти дают ноль. Превращает плавный рост точности в видимость скачка.
- «горький урок»the bitter lesson
- Тезис Саттона (2019) говорит, что методы, опирающиеся на общий поиск и обучение с ростом вычислений, за семьдесят лет систематически обыгрывали методы с вложенными знаниями о предметной области. Статус: спор открыт.
Практикум · Найти линейку под скачком
Приём урока тренируется на двух вещах: на собственном калькуляторе и на чужом графике. Первое даёт понять механизм руками, второе позволяет применить его к реальному заявлению. Вместе это занимает полчаса.
- Посчитайте на калькуляторе, что будет, если ответ состоит не из пяти знаков, а из десяти. Возьмите те же доли верных знаков 0,7 и 0,95 и возведите их в десятую степень.
- Сравните полученное с пятой степенью и запишите, куда сдвинулся видимый скачок. Длина ответа тоже остаётся решением исследователя, и она двигает картинку не меньше, чем размер модели.
- Найдите публикацию или новость, где утверждается, что у модели внезапно появилась какая-то способность. Годится и научная статья, и пересказ в прессе.
- Выпишите оттуда метрику: чем именно мерили и что засчитывалось за успех. Если метрика не названа вовсе, это сам по себе ответ, и его стоит записать.
- Запишите отдельной строкой, чего ваш разбор НЕ доказывает. Даже найденная разрывная метрика не отменяет возможности настоящих скачков, и статус вопроса остаётся «спор открыт».
Вопросы для самопроверки
Что показали измерения Каплана и соавторов в 2020 году?
- Что качество модели растёт неограниченно и почти без затрат: каждое удвоение размера прибавляет столько же, сколько прошлое, и стоит столько же
- Что потери предсказуемо падают по степенному закону при росте параметров, данных и вычислений
- Что размер модели всегда важнее объёма данных
- Что после определённого размера обучение перестаёт помогать: кривая выходит на полку, и дальше рост ресурсов ничего не даёт
Что следует из правила Chinchilla, по которому на параметр нужно около двадцати токенов данных?
- Что модель надо делать как можно больше при любом бюджете: параметры дают прибавку, которой данные не дают
- Что объём обучающих данных на результат почти не влияет: решает число параметров, а один и тот же текст можно показывать повторно
- Что токены стоят дороже параметров
- Что при фиксированном бюджете прежние модели были слишком велики при слишком малых данных
В чём состоит возражение Шеффера, Миранды и Коеджо, отмеченное на NeurIPS 2023?
- Значительная часть заявленных скачков создаётся выбором разрывной метрики
- Эмерджентных способностей не существует, и работа это доказала: все заявленные скачки оказались артефактом метрики
- Модели меньшего размера на деле работают лучше крупных
- Законы масштабирования не воспроизводятся на других данных, и потому предсказывать качество заранее нельзя
Доля верных цифр растёт ровно: 30 %, 50 %, 70 %, 85 %, 95 %. Что покажет метрика «точное совпадение» для ответа из пяти цифр?
- Тот же ровный рост, только с меньшими числами: возведение в степень меняет масштаб, а форму кривой оставляет прежней
- Постоянное значение около нуля на всех размерах: пятая степень любой доли меньше единицы даёт почти ноль
- Почти ноль на первых трёх размерах и резкий подъём на последних
- Убывание: с ростом размера модели ответы длиннее, и ошибки накапливаются
Зачем вообще пользуются разрывными метриками, если они создают ложные скачки?
- По привычке: разумных причин у этого нет, и от разрывных метрик давно отказались
- Они дешевле в вычислении: посимвольное сравнение требует отдельной модели-судьи
- Этого требуют правила конференций: без разрывной метрики работу к публикации не примут
- Часто «всё или ничего» и нужно по делу: программа либо запускается, либо нет
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Jared Kaplan et al., «Scaling Laws for Neural Language Models», 2020: Смотреть стоит прежде всего на графики: их прямизна в логарифмических осях и есть всё содержание работы. Текст объясняет, как мерили и чего не мерили.
- Rylan Schaeffer, Brando Miranda, Sanmi Koyejo, «Are Emergent Abilities of Large Language Models a Mirage?», NeurIPS 2023: Читается как детектив про линейку: авторы показывают, как получить скачок из гладкой кривой и как убрать его обратно сменой метрики. Лучший известный курсу разбор того, как измерение создаёт явление.
- Jordan Hoffmann et al., «Training Compute-Optimal Large Language Models», 2022: Работа о Chinchilla. Полезна тем, что показывает цену ошибки в делении бюджета: тот же счёт за вычисления, а результат заметно лучше.