Бенчмарки: как оценивают нейросети
Три беды любого теста для машин: загрязнение, Гудхарт и валидность конструкта
Бенчмарки нейросетей это наборы задач с известными ответами и правило, превращающее ответы в один балл. Общая линейка даёт сравнимость: именно она сделала видимым отрыв AlexNet в 2012 году, ошибку 15,3 % против 26,2 % у второго места. Бед у такого измерения три: загрязнение, когда опубликованные тесты попадают в обучающие данные, закон Гудхарта, по которому мера, ставшая целью, перестаёт быть хорошей мерой, и вопрос, то ли измерено, что хотели.
Гудхарт, 1975, в формулировке Мэрилин Стратерн. ILSVRC и AlexNet, 2012. Шеффер, Миранда, Коеджо, 2023 · 24 мин · обновлено 01.10.2026
После урока вы сможете
- Понимать, из чего собран бенчмарк и зачем области нужна общая линейка
- Объяснять, почему для моделей, обученных на вебе, загрязнение теста оказывается состоянием по умолчанию
- Узнавать закон Гудхарта в отчётах о результатах, чужих и своих
- Задавать четыре вопроса к любому заголовку «модель сдала экзамен»
Представьте заголовок: модель сдала выпускной экзамен по медицине лучше среднего выпускника. Вывод напрашивается сам собой, и состоит он в том, что машина знает то, чему людей учат шесть лет. Так его обычно и делают: в пересказах, в рекламе, в разговорах за столом.
Проверим, из чего этот вывод собран. Когда экзамен сдаёт человек, вы заключаете, что он чему-то научился, и заключение опирается на два молчаливых условия. Первое: он не видел вопросов заранее и решал их впервые. Второе: сам экзамен устроен так, чтобы отличать умеющих от неумеющих.
Для модели оба условия могут нарушаться, причём незаметно для всех участников. Тогда одно и то же число в заголовке означает совершенно разные вещи. Этот урок объясняет, как отличить одно от другого, не имея доступа к внутренностям системы.
Зачем вообще нужна общая линейка
Начнём с механизма, как всегда в этом курсе. Бенчмарк это набор задач с известными ответами и правило, по которому ответы превращают в один балл. Например, тысяча вопросов с вариантами ответа и доля угаданных. Или сто тысяч фотографий с подписями и доля верно опознанных.
Нужен он ради одной вещи, зато незаменимой, а именно ради сравнимости. Пока каждая команда проверяет систему на своих примерах, заявления о качестве несопоставимы в принципе. Общий набор задач превращает разговор о том, у кого лучше, в разговор о числах.
Как это работает, лучше всего видно на распознавании изображений. С 2010 года шло соревнование, где команды год за годом мерились на общем наборе размеченных картинок. В 2012 году свёрточная сеть AlexNet дала ошибку 15,3 % против 26,2 % у занявшего второе место. Отрыв почти в одиннадцать процентных пунктов увидели все и сразу, именно потому, что мерили одним прибором.
Стоит сразу сказать и то, чем бенчмарк не является, иначе слово «экзамен» утащит нас не туда. У него нет комиссии, нет надзора за списыванием и нет условия «решай сам, своей головой». Это измерительный прибор, а у прибора всегда спрашивают, что именно он меряет и насколько ему можно верить.
Запомним это, прежде чем разбирать беды. Без общей линейки прогресс не отличить от рассказов о прогрессе, и всей области пришлось бы верить друг другу на слово. Дальше речь пойдёт о трёх способах, которыми линейка врёт, и ни один из них не отменяет сказанного.
Первая беда: тест мог быть в обучении
Чтобы бенчмарком пользовались, его надо опубликовать. Задачи и ответы выкладывают в открытый доступ, иначе никто не сможет проверить на них свою систему. Дальше происходит вещь, которую отдельно никто не задумывал.
Языковые модели обучают на огромной доле доступного интернета. Опубликованный тест лежит в интернете, значит, он попадает в обучающие данные сам собой. Загрязнение бенчмарка это когда тестовые задачи оказались в обучении. Для моделей, обученных на вебе, это состояние по умолчанию, а не редкая авария.
Что происходит с результатом дальше, понятно из урока 6. Модель, видевшая задачу вместе с ответом, отвечает по памяти, и делать ей для этого ничего особенного не надо. Балл перестаёт измерять способность справляться с новым и начинает измерять запоминание. А ради первого всё и затевалось: воспроизвести известные ответы умеет обычная таблица.
Здесь напрашивается аналогия, и её надо сразу пометить как аналогию. Похоже это на студента, которому заранее раздали банк вопросов с ответами: балл высокий, предмет не выучен. Ломается аналогия вот где. Студент знает, что видел вопросы, а тут никто не мухлевал. Данные собирали машинно и мешками, и о том, что внутри оказался тест, могли не знать даже разработчики.
Отсюда следует нескучная вещь про даты. Набор задач, пролежавший в открытом доступе несколько лет, успел разойтись по копиям, форумам и разборам решений. Поэтому дата бенчмарка не формальность в подписи, а половина смысла результата.
Отсюда же виден и способ борьбы, которым пользуются составители наборов. Задачи держат закрытыми и выдают только на проверку, а ответы не публикуют вовсе. Обходится это дорого и работает недолго: закрытый набор живёт ровно до тех пор, пока разборы решений не разошлись по сети.
Эту фразу стоит читать медленно. Чтобы проверить такое, надо знать состав обучающих данных, а его публикуют редко. Сверка обычно ищет дословные совпадения, и перефразированный вариант той же задачи её проходит. Из этого не следует, что проверки бесполезны. Следует, что у утверждения «загрязнения нет» есть метод и цена, и про метод уместно спросить.
Вторая беда: мера становится целью
Вторая беда начинается там, где на балл начинают смотреть чужие глаза. Формулировка известна как закон Гудхарта: когда мера становится целью, она перестаёт быть хорошей мерой. Так её выразила Мэрилин Стратерн по мотивам работ экономиста Чарльза Гудхарта 1975 года.
Механизм проще, чем кажется, и злого умысла не требует вовсе. Мера связана с тем, что нам на самом деле нужно, не жёстко, а приблизительно. Пока по мере просто наблюдают, связь держится, потому что никто её не трогает. Как только по мере начинают отчитываться, двигать саму меру оказывается дешевле, чем то, что она отражала.
Возьмём школу, которую оценивают по доле сдавших выпускной экзамен. Можно учить предмету, а можно натаскивать на формат заданий и отговаривать слабых от сдачи. Второе дешевле и быстрее, а доля сдавших вырастет в обоих случаях. Число выросло, и различить по нему две очень разные школы больше нельзя.
В машинном обучении это работает с особой силой, потому что таблицы читают все. Публичный балл попадает в новости, в презентации для заказчиков, в решения о финансировании. Оптимизируется ровно то, что публикуется, и это следствие устройства отрасли, а не чьей-то испорченности.
Заметьте, что перед нами старый знакомый из урока 2. Там система оптимизировала то, что записано в функции потерь, а не то, что имели в виду люди. Здесь оптимизируют уже люди и организации, но разрыв между записанным и подразумеваемым тот же самый.
И ещё одно свойство, из-за которого беду трудно заметить изнутри команды. Каждый отдельный ход выглядит разумным и даже справедливым: подгонка формата убирает потери на ерунде, выбор подходящего теста показывает сильную сторону. Решения «давайте всех обманем» никто не принимает, а сумма разумных решений даёт разъехавшиеся полосы.
Пять ходов команды, которой велено поднять балл
Разберём это с той стороны, с которой обычно не показывают. Вы руководите командой, и к следующему релизу надо поднять результат на публичном тесте. Ходов у вас пять, и все они балл поднимают.
Учить решать задачи по-настоящему. Единственный ход, где балл и умение растут вместе. Он же самый дорогой: нужны данные, время и вычисления. В гонке за таблицей он проигрывает остальным именно поэтому.
Дообучить на самих тестовых задачах. Это загрязнение, сделанное нарочно. Балл взлетает выше, чем от любого другого хода, а умение не меняется вовсе.
Подогнать формат ответа под проверяльщик. Автоматическая проверка часто сравнивает строки. Научите модель отвечать ровно в ожидаемом виде, и балл вырастет без единой новой мысли.
Выбрать тест, на котором вы и так сильны. Публикуют результат там, где он лучше, и не публикуют там, где хуже. Со стороны это выглядит как прогресс, а на деле это выбор витрины.
Прогнать сто попыток и показать лучшую. Ответы модели меняются от запуска к запуску. Рекорд из ста попыток выдают за способность, хотя честная отчётность требует среднего и разброса.
Четыре хода из пяти поднимают число, не добавляя ни капли умения. Тренажёр к этому уроку даёт нажать на каждый и увидеть, как расходятся две полосы: балл в таблице и умение решать. Расхождение полос и есть закон Гудхарта, увиденный своими глазами.
Третья беда: экзамен проверяет не то, что кажется
Допустим теперь, что всё сделано честно. Тест свежий, в обучение не попадал, отчитались средним по ста запускам, формат никто не подгонял. Заголовок про медицинский экзамен всё равно значит не то, что читается, и третья беда самая тихая из трёх.
Валидность конструкта это вопрос, совпадает ли измеряемое с тем, что хотели измерить. Экзамен по медицине проверяет узнавание типичных случаев по готовому описанию. Работа врача начинается раньше: пациент рассказывает путано, жалуется не на то, забывает половину и половину придумывает.
Дальше идут осмотр, решение при неполных данных и ответственность за это решение. Ничего этого в экзаменационном вопросе нет, и это не недостаток экзамена. Экзамен и не задуман как измеритель способности лечить, а входит в длинную систему допуска к профессии.
Для человека он работает потому, что окружён допущениями, которые никто не проговаривает. Сдавший шесть лет ходил в клинику, держал в руках инструменты и отвечал перед преподавателем за свои слова. Балл на экзамене служит верхушкой этой конструкции, и по верхушке судят обо всём остальном.
Перенося экзамен на машину, мы забираем число и молча выбрасываем конструкцию. Успех на медицинском тесте не равен способности лечить, потому что тест никогда и не измерял её целиком. То же верно про юридические, инженерные и школьные экзамены, и везде число держится на невидимых подпорках.
Вспомните экзамен, который сдавали сами. Какую часть той работы, ради которой вас проверяли, он действительно захватывал? Обычно выясняется, что экзамен проверял малую часть, а остальное держалось на практике, надзоре и репутации. Ровно эти подпорки исчезают, когда тот же экзамен дают машине.
Что считать баллом, тоже решение
Есть ещё одно место, где число рождается не само по себе. Даже на одном наборе задач балл можно считать по-разному. Можно требовать точного совпадения строки с эталоном, а можно засчитывать долю верных символов.
Разница не косметическая, и её нетрудно почувствовать. Метрика по принципу «всё или ничего» способна нарисовать резкий скачок там, где непрерывная показывает плавный рост. Набор ответов при этом не меняется ни на букву, меняется только правило, по которому его считают.
Тот же вопрос возникает и с другой стороны: что считать одной задачей. Набор из тысячи вопросов, девятьсот из которых устроены одинаково, меряет одно узкое умение, а выглядит как широкая проверка. Состав набора решает здесь не меньше, чем его размер и правило подсчёта.
Вокруг этого идёт спор о заявленных скачках способностей, и урок 8 разбирает его медленно. Здесь достаточно запомнить приём: спрашивая про балл, спрашивайте и про способ подсчёта. Выбор измерения способен создать явление, которого нет.
С кем именно сравнивают
Осталась половина заголовка, о которой обычно не думают вовсе. «Лучше среднего выпускника» это утверждение про людей, и человеческое число тоже откуда-то взялось. Часто оно старое, взято из чужой работы и получено совсем в других условиях.
Условия решают многое, потому что люди сдают экзамен не в вакууме. Человек работал по часам, без справочников и подсказок, после бессонной ночи и в чужой аудитории. У модели ограничения по времени нет вовсе, а сколько ей дать попыток, решает тот, кто проводит замер.
Отдельный вопрос, кто попал в число тех людей, с которыми сравнивают. «Средний выпускник» и «средний человек с улицы» отличаются в разы, а слово «средний» в заголовке одинаковое. Бывает и так, что сравнивают с уже сдавшими экзамен, то есть с прошедшими отбор, а не со всеми, кто пробовал.
Отсюда правило, которое стоит держать рядом с остальными. Сравнение человека и машины требует отдельного замера со своими условиями, а не бесплатного приложения к баллу модели. Если условия не описаны, сравнивать нечего, сколько бы процентов ни стояло в заголовке.
Четыре вопроса к заголовку
Соберём урок в инструмент, работающий без доступа к внутренностям системы. Увидев «модель сдала экзамен», задайте четыре вопроса. Ответы на них обычно короче самой новости и ищутся в первоисточнике.
Какой набор задач? «Экзамен по медицине» не адрес: у теста есть имя, состав и объём. Пока набор не назван, сравнивать результат просто не с чем.
Какой он даты и лежал ли в открытом доступе? Старый открытый набор мог попасть в обучение сам собой. У вопроса о том, проверяли ли загрязнение и каким способом, бывает проверяемый ответ.
Как считали балл и сколько было попыток? Один рекордный запуск и среднее по ста запускам дают разные утверждения о разных вещах. Правило подсчёта решает не меньше, чем сами ответы.
Что этот экзамен проверяет у людей? Здесь живёт валидность конструкта, и здесь чаще всего ломается вывод. У человека балл работает вместе с практикой, надзором и ответственностью. Отделив число от них, вы получаете число, а не специалиста.
Четыре вопроса выглядят занудно и не устаревают вместе с моделями. Общий приём чтения громких заявлений разбирает курс критического мышления. Здесь он повёрнут под конкретное устройство машинного обучения. Тем и полезен: место, где ломается вывод от балла к умению, у машин своё.
Что дальше
Итог урока звучит скромнее заголовков, зато держится. Балл это результат на конкретном наборе задач конкретной даты, посчитанный конкретным правилом. Всё остальное называют выводом, и у вывода есть условия, которые приходится проверять руками.
Из трёх бед не следует, что мерить бесполезно, и это важно не перепутать. Без общей линейки заявления о качестве вообще нельзя сравнивать между собой. Следует другое: результат читают с четырьмя вопросами, а не с восклицательным знаком.
Урок 15 берёт следующее заявление того же рода: модель рассуждает по шагам и показывает ход мысли. Мы разберём, что там измеримо, а что дописано сверху. Порядок будет тот же самый, сначала механизм, потом оценка.
А тренажёр стоит открыть прямо сейчас, до чтения дальше. Пять кнопок, две полосы, и расхождение видно уже на третьем нажатии. Закон Гудхарта проще увидеть, чем прочитать про него ещё раз.
Как поднять балл, не поумнев
Пять способов улучшить результат на публичном тесте. Четыре из них не добавляют ни капли умения, и полосы расходятся у вас на глазах.
Ключевые работы и результаты
| Чарльз Гудхарт | 1975 | Наблюдение о статистических закономерностях: как только по такой закономерности начинают управлять, она перестаёт выполняться. В широкий обиход мысль вошла в формулировке Мэрилин Стратерн. Когда мера становится целью, она перестаёт быть хорошей мерой. |
| Шеффер, Миранда и Коеджо, «Are Emergent Abilities of Large Language Models a Mirage?», NeurIPS | 2023 | Отмеченная работа конференции NeurIPS: часть заявленных скачков способностей создаётся выбором метрики. Разрывная метрика рисует скачок там, где непрерывная показывает плавный рост на тех же самых ответах. |
Что подтвердилось, а что нет
Экзамен проверяет узнавание типичных случаев по готовому описанию, а работа начинается раньше и состоит из другого: сбор сведений у путающегося человека, решение при неполных данных, ответственность за него. У людей балл работает как верхушка длинной конструкции из практики и надзора. Перенося число на машину, эту конструкцию выбрасывают молча и получают число, а не специалиста.
Тесты публикуют, а модели обучают на большой доле интернета, значит, задачи с ответами могли попасть в обучение по умолчанию. Тогда балл измеряет запоминание, а не способность справляться с новым. Осторожная версия утверждения выглядит так: модель показала столько-то процентов на таком-то наборе такой-то даты, и про проверку загрязнения сказано то-то.
Без общего набора задач заявления разных команд несопоставимы, и остаётся верить на слово. Именно общая линейка сделала видимым отрыв AlexNet в 2012 году: 15,3 % ошибки против 26,2 % у второго места. Из трёх бед бенчмарка следует не отказ от измерения, а привычка спрашивать про набор, дату, загрязнение и правило подсчёта.
Шеффер, Миранда и Коеджо в 2023 году взяли те же самые ответы моделей и пересчитали их непрерывной мерой: перелом исчезал, оставался предсказуемый рост. Работа получила Outstanding Paper на NeurIPS, то есть прошла разбор не только у авторов. Формулировать итог надо ровно так, как он получен: показано, что часть заявленных скачков создана выбором измерения. Про все скачки такого не показано, и спор об эмерджентности остаётся открытым отдельной позицией реестра. Ради практической половины запись и заведена: прежде чем объяснять скачок, посмотрите на шкалу, по которой его нарисовали.
Термины
- бенчмаркbenchmark
- Набор задач с известными ответами и правило, превращающее ответы в один балл. Даёт сравнимость между системами и приносит три беды: загрязнение, закон Гудхарта и вопрос о валидности конструкта.
- загрязнение бенчмаркаbenchmark contamination
- Тестовые задачи попали в обучающие данные. Для моделей, обученных на большой доле интернета, это состояние по умолчанию: тесты опубликованы в сети. Балл тогда измеряет запоминание, а не способность справляться с новым.
- закон ГудхартаGoodhart's law
- Когда мера становится целью, она перестаёт быть хорошей мерой. Формулировка Мэрилин Стратерн по мотивам работ Чарльза Гудхарта 1975 года. Злого умысла механизм не требует.
- валидность конструктаconstruct validity
- Совпадает ли измеряемое с тем, что хотели измерить. Успех на медицинском тесте не равен способности лечить: тест проверяет узнавание случаев по описанию, а не работу с человеком.
- функция потерьloss function
- Число, измеряющее, насколько ответы модели плохи: чем хуже, тем больше. Её выбор становится решением о том, что считать ошибкой, а не технической мелочью.
- искусственный интеллектartificial intelligence
- Область, занимающаяся задачами, для которых нет явного пошагового алгоритма решения. Общепринятого определения через свойства машины не существует.
Практикум · Разобрать один заголовок до первоисточника
Приём этого урока работает только руками. Пока не пройдёшь путь от новости до набора задач, кажется, что это долго и требует специальных знаний. Обычно это двадцать минут, и половина заголовков разваливается по дороге.
- Найдите свежую новость о том, что система показала рекордный результат на каком-нибудь тесте. Годится любая: сравнение моделей, медицинский экзамен, школьная олимпиада, задачи по программированию.
- Дойдите до первоисточника: статьи, отчёта или таблицы, на которую новость ссылается. Выпишите точное имя набора задач и год, когда набор опубликовали.
- Найдите, что в первоисточнике сказано про загрязнение: проверяли ли, что задачи не попали в обучение, и каким способом. Если про это не сказано ничего, это тоже ответ, и его стоит записать именно так.
- Выпишите правило подсчёта балла и число попыток: один запуск, среднее по нескольким, лучший из. Рядом запишите, с каким человеческим результатом сравнивают и откуда он взят.
- Ответьте письменно на один вопрос: что этот экзамен проверяет у людей и какая часть настоящей работы в него не входит. Сравните свой ответ с тем, что утверждал заголовок.
Вопросы для самопроверки
Задачи известного набора лежат в открытом доступе несколько лет, а модель обучена на большой доле интернета. Как называется проблема и что она делает с результатом?
- Переобучение: модель слишком сложна для данных и запомнила их вместо закономерности
- Закон Гудхарта: балл стал целью разработки и потому перестал быть хорошей мерой
- Загрязнение: балл начинает измерять запоминание, а не способность справляться с новым
- Валидность конструкта: измерено не то, что хотели измерить
Школу оценивают по доле сдавших экзамен, и школа начинает натаскивать на формат заданий и отговаривать слабых от сдачи. Что это за случай?
- Закон Гудхарта: мера стала целью и перестала быть хорошей мерой
- Загрязнение: ученики видели задания заранее, и балл измеряет память, а не подготовку
- Ошибка в выборе функции потерь
- Низкая валидность конструкта: экзамен измеряет не то знание, ради которого его вводили
Команде велено поднять балл на публичном тесте. Какой ход поднимает и балл, и умение решать задачи?
- Подогнать формат ответа под автоматическую проверку
- Прогнать сто попыток и опубликовать лучшую
- Выбрать тест, на котором система и так сильна
- Настоящее умение: учить модель на задачах того же рода, собранных отдельно от набора
Модель набрала высокий балл на экзамене по медицине. Что из этого следует?
- Она может заменить врача на приёме: балл выше человеческого, а значит и работу она выполнит не хуже
- Она хорошо отвечает на вопросы этого набора, а про способность лечить это говорит мало
- Ничего: экзамены для людей к машинам неприменимы вовсе, и такие замеры лишены смысла
- Смотря какой экзамен: по одним наборам вывод сделать можно, по другим нет
Что верно сказать про бенчмарки в целом?
- Мерить нужно: без общего набора задач заявления несопоставимы, но результат надо читать с вопросами
- Бенчмарки сводятся к чистому маркетингу: сравнивать по ним системы нельзя, и отказ от них ничего бы не потерял
- Хорошо составленный бенчмарк накрутить невозможно
- Достаточно опубликовать балл и название набора, чтобы результат можно было проверить и повторить
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Dive into Deep Learning (d2l.ai), главы об обобщении и выборе модели: Откуда взялось требование проверять на невиданных данных и почему в тест нельзя заглядывать. Выкладки можно пропускать, рассуждение читается отдельно от них.
- Ryan Schaeffer, Brando Miranda, Sanmi Koyejo, «Are Emergent Abilities of Large Language Models a Mirage?», NeurIPS 2023: Лучший известный пример того, как выбор метрики создаёт явление. Смысл понятен по графикам, даже если пропустить формулы целиком.
- Тренажёр «Как поднять балл, не поумнев» в этом уроке: Пять кнопок и две полосы. Нажмите все пять по очереди и посмотрите, на каком ходу разрыв становится неприличным.