Революция достоверности в экономике
Как поле перешло от спора о моделях к спору о том, что измерено
Революция достоверности в экономике это сдвиг последних тридцати лет к вопросу о том, что можно установить данными: откуда взят вывод и с чем сравнивали. Нобелевские премии 2019 и 2021 годов присуждены за метод, а не за находку. Пересчёт работы о долге и росте показал, что из среднего выпали пять стран, и после исправления рост при долге выше 90 % ВВП оказался плюс 2,2 % вместо опубликованных минус 0,1 %.
Нобелевские премии 2019 и 2021 · Herndon, Ash, Pollin, 2013 · Camerer и др., 2016 · 45 мин · обновлено 12.09.2026
После урока вы сможете
- Различать утверждение, следующее из модели, и утверждение, полученное измерением
- Объяснять, за что именно присуждены Нобелевские премии 2019 и 2021 годов и почему это премии за метод
- Восстанавливать, как была найдена ошибка в широко цитировавшейся работе, и что из этого случая следует
- Отличать проверку расчёта от повторения исследования и называть, что ловит каждая процедура
В 2013 году аспирант Университета Массачусетса в Амхерсте делал обычную для эконометрического курса работу: взять опубликованную статью и повторить её расчёт по исходным данным. Он взял работу Кармен Рейнхарт и Кеннета Рогоффа «Growth in a Time of Debt», из которой следовало, что при отношении государственного долга к ВВП выше 90 % рост становится отрицательным, и на которую ссылались политики, обосновывая программы жёсткой экономии.
Числа не сошлись. Аспирант попросил у авторов таблицу, и авторы её прислали. В таблице формула среднего не была растянута на пять строк, и из расчёта выпали Дания, Канада, Бельгия, Австрия и Австралия. Нашлись и два спорных решения: об исключении части данных и о способе взвешивания. После исправления средний рост при отношении долга к ВВП выше 90 % оказался +2,2 % вместо опубликованных −0,1 %.
У этой истории два прочтения. Первое: экономистам нельзя верить, они ошиблись в электронной таблице. Второе: так и выглядит дисциплина, которая себя проверяет, ведь ошибку нашли и опубликовали сами экономисты, ровно той процедурой, которая для этого и существует. Урок о том, какое прочтение верно и что за тридцать лет изменилось в поле, сделав второе прочтение возможным.
Модель и измерение
Половина путаницы вокруг экономики держится на том, что два совершенно разных вида утверждений произносятся одинаковым тоном.
Модельное утверждение имеет вид «если выполняются такие-то допущения, то следует такое-то». Например: если спрос на труд убывает по цене, а рынок конкурентен, то цена труда, установленная выше равновесной, сокращает число нанятых. Это утверждение верно так же, как верна теорема: оно выведено, а не измерено. Спорить с ним, не трогая допущений, бессмысленно.
Эмпирическое утверждение имеет вид «в такой-то ситуации наблюдалось такое-то». Например: в заведениях быстрого питания Нью-Джерси после апреля 1992 года занятость не снизилась. Оно проверяется данными и только ими, а верным или неверным оказывается для конкретного места и времени.
Эти два утверждения не противоречат друг другу и не могут противоречить: они о разном. Модель говорит, что следует из допущений, а измерение фиксирует, что было. Если измерение расходится с моделью, это означает, что какое-то допущение здесь не выполняется, и подсказывает, какое проверять первым. Ошибкой становится не расхождение, а подмена: модельный вывод, произнесённый без оговорки о допущениях, и измерение, произнесённое как закон природы.
Именно здесь и произошёл сдвиг, который называют революцией достоверности. Дело не в том, что экономисты перестали строить модели. Модели никуда не делись, и добрая половина этого курса о них. Изменилось требование по умолчанию. Тридцать лет назад на семинаре первым делом спрашивали, из какой модели это следует. Сейчас первый вопрос другой: откуда вы это знаете, что с чем сравнивалось, кто был контрольной группой.
Продолжение врезки шестнадцатого урока: там приём давался по форме утверждения, а здесь он даётся по способу опровержения. Модельное утверждение опровергается только показом, что допущение здесь не выполняется, и данные сами по себе его не трогают. Эмпирическое опровергается другими данными, а ссылка на теорию его не спасает. Если вы не можете сказать, какое из двух опровержений уместно, значит, утверждение сформулировано так, что в нём смешаны оба, и это уже находка. Третий и последний вид того же приёма ждёт в двадцать четвёртом уроке.
Две премии за метод
Внешним свидетельством сдвига служат две Нобелевские премии подряд, обе присуждённые не за результат, а за способ его получать.
2019 год, Абхиджит Банерджи, Эстер Дюфло и Майкл Кремер, формулировка: «за экспериментальный подход к борьбе с глобальной бедностью». Кремер с коллегами в середине 1990-х показал силу подхода на полевых экспериментах в школах западной Кении, а Банерджи и Дюфло распространили его на другие вопросы и страны. Вклад состоит в переносе рандомизированного эксперимента в экономику развития и в оценке не только эффекта вмешательства, но и его стоимости. В том же сообщении комитета приведено следствие: как прямой результат одного из исследований лауреатов программами дополнительных занятий в школах охвачено более пяти миллионов индийских детей.
2021 год, половина премии Дэвиду Карду «за эмпирический вклад в экономику труда», вторая половина совместно Джошуа Ангристу и Гвидо Имбенсу «за методологический вклад в анализ причинных связей». Слово «методологический» стоит прямо в формулировке. Экономист не может назначить стране закон, как медик назначает лекарство, поэтому берёт ситуации, созданные реальностью: закон изменился в одном штате и не изменился в соседнем, призыв распределён лотереей, дата рождения решает, в каком году ребёнок пошёл в школу. Ангрист и Имбенс в середине 1990-х решили методологические проблемы, из-за которых из таких ситуаций раньше нельзя было делать точные причинные выводы.
Разница между двумя премиями состоит в том, кто бросает жребий. В 2019 году жребий в руках исследователя. В 2021 году его бросает реальность, а исследователь его находит и доказывает, что это действительно был жребий. Общее у них важнее различия: премия за метод меняет не список известных фактов, а то, что в поле считается аргументом. Отдельный результат может быть опровергнут, и тогда премия за него состарится вместе с ним. Способ проверять переживает любой отдельный результат.
Ни та ни другая формулировка при этом не утверждает, что метод работает всегда. Двадцатый урок разбирает, чего стоит полевой эксперимент и чего он не даёт. Двадцать первый показывает, что делают, когда эксперимент невозможен, и на каком допущении держится вывод тогда.
Пересчёт, который стал учебным случаем
Вернёмся к таблице, с которой начался урок, и доведём разбор до конца: это самый инструктивный случай в модуле.
Херндон, Эш и Поллин нашли три разные по природе вещи. Первая оказалась прямой ошибкой: формула среднего не была растянута на пять строк, и пять стран не попали в расчёт. Вторая состоит в спорном исключении части наблюдений. Третья касается способа взвешивания, тоже спорного: считать ли каждую страну одним наблюдением или каждый год в каждой стране. Первое и есть ошибка, о которой спорить нечего. Второе и третье относятся к решениям, о которых спорить можно, и стороны спорят до сих пор.
Итог арифметики: было −0,1 %, стало +2,2 %. Разница составляет 2,3 процентных пункта, и вся политическая нагрузка держалась не на величине, а на знаке. Отрицательный рост за порогом выглядит как обрыв, за которым что-то принципиально меняется. Положительный читается как продолжение той же плавной картины, где высокий долг связан с медленным ростом, но никакого рубежа нет. Порог в 90 % как рубеж, за которым рост становится отрицательным, из данных не следует.
Дальше требуется аккуратность, потому что тема заряжена. Вопрос, сокращать ли расходы в спад, этой работой не решается ни в одну сторону. В нём есть ценностная часть. Она о том, кто несёт издержки и когда. Есть и другие эмпирические части, у каждой из которых своя литература. Опровергнуто одно конкретное утверждение: что существует порог в 90 % ВВП, за которым рост меняет знак. Опровержение довода в пользу решения не становится доводом против решения. Это разные вещи, и смешивать их так же неправильно, как было неправильно опираться на непроверенный расчёт.
И главное, ради чего случай стоит в этом уроке. Ошибку такого рода нельзя найти чтением. Нерастянутая формула в тексте статьи неотличима от осознанного решения: она оставляет след только в файле. Её ловит единственная процедура, попытка воспроизвести расчёт по тем же данным, и работает она лишь тогда, когда данные и код доступны. Здесь проверка стала возможной потому, что авторы, когда их попросили, файл передали. Требование выкладывать данные и код вместе со статьёй, которое сегодня есть у ведущих экономических журналов, существует ровно затем, чтобы это не зависело от доброй воли.
Когда рушится расчёт, на который ссылались сторонники решения, соблазн прочитать это как аргумент в пользу противоположного решения очень велик. Логически из падения одного довода не следует ничего о самом решении: остаются другие доводы и остаётся ценностная часть вопроса, которую данные не закрывают. Это правило работает в обе стороны и применяется в курсе ко всем политически заряженным сюжетам.
Проверить расчёт и повторить исследование
Слово «воспроизводимость» покрывает две разные процедуры, и различать их полезно: они ловят разное и стоят разного.
Проверка расчёта: те же данные, тот же код, выходят ли те же числа? Ловит ошибки в вычислении и спорные решения об обработке, которые в тексте статьи не видны. Стоит недорого: нужны файлы и несколько дней. Случай Рейнхарт и Рогоффа и есть ровно эта процедура.
Повторение исследования: новые данные, тот же замысел, и тот же ли вывод? Ловит другое: эффекты, которых на самом деле нет, а в первой работе они получились случайно. Стоит дорого, потому что это новый сбор данных.
Цифры повторения в экономике есть, и они не катастрофические и не успокаивающие. Camerer и др. (2016) повторили 18 лабораторных экспериментов из American Economic Review и Quarterly Journal of Economics с 2011 по 2014 год. Планы анализа публиковались заранее, мощность репликаций держалась не менее 90 % для обнаружения исходного размера эффекта на уровне 5 %. Значимый эффект в том же направлении получен в 11 из 18 случаев, то есть в 61 %. Размер эффекта в репликациях составил в среднем 66 % от исходного.
Читать это надо осторожно. Число 61 % относится к лабораторным экспериментам определённого типа из двух журналов за четыре года. Это не доля верных утверждений в экономике и не может ею быть. Существеннее другое: мощность не менее 90 % означает, что репликации были построены так, чтобы обнаружить исходный эффект, если он есть. При такой мощности «не нашли» становится информативным результатом, а не признаком слабой работы.
Систематическое снижение размера эффекта при повторении составляет отдельное явление, и объясняется оно устройством отбора публикаций, а не чьей-то недобросовестностью. Механизм разобран в курсе статистики этой школы, в уроке о мощности и проклятии победителя. Здесь достаточно знать, что падение до двух третей есть ожидаемое поведение системы, а не аномалия. Нашему курсу принадлежит другая часть: что дисциплина с этим сделала. Сделала она две вещи, и обе процедурные. Потребовала данные и код при публикации. И завела реестр, куда план анализа рандомизированного исследования регистрируется до того, как собраны данные, чтобы потом было видно, что именно собирались проверять.
Camerer и др., «Evaluating replicability of laboratory experiments in economics», Science, 2016. Те же числа приведены в курсе статистики этой школы, где разобрано, почему размер эффекта при повторении систематически падает. Здесь они нужны для другого: показать, что дисциплина считает свою воспроизводимость сама и публикует результат независимо от того, каким он вышел.
Чего революция не отменила
Честность требует назвать и обратную сторону, тем более что называют её сами участники сдвига.
Метод хорошо отвечает на узкие вопросы и молчит о широких. Можно проверить, повышает ли конкретная программа посещаемость в конкретных школах. Нельзя разыграть жребием валютный режим страны, устройство пенсионной системы или темп роста за полвека: не с чем сравнивать и некому бросить монету. Значительная часть того, о чём общество спрашивает экономистов, лежит именно в этой области, и достоверность там достигается иначе, сходимостью разнородных свидетельств, а не одним решающим замером.
Отсюда риск смещения повестки. Если карьера строится на достоверно измеримом, вопросы начинают выбираться по признаку проверяемости, а не важности. Это возражение предъявляют революции достоверности её же серьёзные сторонники, и оно не снимается тем, что метод хорош.
И измеренный эффект остаётся привязанным к месту. Результат, полученный в конкретных школах, на конкретных людях, при конкретном исполнителе, не переносится в другую страну автоматически. Это не мелкая оговорка, а основное содержательное ограничение подхода, и следующий урок посвящён ему целиком.
Из урока стоит вынести в виде привычки два вопроса к любому экономическому утверждению. Первый: это следствие модели или результат измерения? Второй, если измерения: с чем сравнивали и почему сравниваемые группы сопоставимы? Ответы на них дают больше, чем знание любого отдельного результата, и именно им посвящены два оставшихся урока модуля.
Ключевые работы
| Herndon, Ash, Pollin, критика работы Рейнхарт и Рогоффа «Growth in a Time of Debt», Университет Массачусетса в Амхерсте | 2013 | Попытка воспроизвести расчёт вскрыла три проблемы: пять стран, выпавших из среднего из-за нерастянутой формулы, спорное исключение части данных и спорный способ взвешивания. После исправления средний рост при долге выше 90 % ВВП равен +2,2 % вместо опубликованных −0,1 %. |
| Camerer и др., «Evaluating replicability of laboratory experiments in economics», Science | 2016 | Повторены 18 лабораторных экономических экспериментов при мощности репликаций не менее 90 %: значимый эффект в том же направлении в 11 из 18 случаев, размер эффекта в среднем 66 % от исходного. |
Что подтвердилось, а что нет
Утверждение опиралось на одну работу, расчёт которой не воспроизвёлся. После исправления ошибки в таблице и пересмотра двух спорных решений средний рост при отношении долга к ВВП выше 90 % оказался +2,2 % вместо опубликованных −0,1 %: знак меняется, а вместе с ним исчезает и сам порог как рубеж. Связь высокого долга с медленным ростом в данных остаётся, но она плавная, её направление отдельно не установлено, и никакого особого значения у отметки в 90 % нет.
Ошибка действительно была и действительно меняла знак результата. Но нашли её и опубликовали сами экономисты, и помогла им попытка воспроизвести чужой расчёт по исходным данным, единственная процедура, которая такие вещи находит. Случай свидетельствует о том, что проверка работает, а не о том, что её нет. Обратное прочтение к тому же самоопровергается: если экономическим расчётам верить нельзя вовсе, то нельзя верить и пересчёту, на который это прочтение опирается.
Это констатация о том, как сегодня устроена работа, а не оценка отдельных результатов. Ведущие журналы требуют вместе со статьёй данные и код. Полевые эксперименты Американская экономическая ассоциация требует регистрировать в своём реестре, и по правилу журналов ассоциации сделать это нужно до подачи статьи в печать. Две Нобелевские премии подряд присуждены за метод, а не за находку. Одна оговорка обязательна, иначе пункт читается сильнее, чем он есть: реестр прямо разрешает регистрацию на любой стадии испытания, включая завершённое, поэтому запись в нём сама по себе не доказывает, что план анализа был зафиксирован до сбора данных. Для этого надо смотреть на дату. При этом сдвиг не означает отказа от моделей, а изменилось то, что считается достаточным основанием для утверждения о реальности.
Camerer и др. (2016) повторили 18 лабораторных экспериментов из American Economic Review и Quarterly Journal of Economics с 2011 по 2014 год: планы анализа публиковались заранее, мощность репликаций была не ниже 90 % для обнаружения исходного размера эффекта. Значимый эффект в том же направлении получен в 11 случаях из 18, а размер эффекта в повторениях составил в среднем 66 % от исходного. Оговорки две, и обе обязательны. Доля 11 из 18 относится к лабораторным экспериментам определённого типа из двух журналов за четыре года и долей верных утверждений в экономике не является. И само снижение не признак недобросовестности, а ожидаемое поведение системы, отбирающей публикации по значимости. Механизм разобран в курсе статистики этой школы.
Термины
- революция достоверностиcredibility revolution
- Сдвиг экономической науки за последние тридцать лет к выяснению того, что можно установить данными: обязательным стал вопрос о том, откуда взят вывод и с чем сравнивалось.
- модельное утверждениеmodel-based claim
- Утверждение вида «если выполняются такие-то допущения, то следует такое-то». Опровергается показом, что допущение здесь не выполняется, а не данными самими по себе.
- эмпирическое утверждениеempirical claim
- Утверждение вида «в такой-то ситуации наблюдалось такое-то». Относится к конкретному месту и времени и проверяется только данными.
- причинный выводcausal inference
- Заключение о том, что изменилось бы, если бы воздействия не было. Обеспечивается устройством исследования, а не обработкой чисел.
- вычислительная воспроизводимостьcomputational reproducibility
- Получение тех же чисел из тех же данных тем же кодом. Ловит ошибки вычисления и спорные решения об обработке, не видимые в тексте статьи.
- репликацияreplication
- Повторение исследования на новых данных по тому же замыслу. Ловит эффекты, которых нет, а в исходной работе они получились случайно.
- предварительная регистрацияpreregistration
- Фиксация плана анализа до сбора данных, обычно в открытом реестре. Позволяет отличить проверку заранее заявленной гипотезы от находки, сделанной после просмотра данных.
- политика доступности данных и кодаdata and code availability policy
- Требование журнала выкладывать материалы расчёта вместе со статьёй. Делает проверку расчёта возможной независимо от согласия авторов.
Практикум · Дойти до первоисточника одного числа
Задание на живом материале: взять экономическое утверждение из новостей и довести его до того места, где видно, модель это или измерение и можно ли расчёт проверить. Двадцать-сорок минут.
- Найдите в новостях или в публичном отчёте за последнюю неделю экономическое утверждение с числом: «ставка выше такой-то замедляет рост», «программа дала столько-то процентов», «налог принесёт столько-то».
- Дойдите до первоисточника: не до пересказа и не до пресс-релиза, а до работы или до таблицы, откуда число взято. Запишите, за сколько переходов вы туда добрались и на каком из них число впервые изменилось или потеряло оговорку.
- Определите вид утверждения. Если перед вами следствие модели, выпишите допущения, при которых оно выведено. Если перед вами измерение, выпишите, что именно измерялось, у кого и с чем сравнивалось.
- Проверьте, выложены ли данные и код. Если выложены, откройте и найдите, какие наблюдения в расчёт вошли, а какие исключены и на каком основании. Если не выложены, так и запишите: расчёт непроверяем.
- Сформулируйте одним предложением, что должно было бы оказаться неверным, чтобы утверждение рухнуло. Для модельного утверждения это допущение, а для эмпирического свойство группы сравнения.
Вопросы для самопроверки
В отчёте написано: «Повышение налога на товар сократит его потребление». Никаких данных о конкретном рынке не приводится. Что это за утверждение?
- Эмпирическое: оно о том, что произойдёт в реальности
- Модельное: оно выведено из допущений, а величина и даже наличие эффекта на конкретном рынке остаются отдельным вопросом
- Ни то ни другое: это прогноз, а прогнозы вне разделения
- Эмпирическое, если такой налог где-нибудь уже вводился: тогда утверждение опирается на состоявшийся опыт, а не на рассуждение
Почему ошибку в работе Рейнхарт и Рогоффа нашли попыткой воспроизвести расчёт, а не внимательным чтением статьи?
- Потому что статья была написана слишком сложно
- Потому что авторы отказывались раскрывать данные, и добраться до расчёта удалось только после долгой борьбы за доступ к файлу
- Потому что рецензенты не читали её достаточно внимательно
- Потому что формула, не растянутая на пять строк, не оставляет следа в тексте: увидеть её можно только повторив вычисление
Camerer и др. (2016) повторили 18 лабораторных экономических экспериментов при мощности не менее 90 % и получили значимый эффект в том же направлении в 11 случаях. Какой вывод отсюда НЕ следует?
- Что примерно 61 % экономических утверждений верны
- Что часть опубликованных эффектов при повторении не воспроизводится
- Что репликации были спланированы так, чтобы обнаружить исходный эффект, если он есть
- Что размеры эффектов при повторении оказались систематически меньше исходных
Учебный пример. Две работы об одной программе. Первая строит модель поведения фирм и выводит, что издержки должны упасть на 8 %. Вторая сравнивает фирмы, попавшие и не попавшие в программу по лотерее, и измеряет падение на 3 %. Что верно?
- Вторая работа опровергает первую
- Первая точнее, потому что опирается на понимание механизма, тогда как сравнение по лотерее ловит только внешнюю сторону дела и механизма не объясняет
- Работы отвечают на разные вопросы: одна говорит, что следует из допущений, а другая сообщает, что наблюдалось у попавших в лотерею
- Расхождение означает арифметическую ошибку в одной из работ
Что означает статус «миф» для утверждения «экономистам нельзя верить, они ошиблись в таблице»?
- Что ошибки в таблице на самом деле не было: статус «миф» ставят утверждениям, у которых нет фактической основы
- Что ошибка была, но нашли и опубликовали её сами экономисты, причём той процедурой, которая для этого существует
- Что ошибка была, но незначительная: после исправления средний рост почти не изменился, и вывод о пороге в 90 % устоял
- Что о подобных случаях не следует говорить публично
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Пресс-релизы Нобелевского комитета по экономике за 2019 и 2021 годы, nobelprize.org: Формулировки премий из первых рук. В сообщении 2021 года слово «методологический» стоит прямо в тексте награждения.
- Herndon, Ash, Pollin, критика работы Рейнхарт и Рогоффа, 2013: Полный разбор трёх найденных проблем с таблицами и пересчётом. Читается как учебник по тому, что именно делает проверка расчёта.
- Курс статистики этой школы, уроки о мощности и о том, как устанавливают причину: Там разобраны проклятие победителя, рандомизация и естественные эксперименты как род свидетельства. Здесь на это опираются, а не пересказывают.
- AEA RCT Registry, страница «About the AEA RCT Registry», aeaweb.org/journals/policies/rct-registry: Дословно: полевые эксперименты должны быть зарегистрированы до подачи статьи в печать, а регистрировать разрешено «during any phase of the trial: forthcoming, ongoing, or completed». Страница на две минуты чтения, и она сразу показывает, чего запись в реестре не доказывает. Снято 22 августа 2026 года.