К содержанию
Фонтум Основы статистики Урок 22 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль VII. Где статистика ломается · урок 22 из 24

Кризис воспроизводимости

Почему эффект в повторении систематически меньше опубликованного

Репликация это повторное проведение исследования, проверяющее, получится ли тот же результат на новых данных. Крупнейший проект, Open Science Collaboration 2015 года, повторил 100 психологических исследований: значимый результат дали 36 % против 97 % в оригиналах, а средний размер эффекта упал с r = 0,403 до примерно 0,20. Во всех больших проектах эффект в повторении систематически меньше опубликованного. Падение идёт только в одну сторону.

OSC 2015 · Camerer 2016, 2018 · 45 мин · обновлено 12.09.2026

После урока вы сможете

  • Называть числа четырёх больших проектов по воспроизводимости и то, что именно в них измерялось
  • Объяснять, почему систематическое падение размера эффекта ожидаемо без предположения о недобросовестности
  • Разбирать, что следует и что не следует из неудачной репликации
  • Формулировать корректное обновление убеждений вместо вывода «верить нечему»

В 2015 году в Science вышел отчёт коллектива Open Science Collaboration, силами которого были заново проведены 100 экспериментальных и корреляционных исследований из трёх ведущих психологических журналов. Задача была поставлена буквально: повторить процедуру и посмотреть, что получится.

Значимый результат был получен в 97 % оригинальных работ и в 36 % репликаций. Средний размер эффекта упал с r = 0,403 до примерно 0,20.

Из этих трёх чисел в публичный оборот ушло одно, и в форме, которая ему не принадлежит: «36 % психологии не воспроизводится». Урок посвящён тому, что на самом деле измерили этот и три соседних проекта, чем их результаты объясняются и какой вывод из них следует делать, а какой не следует, хотя очень хочется.

Сразу стоит обратить внимание на первое число, а не на второе. Доля значимых результатов в оригиналах составляет 97 %. В поле, где почти каждая опубликованная работа что-то находит, ненаходки не публикуются, о чём был двадцатый урок. Кризис виден уже здесь, до всякой репликации.

Четыре проекта и их числа

Open Science Collaboration, 2015, Science. Сто экспериментальных и корреляционных исследований из трёх ведущих психологических журналов. Значимый результат: 97 % в оригиналах, 36 % в репликациях. Средний размер эффекта r = 0,403 в оригиналах и около 0,20 в повторениях.

Camerer и др., 2016, Science. Восемнадцать лабораторных экспериментов из American Economic Review и Quarterly Journal of Economics за 2011-2014 годы. Важная деталь устройства: репликации планировались с мощностью не менее 90 %, то есть с запасом, при котором ссылаться на нехватку чувствительности уже трудно. Воспроизвелись 11 из 18, то есть 61 %. Размер эффекта в репликациях составил в среднем 66 % от исходного.

Camerer и др., 2018, Nature Human Behaviour. Двадцать один социально-научный эксперимент из Nature и Science за 2010-2015 годы, то есть работы из самых заметных журналов вообще. Планы анализа были предрегистрированы, и это прямо то средство против сада расходящихся троп, о котором шла речь в предыдущем уроке. Воспроизвелись 13 из 21, то есть 62 %. Размер эффекта составил около 50 % от исходного.

Many Labs 1, Klein и др., 2014. Устройство здесь другое: не по одной репликации на находку, а тринадцать эффектов, проверенных в 36 выборках, всего 6 344 участника. Воспроизвелись 10 из 13.

Разброс долей успеха от 36 до 62 % на первый взгляд выглядит как разница между полями: экономика и социальные науки надёжнее психологии. Такое чтение преждевременно. Проекты отличаются не только предметом, но и критерием успеха, набором отобранных работ, мощностью репликаций и тем, кто их проводил. Сравнивать 36 % из первой строки с 61 % из второй как две оценки одной величины нельзя: это разные величины.

Есть, однако, столбец, который читается поперёк всех четырёх строк и не зависит от выбора критерия.

об источникеЧто именно повторяли

Во всех четырёх проектах речь о прямой репликации, повторении процедуры оригинала настолько близко, насколько это возможно, на новых участниках. Это не проверка теории и не оценка её правдоподобия: проверяется одно конкретное утверждение о том, что при таких-то условиях получается такой-то результат.

Главное не проценты, а падение эффекта

Сложите три числа из правого столбца. В психологии средний размер эффекта упал с 0,403 примерно до 0,20, то есть вдвое. В экономике репликации дали в среднем 66 % от исходного, падение на треть. В социальных науках вышло около 50 % от исходного, снова вдвое.

Обратите внимание на свойство этого набора, которое важнее любой отдельной цифры: падение идёт в одну сторону. Ни в одном из проектов повторение в среднем не усилило эффект. Если бы дело было в случайных колебаниях, отклонения распределились бы в обе стороны примерно поровну, и половина репликаций дала бы величину больше исходной.

Это и есть результат, ради которого стоило проводить проекты. Отдельные доли успеха зависят от произвольного критерия и от состава отобранных работ, а систематическое направление сдвига не зависит ни от того, ни от другого. Именно поэтому в реестре курса статус выдержало не стоит ни у одной из этих долей: он стоит у утверждения о систематическом снижении и отдельно у измеримости разброса между выборками, ради которой и затевался Many Labs.

И у этого утверждения есть прямое практическое употребление, чего нельзя сказать о процентах. Читая о величине эффекта в свежей работе, разумно заранее ожидать, что при аккуратном повторении она окажется меньше. На вопрос, насколько меньше, эти проекты ответа не дают. Множители «вдвое» и «на треть» получены на 21 и 18 конкретных работах конкретных полей, и переносить их на произвольную статью значило бы сделать ровно то, о чём предупреждал первый раздел этого урока: обойтись с числом так, будто оно не зависит от условий, при которых получено. Надёжно здесь направление, а не коэффициент. И это не обвинение авторам: это поправка на процедуру, через которую результат попал вам на глаза.

Почему падение ожидаемо

Теперь соберём объяснение из двух предыдущих уроков. Оно не требует ни одного недобросовестного действия и получается чистой арифметикой.

Пусть в некоторой области истинные связи невелики: настоящая корреляция порядка r = 0,20. Пусть типичное исследование ведётся на 60 наблюдениях, обычном размере для лабораторного эксперимента. Порог значимости при 60 наблюдениях составляет примерно r = 0,25: связь слабее этой при таком объёме значимой не станет.

Отсюда всё и следует. Исследование, честно оценившее связь в 0,20, значимого результата не получит и в журнал не попадёт. Опубликованы будут ровно те выборки, где случайность подбросила оценку выше 0,25, а среднее по таким выборкам заметно превышает 0,25 и легко оказывается в районе 0,4. Литература показывает 0,4, истина равна 0,20, и никто не соврал: сработал порог плюс отбор публикаций по значимости.

Теперь проводится репликация на большой выборке. Порог значимости при большом объёме низкий, отбора нет, и репликация публикуется независимо от того, что получилось. Оценка выходит около 0,20, то есть примерно вдвое меньше опубликованной. Ровно то, что показали проекты.

К этому добавляются два усилителя из предыдущих уроков. Первый называют проклятием победителя: чем меньше мощность, тем сильнее завышена та оценка, которая пересекла порог. Второй это исследовательские степени свободы: если выбор ковариат, момента остановки и правила исключения делался уже по данным, оригинальная оценка вобрала в себя ещё и удачу этих решений, а репликация с фиксированным планом её не повторит.

Заметьте, что объяснение экономно: одна модель отбора покрывает и низкие доли успеха, и падение размера эффекта, и разницу между полями. Там, где эффекты крупнее и мощность выше, завышение меньше. Гипотезы о массовой недобросовестности для этого не требуется, и добавлять её значило бы объяснять уже объяснённое.

методПроверьте счёт сами

Порог значимости по корреляции при объёме 60 равен примерно 0,25, а при объёме 400 примерно 0,10. Возьмите истинное значение 0,20 и посмотрите, что публикуется в каждом случае. При 60 наблюдениях в журнал проходят только удачные выбросы вверх, при 400 почти всё подряд. Завышение опубликованных оценок исчезает не оттого, что исследователи стали честнее, а оттого, что выборки стали больше.

Что следует и что не следует из неудачной репликации

Здесь начинается место, где ошибаются чаще всего, причём в обе стороны сразу.

Неудачная репликация не доказывает, что исходный результат ложен. Она совместима с тремя разными положениями дел. Первое: оригинал был ложным срабатыванием, той самой одной работой из двадцати. Второе: репликация сама дала ложную ненаходку, потому что мощности не хватило. Именно поэтому в проекте Camerer и др. (2016) репликации планировали с мощностью не менее 90 %, чтобы это объяснение снять. Третье: эффект существует, но зависит от условий, которые в повторении не воспроизведены, от состава участников, от культурного контекста, от деталей процедуры. Такое неучтённое условие называют скрытым модератором.

Различить эти три случая по одной паре «оригинал и репликация» нельзя в принципе. Для этого и делают проекты вроде Many Labs 1, где каждый эффект проверяется не однажды, а в десятках выборок: тогда видно, держится ли он везде, нигде или в части условий, и объяснение через скрытый модератор становится проверяемым утверждением, а не отговоркой.

Вторая половина сюжета касается критерия успеха. Что считать воспроизведённым, вопрос не арифметический, а договорной, и решений тут по меньшей мере три. Можно требовать значимости в репликации при том же направлении эффекта. Можно требовать, чтобы исходная оценка попадала в интервал репликации. Можно требовать, чтобы величина эффекта была не меньше некоторой доли исходной. Три правила, применённые к одним и тем же данным, дают три разные доли успеха.

Именно вокруг этого шёл содержательный спор о проекте 2015 года: критика Gilbert и др. (2016) и ответ авторов проекта. Спор был не о том, честно ли посчитано, а о том, что означает выбранное определение успеха и какие следствия из него правомерны. Знать об этом стоит по той же причине, по какой знать о разборе Literary Digest: расхожая версия результата обычно короче и увереннее оригинала.

осторожноСимметричная ошибка

«Репликация провалилась, значит, эффекта нет» и «репликация провалилась, значит, репликаторы что-то сделали не так» повторяют одну и ту же ошибку, сделанную в разные стороны. Обе подставляют готовый вывод туда, где данных на вывод не хватает. Корректный ответ звучит скучно: результат под вопросом, и решается вопрос дальнейшими проверками, а не выбором удобной версии.

Против нигилизма

Остаётся вывод, к которому подталкивает всё вышеизложенное и который так же неверен, как доверчивость: «верить нечему».

Первое возражение процедурное. Все числа этого урока получены теми самыми методами, которые нигилистический вывод объявляет негодными: выборки, размеры эффектов, мощность, доверительные интервалы. Кризис воспроизводимости обнаружен не критиками извне, а самой дисциплиной и её же инструментами. Утверждение «статистике верить нельзя, ведь статистика показала, что ей нельзя верить» опровергает себя ровно тем способом, который разбирался в первом уроке применительно к тезису «статистикой можно доказать что угодно».

Второе возражение фактическое. Воспроизводимость не однородна. В Many Labs 1 из тринадцати эффектов держались десять, проверенные в 36 выборках на 6 344 участниках, а три не удержались. Это не приговор полю, а карта: одни находки устойчивы, другие нет, и содержательный вопрос в том, чем они отличаются. Вывод «верить нечему» стирает ровно ту разницу, ради которой проекты и затевались.

Третье возражение практическое. Корректное обновление убеждений здесь количественное, а не категорическое, и оно вполне выполнимо. Одно значимое исследование даёт слабое свидетельство, а не установленный факт. Опубликованный размер эффекта скорее верхняя оценка, чем средняя, и разумно ждать при повторении меньшего числа. Число независимых воспроизведений важнее престижа журнала. Эти три правила меняют поведение читателя, а «верить нечему» не меняет ничего, потому что не подсказывает ни одного действия.

И четвёртое, самое неудобное. Отказ от статистических свидетельств не оставляет человека ни с чем, а оставляет его с интуицией, систематические сбои которой разбирались в первом уроке: люди находят закономерности в случайных сериях, оценивают вероятность по яркости примера и не удерживают базовую частоту. Метод, ошибающийся в известной доле случаев и умеющий эту долю измерить, лучше метода, который ошибается неизвестно как часто и об этом не сообщает.

Итог урока и всего модуля удобно свести к одной замене в вопросе. Раньше читатель спрашивал: опубликовано ли это в приличном журнале. Теперь он спрашивает: воспроизведено ли это, сколько раз, кем и что стало с размером эффекта. Второй вопрос труднее и почти всегда имеет ответ хуже, чем хотелось бы, но именно он отличает знание от списка литературы.

Ключевые работы

Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science2015Сто экспериментальных и корреляционных исследований из трёх ведущих психологических журналов: значимый результат в 97 % оригиналов и 36 % репликаций, средний размер эффекта r = 0,403 против примерно 0,20.
Camerer и др., Science2016Восемнадцать лабораторных экспериментов из American Economic Review и Quarterly Journal of Economics за 2011-2014 годы. Репликации по заранее опубликованным планам анализа, с мощностью не менее 90 %: воспроизвелись 11 из 18 (61 %), размер эффекта в среднем 66 % от исходного.
Camerer и др., Nature Human Behaviour2018Двадцать один социально-научный эксперимент из Nature и Science за 2010-2015 годы с предрегистрированными планами анализа: воспроизвелись 13 из 21 (62 %), размер эффекта около 50 % от исходного.
Klein и др., Many Labs 12014Тринадцать эффектов, проверенных в 36 выборках, 6 344 участника: воспроизвелись 10 из 13. Устройство проекта позволяет отличать неустойчивость эффекта от неудачи отдельной репликации.

Что здесь путают

миф36 % психологии не воспроизводится.

Проект Open Science Collaboration (2015) получил долю значимых репликаций 36 % для 100 отобранных работ из трёх журналов. Это не доля воспроизводимого в психологии и вообще не оценка дисциплины. Критерий успеха при этом произволен: требование значимости, требование попадания исходной оценки в интервал репликации и требование сохранить долю величины эффекта дают разные числа на одних и тех же данных. Вокруг этого шёл содержательный спор, в него вошли критика Gilbert и др. (2016) и ответ авторов проекта. Устойчивая часть результата лежит в другом столбце: средний размер эффекта упал с r = 0,403 примерно до 0,20.

выдержалоРазмер эффекта в репликации систематически меньше исходного.

Держится во всех четырёх проектах и в одну сторону: 0,403 против примерно 0,20 в психологии, 66 % от исходного в экономике, около 50 % в социальных науках. Случайные колебания дали бы отклонения в обе стороны поровну, а здесь их нет. Объяснение экономно и не требует недобросовестности: порог значимости пропускает в литературу только выборки, где случайность сыграла вверх, и завышение тем больше, чем меньше мощность. Из этого следует рабочее правило чтения: опубликованная величина эффекта даёт верхнюю оценку, а не среднюю.

отвергнутоНеудачная репликация доказывает, что исходный результат был ложным.

Она совместима с тремя разными положениями дел: оригинал был ложным срабатыванием, репликация сама оказалась ложной ненаходкой из-за нехватки мощности, эффект существует, но зависит от невоспроизведённого условия. Различить их по одной паре работ невозможно, для этого и нужны проекты вроде Many Labs 1, где каждый эффект проверяется в десятках выборок. Симметричная ошибка не менее распространена: считать, что провал репликации всегда объясняется огрехами репликаторов. Обе версии подставляют вывод туда, где данных на него не хватает.

выдержалоРазброс результата между выборками становится измеримой величиной, если один протокол выполняют многие лаборатории.

Many Labs 1 (Klein и др., 2014) устроен не как остальные проекты: не по одной репликации на находку, а тринадцать эффектов на 36 выборках, всего 6 344 участника. Именно поэтому различие между выборками перестало быть предметом спора и стало числом. Статус стоит у измеримости разброса, а не у доли успеха: воспроизвелись 10 из 13, но эта доля зависит от того, какие эффекты отобраны и что считать успехом, и сравнивать её с 36 % или 61 % из других проектов нельзя, это разные величины.

Термины

репликацияreplication
Повторное проведение исследования с целью проверить, получится ли тот же результат на новых данных.
прямая репликацияdirect replication
Повторение процедуры оригинала настолько близко, насколько возможно, на новой выборке. Отличается от концептуальной репликации, которая проверяет ту же идею другим способом.
концептуальная репликацияconceptual replication
Проверка того же теоретического предсказания другой процедурой. При неудаче не позволяет отличить ложность исходного результата от неудачности новой процедуры.
воспроизводимость результатаreplicability
Свойство результата получаться заново при повторении процедуры независимой группой.
критерий успеха репликацииreplication success criterion
Правило, по которому репликация признаётся удавшейся: значимость в том же направлении, попадание исходной оценки в интервал репликации либо сохранение доли величины эффекта. Разные правила дают разные доли успеха на одних данных.
скрытый модераторhidden moderator
Не описанное в оригинале условие, от которого эффект зависит. Объяснение становится проверяемым только при сравнении многих выборок.
гетерогенность эффектаeffect heterogeneity
Различие величины эффекта между выборками или условиями сверх того, что объясняется случайностью.
многолабораторная репликацияmany-labs replication
Проверка одного эффекта параллельно в десятках лабораторий по единому протоколу. Отличает неустойчивость эффекта от неудачи отдельного повторения.
регистрируемый отчётregistered report
Формат публикации, при котором журнал принимает работу по описанию замысла и плана анализа, до получения результата.

Практикум · Три критерия успеха на одних данных

Здесь надо своими руками увидеть, что доля успешных репликаций зависит от выбранного определения успеха, а падение размера эффекта не зависит. Понадобятся бумага и калькулятор, около получаса.

  1. Запишите три правила успеха в проверяемом виде. (1) Репликация значима при том же направлении эффекта. (2) Исходная оценка попадает в интервал репликации. (3) Величина эффекта в репликации не меньше половины исходной.
  2. Составьте таблицу из десяти строк: в каждой стоят исходная величина эффекта, величина в репликации и границы интервала репликации. Пять строк сделайте такими, где репликация даёт примерно половину исходного и интервал широкий, а другие пять такими, где репликация даёт величину около нуля.
  3. Примените к таблице все три правила по очереди и посчитайте три доли успеха. Выпишите их рядом: это три разных числа, полученных из одних и тех же данных.
  4. Посчитайте среднее отношение величины эффекта в репликации к исходной по всем десяти строкам. Проверьте, меняется ли это число при переходе от одного правила к другому.
  5. Напишите два предложения: какое из четырёх чисел вы поставили бы в заголовок и что при этом потеряет читатель. Сравните свой выбор с формулировкой «36 % психологии не воспроизводится».

Вопросы для самопроверки

Вопрос 1

В проекте Open Science Collaboration (2015) значимый результат получен в 97 % оригинальных работ и в 36 % репликаций. Что говорит первое из этих чисел?

  • Что репликации были проведены хуже оригиналов
  • Что 3 % оригинальных работ содержали ошибки в расчётах
  • Что отбор в литературу шёл по значимости: поле, где находит почти каждая работа, не публикует ненаходки
  • Что 97 % психологических исследований выполнены методологически безупречно
Вопрос 2

Camerer и др. (2016): воспроизвелись 11 из 18, размер эффекта в среднем 66 % от исходного. Camerer и др. (2018): воспроизвелись 13 из 21, размер эффекта около 50 %. Что здесь общее и важное?

  • Провалы в обоих проектах объясняются недостаточной мощностью репликаций: повторы планировались на тех же объёмах, что и оригиналы
  • Размер эффекта в репликации в обоих случаях систематически меньше исходного
  • Доля успеха в обоих проектах ровно две трети
  • Обе доли выше психологических 36 %
Вопрос 3

Эффект не воспроизвёлся в тщательно спланированной репликации с высокой мощностью. Что из этого следует?

  • Что исходный результат под вопросом, но его ложность этим не доказана
  • Что эффект реален, но зависит от условий, которые не были воспроизведены
  • Что репликаторы отклонились от процедуры оригинала
  • Что исходный результат ложен
Вопрос 4

Что не так с формулировкой «36 % психологии не воспроизводится»?

  • Цифра занижена: в действительности не воспроизводится большая доля, потому что неудачные репликации тоже не публикуются
  • Это доля значимых репликаций для 100 работ из трёх журналов, и сам критерий успеха произволен
  • Проект не проходил рецензирование, поэтому его числа нельзя цитировать: отчёт вышел препринтом и в журнал не подавался
  • Ничего: это точная передача результата проекта 2015 года, и формулировка совпадает с авторской
Вопрос 5

Читатель делает вывод: «раз воспроизводится меньше половины, доверять нельзя ничему». Что с этим выводом?

  • Он верен: без независимого воспроизведения результат знанием не является, а воспроизвелось меньше половины работ
  • Он верен для психологии и неверен для экономики: в экономике эффекты воспроизводятся полностью
  • Он неверен так же, как доверчивость: эти числа получены теми же методами, а корректное обновление количественное
  • Он неверен, потому что все неудачи репликаций объясняются различием условий: эффекты реальны, просто чувствительны к обстановке

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science, 2015: Первоисточник самой цитируемой цифры модуля. Читать стоит ради раздела о критериях успеха: их несколько, и они дают разные ответы.
  • Gilbert и др., комментарий к проекту воспроизводимости, 2016, и ответ авторов проекта: Спор о том, что означает выбранное определение успеха. Полезен как пример содержательной, а не риторической критики.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?