Кризис воспроизводимости
Почему эффект в повторении систематически меньше опубликованного
Репликация это повторное проведение исследования, проверяющее, получится ли тот же результат на новых данных. Крупнейший проект, Open Science Collaboration 2015 года, повторил 100 психологических исследований: значимый результат дали 36 % против 97 % в оригиналах, а средний размер эффекта упал с r = 0,403 до примерно 0,20. Во всех больших проектах эффект в повторении систематически меньше опубликованного. Падение идёт только в одну сторону.
OSC 2015 · Camerer 2016, 2018 · 45 мин · обновлено 12.09.2026
После урока вы сможете
- Называть числа четырёх больших проектов по воспроизводимости и то, что именно в них измерялось
- Объяснять, почему систематическое падение размера эффекта ожидаемо без предположения о недобросовестности
- Разбирать, что следует и что не следует из неудачной репликации
- Формулировать корректное обновление убеждений вместо вывода «верить нечему»
В 2015 году в Science вышел отчёт коллектива Open Science Collaboration, силами которого были заново проведены 100 экспериментальных и корреляционных исследований из трёх ведущих психологических журналов. Задача была поставлена буквально: повторить процедуру и посмотреть, что получится.
Значимый результат был получен в 97 % оригинальных работ и в 36 % репликаций. Средний размер эффекта упал с r = 0,403 до примерно 0,20.
Из этих трёх чисел в публичный оборот ушло одно, и в форме, которая ему не принадлежит: «36 % психологии не воспроизводится». Урок посвящён тому, что на самом деле измерили этот и три соседних проекта, чем их результаты объясняются и какой вывод из них следует делать, а какой не следует, хотя очень хочется.
Сразу стоит обратить внимание на первое число, а не на второе. Доля значимых результатов в оригиналах составляет 97 %. В поле, где почти каждая опубликованная работа что-то находит, ненаходки не публикуются, о чём был двадцатый урок. Кризис виден уже здесь, до всякой репликации.
Четыре проекта и их числа
Open Science Collaboration, 2015, Science. Сто экспериментальных и корреляционных исследований из трёх ведущих психологических журналов. Значимый результат: 97 % в оригиналах, 36 % в репликациях. Средний размер эффекта r = 0,403 в оригиналах и около 0,20 в повторениях.
Camerer и др., 2016, Science. Восемнадцать лабораторных экспериментов из American Economic Review и Quarterly Journal of Economics за 2011-2014 годы. Важная деталь устройства: репликации планировались с мощностью не менее 90 %, то есть с запасом, при котором ссылаться на нехватку чувствительности уже трудно. Воспроизвелись 11 из 18, то есть 61 %. Размер эффекта в репликациях составил в среднем 66 % от исходного.
Camerer и др., 2018, Nature Human Behaviour. Двадцать один социально-научный эксперимент из Nature и Science за 2010-2015 годы, то есть работы из самых заметных журналов вообще. Планы анализа были предрегистрированы, и это прямо то средство против сада расходящихся троп, о котором шла речь в предыдущем уроке. Воспроизвелись 13 из 21, то есть 62 %. Размер эффекта составил около 50 % от исходного.
Many Labs 1, Klein и др., 2014. Устройство здесь другое: не по одной репликации на находку, а тринадцать эффектов, проверенных в 36 выборках, всего 6 344 участника. Воспроизвелись 10 из 13.
Разброс долей успеха от 36 до 62 % на первый взгляд выглядит как разница между полями: экономика и социальные науки надёжнее психологии. Такое чтение преждевременно. Проекты отличаются не только предметом, но и критерием успеха, набором отобранных работ, мощностью репликаций и тем, кто их проводил. Сравнивать 36 % из первой строки с 61 % из второй как две оценки одной величины нельзя: это разные величины.
Есть, однако, столбец, который читается поперёк всех четырёх строк и не зависит от выбора критерия.
Во всех четырёх проектах речь о прямой репликации, повторении процедуры оригинала настолько близко, насколько это возможно, на новых участниках. Это не проверка теории и не оценка её правдоподобия: проверяется одно конкретное утверждение о том, что при таких-то условиях получается такой-то результат.
Главное не проценты, а падение эффекта
Сложите три числа из правого столбца. В психологии средний размер эффекта упал с 0,403 примерно до 0,20, то есть вдвое. В экономике репликации дали в среднем 66 % от исходного, падение на треть. В социальных науках вышло около 50 % от исходного, снова вдвое.
Обратите внимание на свойство этого набора, которое важнее любой отдельной цифры: падение идёт в одну сторону. Ни в одном из проектов повторение в среднем не усилило эффект. Если бы дело было в случайных колебаниях, отклонения распределились бы в обе стороны примерно поровну, и половина репликаций дала бы величину больше исходной.
Это и есть результат, ради которого стоило проводить проекты. Отдельные доли успеха зависят от произвольного критерия и от состава отобранных работ, а систематическое направление сдвига не зависит ни от того, ни от другого. Именно поэтому в реестре курса статус выдержало не стоит ни у одной из этих долей: он стоит у утверждения о систематическом снижении и отдельно у измеримости разброса между выборками, ради которой и затевался Many Labs.
И у этого утверждения есть прямое практическое употребление, чего нельзя сказать о процентах. Читая о величине эффекта в свежей работе, разумно заранее ожидать, что при аккуратном повторении она окажется меньше. На вопрос, насколько меньше, эти проекты ответа не дают. Множители «вдвое» и «на треть» получены на 21 и 18 конкретных работах конкретных полей, и переносить их на произвольную статью значило бы сделать ровно то, о чём предупреждал первый раздел этого урока: обойтись с числом так, будто оно не зависит от условий, при которых получено. Надёжно здесь направление, а не коэффициент. И это не обвинение авторам: это поправка на процедуру, через которую результат попал вам на глаза.
Почему падение ожидаемо
Теперь соберём объяснение из двух предыдущих уроков. Оно не требует ни одного недобросовестного действия и получается чистой арифметикой.
Пусть в некоторой области истинные связи невелики: настоящая корреляция порядка r = 0,20. Пусть типичное исследование ведётся на 60 наблюдениях, обычном размере для лабораторного эксперимента. Порог значимости при 60 наблюдениях составляет примерно r = 0,25: связь слабее этой при таком объёме значимой не станет.
Отсюда всё и следует. Исследование, честно оценившее связь в 0,20, значимого результата не получит и в журнал не попадёт. Опубликованы будут ровно те выборки, где случайность подбросила оценку выше 0,25, а среднее по таким выборкам заметно превышает 0,25 и легко оказывается в районе 0,4. Литература показывает 0,4, истина равна 0,20, и никто не соврал: сработал порог плюс отбор публикаций по значимости.
Теперь проводится репликация на большой выборке. Порог значимости при большом объёме низкий, отбора нет, и репликация публикуется независимо от того, что получилось. Оценка выходит около 0,20, то есть примерно вдвое меньше опубликованной. Ровно то, что показали проекты.
К этому добавляются два усилителя из предыдущих уроков. Первый называют проклятием победителя: чем меньше мощность, тем сильнее завышена та оценка, которая пересекла порог. Второй это исследовательские степени свободы: если выбор ковариат, момента остановки и правила исключения делался уже по данным, оригинальная оценка вобрала в себя ещё и удачу этих решений, а репликация с фиксированным планом её не повторит.
Заметьте, что объяснение экономно: одна модель отбора покрывает и низкие доли успеха, и падение размера эффекта, и разницу между полями. Там, где эффекты крупнее и мощность выше, завышение меньше. Гипотезы о массовой недобросовестности для этого не требуется, и добавлять её значило бы объяснять уже объяснённое.
Порог значимости по корреляции при объёме 60 равен примерно 0,25, а при объёме 400 примерно 0,10. Возьмите истинное значение 0,20 и посмотрите, что публикуется в каждом случае. При 60 наблюдениях в журнал проходят только удачные выбросы вверх, при 400 почти всё подряд. Завышение опубликованных оценок исчезает не оттого, что исследователи стали честнее, а оттого, что выборки стали больше.
Что следует и что не следует из неудачной репликации
Здесь начинается место, где ошибаются чаще всего, причём в обе стороны сразу.
Неудачная репликация не доказывает, что исходный результат ложен. Она совместима с тремя разными положениями дел. Первое: оригинал был ложным срабатыванием, той самой одной работой из двадцати. Второе: репликация сама дала ложную ненаходку, потому что мощности не хватило. Именно поэтому в проекте Camerer и др. (2016) репликации планировали с мощностью не менее 90 %, чтобы это объяснение снять. Третье: эффект существует, но зависит от условий, которые в повторении не воспроизведены, от состава участников, от культурного контекста, от деталей процедуры. Такое неучтённое условие называют скрытым модератором.
Различить эти три случая по одной паре «оригинал и репликация» нельзя в принципе. Для этого и делают проекты вроде Many Labs 1, где каждый эффект проверяется не однажды, а в десятках выборок: тогда видно, держится ли он везде, нигде или в части условий, и объяснение через скрытый модератор становится проверяемым утверждением, а не отговоркой.
Вторая половина сюжета касается критерия успеха. Что считать воспроизведённым, вопрос не арифметический, а договорной, и решений тут по меньшей мере три. Можно требовать значимости в репликации при том же направлении эффекта. Можно требовать, чтобы исходная оценка попадала в интервал репликации. Можно требовать, чтобы величина эффекта была не меньше некоторой доли исходной. Три правила, применённые к одним и тем же данным, дают три разные доли успеха.
Именно вокруг этого шёл содержательный спор о проекте 2015 года: критика Gilbert и др. (2016) и ответ авторов проекта. Спор был не о том, честно ли посчитано, а о том, что означает выбранное определение успеха и какие следствия из него правомерны. Знать об этом стоит по той же причине, по какой знать о разборе Literary Digest: расхожая версия результата обычно короче и увереннее оригинала.
«Репликация провалилась, значит, эффекта нет» и «репликация провалилась, значит, репликаторы что-то сделали не так» повторяют одну и ту же ошибку, сделанную в разные стороны. Обе подставляют готовый вывод туда, где данных на вывод не хватает. Корректный ответ звучит скучно: результат под вопросом, и решается вопрос дальнейшими проверками, а не выбором удобной версии.
Против нигилизма
Остаётся вывод, к которому подталкивает всё вышеизложенное и который так же неверен, как доверчивость: «верить нечему».
Первое возражение процедурное. Все числа этого урока получены теми самыми методами, которые нигилистический вывод объявляет негодными: выборки, размеры эффектов, мощность, доверительные интервалы. Кризис воспроизводимости обнаружен не критиками извне, а самой дисциплиной и её же инструментами. Утверждение «статистике верить нельзя, ведь статистика показала, что ей нельзя верить» опровергает себя ровно тем способом, который разбирался в первом уроке применительно к тезису «статистикой можно доказать что угодно».
Второе возражение фактическое. Воспроизводимость не однородна. В Many Labs 1 из тринадцати эффектов держались десять, проверенные в 36 выборках на 6 344 участниках, а три не удержались. Это не приговор полю, а карта: одни находки устойчивы, другие нет, и содержательный вопрос в том, чем они отличаются. Вывод «верить нечему» стирает ровно ту разницу, ради которой проекты и затевались.
Третье возражение практическое. Корректное обновление убеждений здесь количественное, а не категорическое, и оно вполне выполнимо. Одно значимое исследование даёт слабое свидетельство, а не установленный факт. Опубликованный размер эффекта скорее верхняя оценка, чем средняя, и разумно ждать при повторении меньшего числа. Число независимых воспроизведений важнее престижа журнала. Эти три правила меняют поведение читателя, а «верить нечему» не меняет ничего, потому что не подсказывает ни одного действия.
И четвёртое, самое неудобное. Отказ от статистических свидетельств не оставляет человека ни с чем, а оставляет его с интуицией, систематические сбои которой разбирались в первом уроке: люди находят закономерности в случайных сериях, оценивают вероятность по яркости примера и не удерживают базовую частоту. Метод, ошибающийся в известной доле случаев и умеющий эту долю измерить, лучше метода, который ошибается неизвестно как часто и об этом не сообщает.
Итог урока и всего модуля удобно свести к одной замене в вопросе. Раньше читатель спрашивал: опубликовано ли это в приличном журнале. Теперь он спрашивает: воспроизведено ли это, сколько раз, кем и что стало с размером эффекта. Второй вопрос труднее и почти всегда имеет ответ хуже, чем хотелось бы, но именно он отличает знание от списка литературы.
Ключевые работы
| Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science | 2015 | Сто экспериментальных и корреляционных исследований из трёх ведущих психологических журналов: значимый результат в 97 % оригиналов и 36 % репликаций, средний размер эффекта r = 0,403 против примерно 0,20. |
| Camerer и др., Science | 2016 | Восемнадцать лабораторных экспериментов из American Economic Review и Quarterly Journal of Economics за 2011-2014 годы. Репликации по заранее опубликованным планам анализа, с мощностью не менее 90 %: воспроизвелись 11 из 18 (61 %), размер эффекта в среднем 66 % от исходного. |
| Camerer и др., Nature Human Behaviour | 2018 | Двадцать один социально-научный эксперимент из Nature и Science за 2010-2015 годы с предрегистрированными планами анализа: воспроизвелись 13 из 21 (62 %), размер эффекта около 50 % от исходного. |
| Klein и др., Many Labs 1 | 2014 | Тринадцать эффектов, проверенных в 36 выборках, 6 344 участника: воспроизвелись 10 из 13. Устройство проекта позволяет отличать неустойчивость эффекта от неудачи отдельной репликации. |
Что здесь путают
Проект Open Science Collaboration (2015) получил долю значимых репликаций 36 % для 100 отобранных работ из трёх журналов. Это не доля воспроизводимого в психологии и вообще не оценка дисциплины. Критерий успеха при этом произволен: требование значимости, требование попадания исходной оценки в интервал репликации и требование сохранить долю величины эффекта дают разные числа на одних и тех же данных. Вокруг этого шёл содержательный спор, в него вошли критика Gilbert и др. (2016) и ответ авторов проекта. Устойчивая часть результата лежит в другом столбце: средний размер эффекта упал с r = 0,403 примерно до 0,20.
Держится во всех четырёх проектах и в одну сторону: 0,403 против примерно 0,20 в психологии, 66 % от исходного в экономике, около 50 % в социальных науках. Случайные колебания дали бы отклонения в обе стороны поровну, а здесь их нет. Объяснение экономно и не требует недобросовестности: порог значимости пропускает в литературу только выборки, где случайность сыграла вверх, и завышение тем больше, чем меньше мощность. Из этого следует рабочее правило чтения: опубликованная величина эффекта даёт верхнюю оценку, а не среднюю.
Она совместима с тремя разными положениями дел: оригинал был ложным срабатыванием, репликация сама оказалась ложной ненаходкой из-за нехватки мощности, эффект существует, но зависит от невоспроизведённого условия. Различить их по одной паре работ невозможно, для этого и нужны проекты вроде Many Labs 1, где каждый эффект проверяется в десятках выборок. Симметричная ошибка не менее распространена: считать, что провал репликации всегда объясняется огрехами репликаторов. Обе версии подставляют вывод туда, где данных на него не хватает.
Many Labs 1 (Klein и др., 2014) устроен не как остальные проекты: не по одной репликации на находку, а тринадцать эффектов на 36 выборках, всего 6 344 участника. Именно поэтому различие между выборками перестало быть предметом спора и стало числом. Статус стоит у измеримости разброса, а не у доли успеха: воспроизвелись 10 из 13, но эта доля зависит от того, какие эффекты отобраны и что считать успехом, и сравнивать её с 36 % или 61 % из других проектов нельзя, это разные величины.
Термины
- репликацияreplication
- Повторное проведение исследования с целью проверить, получится ли тот же результат на новых данных.
- прямая репликацияdirect replication
- Повторение процедуры оригинала настолько близко, насколько возможно, на новой выборке. Отличается от концептуальной репликации, которая проверяет ту же идею другим способом.
- концептуальная репликацияconceptual replication
- Проверка того же теоретического предсказания другой процедурой. При неудаче не позволяет отличить ложность исходного результата от неудачности новой процедуры.
- воспроизводимость результатаreplicability
- Свойство результата получаться заново при повторении процедуры независимой группой.
- критерий успеха репликацииreplication success criterion
- Правило, по которому репликация признаётся удавшейся: значимость в том же направлении, попадание исходной оценки в интервал репликации либо сохранение доли величины эффекта. Разные правила дают разные доли успеха на одних данных.
- скрытый модераторhidden moderator
- Не описанное в оригинале условие, от которого эффект зависит. Объяснение становится проверяемым только при сравнении многих выборок.
- гетерогенность эффектаeffect heterogeneity
- Различие величины эффекта между выборками или условиями сверх того, что объясняется случайностью.
- многолабораторная репликацияmany-labs replication
- Проверка одного эффекта параллельно в десятках лабораторий по единому протоколу. Отличает неустойчивость эффекта от неудачи отдельного повторения.
- регистрируемый отчётregistered report
- Формат публикации, при котором журнал принимает работу по описанию замысла и плана анализа, до получения результата.
Практикум · Три критерия успеха на одних данных
Здесь надо своими руками увидеть, что доля успешных репликаций зависит от выбранного определения успеха, а падение размера эффекта не зависит. Понадобятся бумага и калькулятор, около получаса.
- Запишите три правила успеха в проверяемом виде. (1) Репликация значима при том же направлении эффекта. (2) Исходная оценка попадает в интервал репликации. (3) Величина эффекта в репликации не меньше половины исходной.
- Составьте таблицу из десяти строк: в каждой стоят исходная величина эффекта, величина в репликации и границы интервала репликации. Пять строк сделайте такими, где репликация даёт примерно половину исходного и интервал широкий, а другие пять такими, где репликация даёт величину около нуля.
- Примените к таблице все три правила по очереди и посчитайте три доли успеха. Выпишите их рядом: это три разных числа, полученных из одних и тех же данных.
- Посчитайте среднее отношение величины эффекта в репликации к исходной по всем десяти строкам. Проверьте, меняется ли это число при переходе от одного правила к другому.
- Напишите два предложения: какое из четырёх чисел вы поставили бы в заголовок и что при этом потеряет читатель. Сравните свой выбор с формулировкой «36 % психологии не воспроизводится».
Вопросы для самопроверки
В проекте Open Science Collaboration (2015) значимый результат получен в 97 % оригинальных работ и в 36 % репликаций. Что говорит первое из этих чисел?
- Что репликации были проведены хуже оригиналов
- Что 3 % оригинальных работ содержали ошибки в расчётах
- Что отбор в литературу шёл по значимости: поле, где находит почти каждая работа, не публикует ненаходки
- Что 97 % психологических исследований выполнены методологически безупречно
Camerer и др. (2016): воспроизвелись 11 из 18, размер эффекта в среднем 66 % от исходного. Camerer и др. (2018): воспроизвелись 13 из 21, размер эффекта около 50 %. Что здесь общее и важное?
- Провалы в обоих проектах объясняются недостаточной мощностью репликаций: повторы планировались на тех же объёмах, что и оригиналы
- Размер эффекта в репликации в обоих случаях систематически меньше исходного
- Доля успеха в обоих проектах ровно две трети
- Обе доли выше психологических 36 %
Эффект не воспроизвёлся в тщательно спланированной репликации с высокой мощностью. Что из этого следует?
- Что исходный результат под вопросом, но его ложность этим не доказана
- Что эффект реален, но зависит от условий, которые не были воспроизведены
- Что репликаторы отклонились от процедуры оригинала
- Что исходный результат ложен
Что не так с формулировкой «36 % психологии не воспроизводится»?
- Цифра занижена: в действительности не воспроизводится большая доля, потому что неудачные репликации тоже не публикуются
- Это доля значимых репликаций для 100 работ из трёх журналов, и сам критерий успеха произволен
- Проект не проходил рецензирование, поэтому его числа нельзя цитировать: отчёт вышел препринтом и в журнал не подавался
- Ничего: это точная передача результата проекта 2015 года, и формулировка совпадает с авторской
Читатель делает вывод: «раз воспроизводится меньше половины, доверять нельзя ничему». Что с этим выводом?
- Он верен: без независимого воспроизведения результат знанием не является, а воспроизвелось меньше половины работ
- Он верен для психологии и неверен для экономики: в экономике эффекты воспроизводятся полностью
- Он неверен так же, как доверчивость: эти числа получены теми же методами, а корректное обновление количественное
- Он неверен, потому что все неудачи репликаций объясняются различием условий: эффекты реальны, просто чувствительны к обстановке
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science, 2015: Первоисточник самой цитируемой цифры модуля. Читать стоит ради раздела о критериях успеха: их несколько, и они дают разные ответы.
- Gilbert и др., комментарий к проекту воспроизводимости, 2016, и ответ авторов проекта: Спор о том, что означает выбранное определение успеха. Полезен как пример содержательной, а не риторической критики.