К содержанию
Фонтум Основы статистики Урок 24 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль VIII. Что с этим делать · урок 24 из 24

Статистическая грамотность

Двадцать лет исправлений, незакрытый спор о значимости и почему итог курса это не недоверие

Ответом науки на кризис воспроизводимости стали конкретные изменения практики. Предрегистрация публично фиксирует гипотезу, основной исход, объём выборки и правило остановки до сбора данных. Зарегистрированные отчёты журнал принимает до получения результата. Данные и код открыты. Эти меры забирают свободу решать по ходу дела, поднимавшую долю ложных находок. Итог курса не в недоверии к числам, а в проверке того, как они получены.

Amrhein и др., 2019 · Camerer и др., 2016 и 2018 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Называть конкретные изменения практики, ответившие на поломки седьмого модуля
  • Излагать спор об отказе от порога значимости с обеих сторон, не выбирая победителя
  • Составлять план собственного измерения с заранее заявленным исходом и правилом остановки
  • Отличать обоснованное недоверие к отдельному выводу от отказа доверять числам вообще

Седьмой модуль закончился неприятным списком. Публикуется не то, что верно, а то, что значимо. Свобода в обработке данных превращает шум в находку, не требуя ни одного недобросовестного шага. А в проверочных проектах размер эффекта при повторении систематически оказывался меньше исходного, и в психологии, и в экономике, и в социальных науках.

Всё это известно не потому, что кто-то со стороны обвинил профессию, а потому, что профессия это измерила: проекты воспроизводимости провели те же люди, которые публикуются в тех же журналах, а заявление о p-значениях выпустила Американская статистическая ассоциация, а не её критики.

Урок рассказывает про то, что сделали дальше, и что из этого можно взять себе.

Предрегистрация: план раньше данных

Ответ на поломку из тринадцатого и двадцать первого уроков устроен как её зеркало. Там долю ложных находок поднимала свобода решать по ходу дела: когда остановить сбор, какие ковариаты включить, что считать выбросом. Нечестного шага при этом не требовалось ни одного. Каждое решение по отдельности выглядело разумным, и подтасовкой не было ни одно.

Ответ прямой: принять эти решения до того, как данные увидены, и записать публично, с меткой времени. Это и есть предрегистрация, то есть гипотеза, основной исход, объём выборки, правило остановки, план обработки.

Чего она не делает, важнее того, что делает. Поисковый анализ она не запрещает и вторым сортом не объявляет: разглядывание данных в поисках неожиданного остаётся законным жанром, из которого берутся новые гипотезы. Недопустимо другое, выдавать поисковый результат за подтверждающий. Предрегистрация проводит границу между жанрами так, чтобы её нельзя было передвинуть задним числом.

Цену границы показала арифметика прошлого урока. Находка в одном сравнении из двадцати четырёх весит столько, сколько написано на пороге, если сравнение названо заранее. Если же оно выбрано из просмотренных, она не весит почти ничего: ровно одна такая находка при полном отсутствии эффекта и ожидается. Числа в таблицах одинаковые. Различает их дата на плане.

Следующим шагом идёт зарегистрированный отчёт: журнал рецензирует замысел и методы до сбора данных и решает вопрос о публикации по качеству плана, ещё не зная результата. Это прямой ответ на публикационное искажение из двадцатого урока: редакция обязуется напечатать работу, даже если эффекта не найдётся, и отрицательный результат перестаёт быть непубликуемым.

методПять строк до первого наблюдения

Вопрос. Основной исход: одна величина, один способ подсчёта. Сколько наблюдений и когда останавливаюсь. Что считаю подтверждением. Что считаю неподтверждением. Последняя строка пропускается чаще всех и обходится дороже всех.

Открытые данные и код

Вторая линия изменений разделила два понятия. Воспроизводимость расчёта отвечает на вопрос, получится ли из тех же данных тем же кодом то же число. Воспроизводимость результата говорит о том, повторится ли эффект на новых людях. Провал первого обиднее: там речь об ошибке в обработке, а не о природе.

Практика простая, надо выкладывать данные и код вместе со статьёй. Пример из самого курса: Hernán и Robins выложили «Causal Inference: What If» бесплатно вместе с данными и кодом для R, Stata, SAS, Python и Julia, а учебник Berkeley Data 8 открыт по лицензии Creative Commons целиком. Помимо ловли ошибок это делает дешёвой проверку устойчивости: тот же анализ с другим правилом отсечения выбросов или другим набором ковариат даёт другое число или то же самое, и видно это всем, а не только авторам. Решения, из которых складывается сад расходящихся троп, становятся наблюдаемыми.

Ограничение назвать надо сразу: открытость не лечит смещение отбора. Выложить можно и плохо собранную выборку, репрезентативной от публикации она не станет.

Интервалы вместо порога: спор, который не закрыт

Заявление Американской статистической ассоциации 2016 года разбиралось в одиннадцатом уроке. Здесь важны два его принципа: решения не должны приниматься только по тому, перешло ли p-значение порог, и само p-значение остаётся плохой мерой доказательности.

Предложение 2019 года идёт дальше заявления. Amrhein, Greenland и McShane призвали в Nature отказаться от дихотомии «значимо или незначимо» вообще и интерпретировать размеры эффекта и интервалы. Заодно предложено называть доверительный интервал интервалом совместимости: слово «доверие» подсказывает ровно ту трактовку, которую восьмой урок разбирал как неверную.

Довод за. Дихотомия порождает две ошибки-близнеца. Незначимый результат объявляют отсутствием эффекта, хотя интервал может тянуться от заметного вреда до заметной пользы. Значимый объявляют установленным, хотя интервал способен включать величины, ради которых никто не стал бы ничего менять. И две работы с p = 0,04 и p = 0,11 объявляют противоречащими, хотя интервалы у них перекрываются почти целиком.

Довод против. Решение всё равно приходится принимать: регулятор одобряет или не одобряет, журнал печатает или нет, компания выкатывает версию или откатывает. Отмена правила не отменяет решения, а делает его непрозрачным. Там, где стоял порог, появляется суждение, а суждение есть та же исследовательская степень свободы, только без протокола. Интервал к тому же пересказывают выборочно ничуть не хуже p-значения.

Состояние спора: ни ASA, ни журналы в целом порог не отменили, а самый радикальный шаг, запрет проверки значимости в Basic and Applied Social Psychology (2015), остался экспериментом одного издания.

Курс не выбирает сторону, потому что её не выбрала профессия. Взять при этом можно то, с чем согласны обе: приводить размер эффекта и интервал всегда, а p-значение давать как одно из чисел, а не как вердикт.

об источникеТочная ссылка

Valentin Amrhein, Sander Greenland, Blake McShane, «Retire statistical significance», Nature 567, 305-307, 2019. Комментарий подписали 854 человека. В реестре курса у этого предложения статус «спор открыт», и записан он в восьмом и одиннадцатом уроках: поддержано широко и при этом не принято ни ассоциацией, ни журналами.

Многолабораторные проекты

Даже безупречное повторение в одной лаборатории отвечает на узкий вопрос: держится ли эффект здесь, у этих людей. Широкий вопрос требует многих лабораторий сразу. Так устроен Many Labs 1 (Klein и др., 2014): тринадцать эффектов на тридцати шести выборках, 6 344 участника. Ценность не только в доле воспроизведённых. Когда один протокол выполняют тридцать шесть групп, разброс между выборками становится измеряемой величиной, а не предметом спора.

Обратите внимание, как устроены сами проверочные проекты: у Camerer и соавторов (2016) планы анализа публиковались заранее, а повторения ставились с мощностью не менее 90 %. В их же проекте 2018 года планы анализа были предрегистрированы так же. Проекты, измерявшие надёжность литературы, сами построены по правилам, которых у этой литературы не было, и разница между тем, как публиковали, и тем, как проверяли, есть измеренная цена старых правил.

Если вы сами собираете данные

Три четверти перечисленного применимо к таблице, которую вы заполняете сами: к сравнению двух вариантов страницы, двух текстов рассылки, двух способов вести встречи. Первое. Записать основной исход до сбора. Одна величина, один способ подсчёта. Не «посмотрим, что изменится», а «сравниваю долю дочитавших письмо до конца».

Второе. Объём и правило остановки. Здесь полезно один раз ужаснуться числам. Пусть конверсия страницы 4 % и вы хотите заметить рост до 5 %. Чтобы такой рост обнаруживался хотя бы в четырёх случаях из пяти, нужно порядка шести-семи тысяч посетителей на вариант, больше тринадцати тысяч всего. По тысяче на вариант тот же рост обнаружится меньше чем в каждом пятом повторении опыта. Следует из этого не «не проводите тестов», а «знайте заранее, на что рассчитываете»: тест на тысяче посетителей отвечает про крупные эффекты и молчит про мелкие.

Смотреть результат каждый день и остановиться, когда p опустится ниже 0,05, нельзя: это первый пункт списка Simmons и соавторов, и он поднимает долю ложных находок сам по себе, без всяких других вольностей. Число наблюдений называется заранее, либо заранее описывается процедура промежуточных проверок.

Третье и самое пропускаемое. Записать, что будет считаться неподтверждением. Формулировка «если эффекта не будет» не работает: незначимость сама по себе не значит ничего. Работает формулировка с порогом величины: «если разница окажется меньше половины процентного пункта, я считаю, что эффекта нужного мне размера нет, и версию не выкатываю». Такое правило проверяемо и лишает вас возможности объяснить себе задним числом любой исход.

Против нигилизма

После курса, где половина материала о том, как ломается вывод, возникает соблазн простого итога: числам верить нельзя. Это гиперкоррекция, о которой предупреждает курс критического мышления этой же школы: скептик, подозревающий всё, ровно так же слеп, как доверчивый, не подозревающий ничего. Разница лишь в том, что первый считает свою слепоту достоинством.

У фразы «статистикой можно доказать что угодно» есть дефект, видимый изнутри курса. Смещённость публикуемой литературы установлена подсчётом: взяли сто работ, повторили их по одному протоколу, сравнили числа. Если бы числами можно было показать что угодно, показывать кризис воспроизводимости было бы нечем.

Перечислим по пунктам, что как раз работает.

Рандомизированный эксперимент остаётся сильнейшим доступным инструментом. Неопределённость он не устраняет, но делает группы сравнимыми сразу по всем признакам, включая те, о которых никто не подумал и которых никто не измерял. Ни один способ обработки наблюдательных данных этого не даёт: поправка возможна только на измеренное. Поэтому семнадцатый урок ставит жребий в основание, а Hernán и Robins начинают книгу с того, чем рандомизация отличается от наблюдения.

Интервал честнее точечной оценки. Он сообщает и величину, и её неопределённость одним объектом. С этим согласны обе стороны спора 2019 года, и это редкое место, где спорящие сходятся.

Предрегистрация меняет результат измеримо. Исследовательские степени свободы не спорная гипотеза, а результат, который любой воспроизводит симуляцией, и тренажёр тринадцатого урока это делает. Фиксация плана заранее убирает ровно ту свободу, которая его порождает. Именно поэтому проверочные проекты предыдущего раздела и ставились по новым правилам: иначе их собственным числам нечего было бы противопоставить старым. И одно уточнение, без которого легко ошибиться адресом. Разрыв между 97 % значимых результатов в оригиналах и 36 % в повторениях объясняется не предрегистрацией, а отбором публикаций по значимости, который разбирал двадцатый урок. Предрегистрация закрывает другую дыру.

Систематическое падение размера эффекта в повторениях само по себе надёжно установлено. Оно предсказывается механизмом отбора публикаций по значимости и не требует предположения о чьей-либо недобросовестности. Метод, который обнаружил собственную поломку и объяснил её, работает. И профессия оказалась способна сказать это вслух: заявление ASA 2016 года состоит из перечня того, что в её собственной практике делается неверно.

И последнее, ради симметрии. Само «36 % психологии не воспроизводится» курс относит к мифам по разбору двадцать второго урока, где видно, из чего эта доля посчитана. Число выдёргивают из условий ровно тем способом, против которого весь курс. Нигилизм питается той же небрежностью с числами, на которую жалуется.

осторожноСимметричный отказ

«Раз бывают плохие исследования, все исследования одинаковы» устроено так же, как «раз бывают ошибки измерения, измерять бессмысленно». Оно не проверяется, ни к чему не обязывает и удобно ровно тем, что освобождает от разбора.

Чем кончается курс

Правильный вывод из двадцати четырёх уроков не недоверие, а список вопросов, на каждый из которых бывает проверяемый ответ. Какова базовая частота. Какой размер эффекта, а не только значим ли он. Какова мощность и что означала бы незначимость. Сколько сравнений сделано на самом деле. Кого нет в этих данных. Кто решал, в какую группу попадёт объект. Повторял ли это кто-нибудь независимо.

Разница между списком и фразой «числам верить нельзя» практическая. Фраза не проверяется и ни к чему не обязывает. Список даёт семь вопросов, на каждый из которых в хорошей работе ответ есть, а в плохой видно, где именно его нет: первое ощущается как мудрость и не стоит ничего, второе занимает двадцать минут и даёт формулировку, с которой можно работать дальше.

Логичным продолжением идут два других курса школы. Психология даёт материал, на котором всё разобранное и происходило: её результаты чаще прочих проверялись повторениями, и состояние доказательств там указано у каждой темы. Критическое мышление разбирает ту же работу с утверждениями там, где чисел нет вовсе.

Статистика не обещала уверенности. Она обещала отчёт о том, сколько её есть, и это обещание выполняет.

Ключевые работы

Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 305-3072019Комментарий с 854 подписантами: отказаться от дихотомии «значимо или незначимо» в пользу интерпретации размеров эффекта и интервалов совместимости.
Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-1332016Первое за более чем 175 лет формальное заявление ассоциации о конкретной практике: решения не принимаются по одному порогу, p-значение не измеряет величину эффекта.
Klein и др., Many Labs 12014Тринадцать эффектов на тридцати шести выборках, 6 344 участника. Воспроизвелись десять из тринадцати, а разброс между выборками стал измеряемой величиной.
Camerer и др., Nature Human Behaviour2018Двадцать один социально-научный эксперимент из Nature и Science с предрегистрированными планами анализа: воспроизвелись 13 из 21, размер эффекта около половины исходного.
Trafimow, Marks, редакционная статья в Basic and Applied Social Psychology2015Журнал запретил проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Практикой поля запрет не стал.

Что здесь путают

отвергнутоПосле письма 854 подписантов в Nature статистическая значимость отменена.

Не отменена, и это проверяется прямо. Ни Американская статистическая ассоциация, ни журналы порог не отменили: в большинстве изданий значимость по-прежнему участвует в решении о публикации. Единственный радикальный шаг, запрет проверки значимости в Basic and Applied Social Psychology (Trafimow и Marks, 2015), остался экспериментом одного журнала. Открыт другой вопрос: следует ли отменять. Он зарегистрирован отдельно, в одиннадцатом и девятнадцатом уроках, и там у него статус «спор открыт». Здесь же речь о факте, и факт состоит в том, что предложение прозвучало, собрало 854 подписи и принято не было.

отвергнутоПредрегистрация запрещает поисковый анализ.

Запрещает она другое, выдавать поисковый результат за подтверждающий. Разглядывание данных в поисках неожиданного остаётся законным жанром, из которого берутся новые гипотезы. Предрегистрация лишь не даёт передвинуть границу между жанрами задним числом. Работа, где основной исход не подтвердился, а в одной подгруппе нашлось различие, публикуется целиком, с пометкой, что вторая находка поисковая и требует проверки на новых данных. Без пометки та же находка выдаётся за то, что стоит написанного на пороге, хотя выбрана из просмотренных, а с пометкой она честно стоит ровно того, чего стоит новая гипотеза.

сильно ослабленоВыложенные данные и код делают исследование воспроизводимым.

Верно ровно наполовину, и надо различать две половины. Открытость обеспечивает воспроизводимость расчёта: из тех же данных тем же кодом получается то же число, и ошибка в обработке становится находимой. Воспроизводимость результата, то есть повторится ли эффект на новых людях, от неё не зависит вовсе. Не лечит открытость и смещение отбора: выложить можно и плохо собранную выборку, репрезентативной от публикации она не станет. Что открытые данные действительно дают, так это дешёвую проверку устойчивости: тот же анализ с другим правилом отсечения выбросов даёт другое число или то же самое, и видно это всем. Решения, из которых складывается сад расходящихся троп, становятся наблюдаемыми. Этого много, но это не надёжность вывода.

выдержалоФиксация плана до сбора данных убирает ту самую свободу, из которой берутся ложные находки.

Держится потому, что механизм посчитан, а не предположен: перебор защитимых вариантов анализа на данных без всякого эффекта поднимает долю значимых результатов существенно выше 5 %, как показали Simmons, Nelson и Simonsohn (2011), и расчёт воспроизводит любой желающий. Предрегистрация убирает ровно этот перебор, называя основной исход, объём и правило остановки заранее. Проверочные проекты и построены так: у Camerer и др. (2016) планы анализа опубликованы до сбора данных, а мощность повторений не ниже 90 %. У Camerer и др. (2018) планы анализа предрегистрированы так же. Границу надо назвать точно, иначе перепутается адрес: разрыв между 97 % значимых результатов в оригиналах и 36 % в репликациях объясняется отбором публикаций по значимости, а не отсутствием предрегистрации. И поисковый анализ она не запрещает, запрещает выдавать его за подтверждающий.

Термины

предрегистрацияpreregistration
Публичная запись плана исследования с меткой времени до сбора данных: гипотеза, основной исход, объём выборки, правило остановки, план обработки. Делает возможной публикацию по замыслу, а не по результату.
зарегистрированный отчётregistered report
Формат публикации, при котором журнал рецензирует методы до сбора данных и обязуется напечатать работу независимо от результата.
план анализаpreanalysis plan
Часть предрегистрации, описывающая обработку: какие переменные, какие поправки, что делать с выбросами и пропусками.
поисковый и подтверждающий анализexploratory and confirmatory analysis
Два законных жанра: первый порождает гипотезы, второй их проверяет. Ошибка не в поиске, а в выдаче поискового результата за подтверждающий.
правило остановкиstopping rule
Заранее назначенное условие прекращения сбора данных. Влияет на p-значение, поскольку меняет набор исходов, считающихся более крайними. Остановка по достижении желаемого значения сама по себе поднимает долю ложных находок.
многолабораторный проектmany-labs project
Одновременное выполнение одного протокола многими группами. Делает разброс между выборками измеряемой величиной.

Практикум · Предрегистрация на одну страницу

Задание на живом материале: вы записываете план настоящего измерения, которое проведёте сами. Годится сравнение двух заголовков письма, двух маршрутов до работы, двух способов заваривания, двух вариантов страницы, двух режимов подготовки к делу. Нужны две группы или два периода и число на выходе. Запись занимает двадцать-тридцать минут, сбор идёт дальше своим ходом.

  1. Выберите измерение, которое реально проведёте в ближайшие две недели, и запишите вопрос одной фразой. Проверка: в фразе должно быть видно, что с чем сравнивается.
  2. Назовите основной исход, одну величину и один способ её подсчёта. Если хочется нескольких, выберите одну и запишите остальные отдельной строкой как вторичные.
  3. Укажите объём и правило остановки: сколько наблюдений собираете и когда прекращаете. Формулировка «пока не станет видно различие» запрещена. Прикиньте заодно, эффект какого размера такой объём вообще способен показать.
  4. Запишите, что будет считаться подтверждением, и отдельной строкой то, что будет считаться неподтверждением. Второе в виде порога величины: «если разница меньше такой-то, считаю, что эффекта нужного мне размера нет».
  5. Сохраните файл с датой раньше первого наблюдения и не открывайте до конца сбора. После сбора сравните написанное с тем, что захотелось посчитать по ходу дела. Разрыв между двумя списками и есть сад расходящихся троп в вашем собственном исполнении.

Вопросы для самопроверки

Вопрос 1

Исследователь предрегистрировал один основной исход, различия по нему не нашёл, но обнаружил эффект в одной подгруппе. Что он может честно написать в статье?

  • Что предрегистрацию следует считать недействительной, раз данные оказались богаче плана
  • Ничего: предрегистрация запрещает публиковать незапланированные результаты
  • Основной исход не подтвердился, а находка в подгруппе поисковая и требует проверки на новых данных
  • Что эффект существует, но проявляется только в этой подгруппе
Вопрос 2

Две работы об одном и том же: в первой p = 0,04, во второй p = 0,11, интервалы для эффекта перекрываются почти полностью. Новость сообщает, что работы противоречат друг другу. Что здесь неверно?

  • Первая работа опровергнута второй, потому что вторая не подтвердила эффект: незначимый результат отменяет значимый
  • Работы согласуются: разные p при перекрывающихся интервалах противоречием не являются
  • Неверно то, что вторая работа вообще опубликована при p = 0,11: журналы не принимают незначимые результаты
  • Ничего: значимость в одной работе и незначимость в другой и есть противоречие, ради этого порог и введён
Вопрос 3

Журнал принимает работу к печати по качеству плана, ещё не зная результата. Какую именно проблему это решает?

  • Смещение выборки: участников теперь отбирают корректнее, раз план рецензируется до сбора данных
  • Ошибку выжившего в данных отдельного исследования: до сбора данных выбывших ещё нет
  • Низкую мощность: формат обязывает журнал принимать только работы с мощностью не менее 80 %
  • Публикационное искажение: отрицательный результат перестаёт быть непубликуемым
Вопрос 4

Вы запустили сравнение двух вариантов страницы и смотрите результат каждый день, договорившись с собой остановиться, как только p опустится ниже 0,05. Что вы делаете на самом деле?

  • Поднимаете вероятность ложной находки существенно выше 5 %: момент остановки выбран по данным
  • Получаете более надёжный результат, потому что наблюдений в итоге ровно столько, сколько нужно
  • Экономите трафик, не меняя свойств процедуры
  • Ничего страшного, если заранее задан верхний предел числа наблюдений
Вопрос 5

Знакомый после разговора о кризисе воспроизводимости заключает: «Значит, числам верить нельзя». Какое возражение по существу?

  • Кризис касается только психологии, в остальных областях доля воспроизведённых результатов близка к единице
  • Возражать нечего: доля подтверждений и правда низкая
  • Сам кризис установлен подсчётом, и вывод отменяет инструмент, которым получен
  • Проблема решена предрегистрацией, и говорить больше не о чем: с 2015 года смещение литературы устранено

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 2019: Тот же комментарий на выходе из курса. Читать его стоит вместе с возражениями: спор не закрыт, и обе позиции формулируются коротко.
  • Wasserstein, Lazar, «The ASA Statement on p-Values», The American Statistician, 2016: Опорный текст двух последних модулей. Шесть принципов удобно держать рядом как памятку.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?