К содержанию
Фонтум Основы статистики Урок 21 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль VII. Где статистика ломается · урок 21 из 24

P-хакинг

Как получить значимый результат, не сказав ни одного неправдивого слова

p-хакинг это перебор вариантов анализа до получения значимого результата с докладом только удавшегося. Симмонс, Нельсон и Симонсон в работе 2011 года назвали четыре исследовательские степени свободы (момент остановки сбора, набор ковариат, набор условий, обработку выбросов) и с их помощью «доказали», что песня делает участников младше. В саду расходящихся троп то же происходит без умысла: анализ один, но его выбор зависел от данных.

Simmons, Nelson, Simonsohn, 2011 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Называть четыре исследовательские степени свободы и оценивать, насколько каждая поднимает вероятность ложного срабатывания
  • Различать намеренный перебор вариантов анализа и сад расходящихся троп, где умысла нет
  • Объяснять, почему поправка на множественные сравнения в саду троп неприменима
  • Опознавать гипотезу, сформулированную задним числом, по признакам в тексте статьи

В 2011 году Джозеф Симмонс, Лиф Нельсон и Ури Симонсон опубликовали в Psychological Science работу под названием «False-Positive Psychology». Кроме симуляций в ней описаны два настоящих эксперимента, поставленных не для того, чтобы что-то узнать о людях, а для того, чтобы показать, что можно получить обычными средствами.

Во втором из них авторы «доказали», что прослушивание песни делает участников младше. Не чувствующими себя моложе, а именно младше: между теми, кто слушал песню, и контрольной группой получилось значимое различие в возрасте. Эффект логически невозможен, потому что возраст участника сложился задолго до эксперимента и никакая музыка на него не влияет.

При этом в работе не подделаны данные, не выброшены неудобные испытуемые и не написано ни одного неправдивого предложения. Каждый использованный приём анализа встречается в обычных статьях и никем не считается нарушением. Значимый по общепринятому критерию результат собрался из нескольких мелких решений, принятых уже после того, как данные были на руках.

Свободу принимать такие решения авторы назвали исследовательскими степенями свободы. Тринадцатый урок уже показал арифметику множественных сравнений и ввёл образ сада расходящихся троп. Здесь мы разбираем, откуда сравнения берутся в работе, где формально проведено одно.

Четыре степени свободы

Симмонс, Нельсон и Симонсон разбирают четыре решения, которые исследователь почти всегда принимает сам и почти никогда не описывает в статье.

Момент остановки сбора данных. Собрали по двадцать наблюдений в группе, посчитали: p = 0,11. Добрали ещё по десять, посчитали снова: p = 0,04. Останавливаемся, потому что «данных достаточно». Это не одна проверка, а две, и каждая давала шанс пересечь порог. Если бы обе были независимы, вероятность ложного срабатывания составила бы 1 − 0,95², то есть около 9,8 %. При четырёх заглядываниях она равна 1 − 0,95⁴, около 18,5 %. У этого приёма есть неприятное предельное свойство: если добирать данные без ограничения и останавливаться, как только получилось, значимый результат наступит рано или поздно почти наверняка, даже когда эффекта нет вовсе.

Набор ковариат. В исследовании померены пол, возраст и образование. Сравнить группы можно напрямую, а можно с поправкой на любой из трёх признаков, на любую пару и на все три сразу, а всего из трёх измеренных величин выходит восемь вариантов анализа. Ни один из восьми не является жульничеством: поправка на возраст остаётся стандартным и часто необходимым ходом.

Набор условий. В эксперименте три группы: воздействие A, воздействие B и контроль. Отсюда как минимум четыре осмысленных сравнения: A с контролем, B с контролем, A с B и объединённое A+B с контролем. Статья же обычно сообщает про одно, а про два лишних условия читатель не узнаёт, если авторы решат о них не писать.

Обработка выбросов. Отбросить значения дальше трёх стандартных отклонений, дальше двух, отбросить слишком быстрые ответы, не отбрасывать ничего. Четыре правила, каждое защитимо, и выбирается одно, уже глядя на данные.

Теперь соберём скромный набор: два момента остановки, два варианта ковариат, два правила обработки выбросов. Восемь вариантов анализа. Если считать их независимыми, вероятность найти среди них хотя бы один значимый при полностью отсутствующем эффекте равна 1 − 0,95⁸, то есть около 34 %.

Оговорка здесь обязательна, и она содержательная. Восемь вариантов не независимы: они считаются по одним и тем же данным и дают сильно связанные результаты, поэтому настоящее число меньше, чем даёт перемножение. Но оно всегда больше 5 % и растёт с числом вариантов, а то, насколько именно, зависит от конкретного набора приёмов и считается симуляцией. Именно так это и сделано в работе 2011 года: не рассуждением о том, что так бывает, а прямым расчётом вероятности ложного срабатывания для типовых комбинаций приёмов.

методЧетыре вопроса к любому эксперименту

Сколько показателей измерялось всего? Сколько условий было в плане и все ли описаны? По какому правилу исключались наблюдения и было ли оно задано до сбора данных? Когда и почему сбор остановлен? Если ответов нет ни на один, p-значение в статье истолковать нельзя, и не потому, что авторы что-то скрыли, а потому, что для истолкования нужен знаменатель.

Сад расходящихся троп: множественность без перебора

До сих пор описывалось положение, при котором исследователь перебирает варианты и докладывает лучший. Это намеренный отбор, и назвать его сомнительным легко. Гораздо важнее и гораздо чаще встречается другой случай, где перебора не было.

Представим добросовестного человека. Он открывает данные, видит, что время реакции распределено вытянуто вправо, и, совершенно правильно, как учит третий урок, берёт медиану вместо среднего. Замечает троих участников, отвечавших наугад, и исключает их: тоже правильно. Обращает внимание, что эффект держится в основном у женщин, вспоминает, что в литературе есть основания ждать различия по полу, и разбивает выборку. Получает p = 0,02, пишет статью, докладывает ровно один анализ и ничего не скрывает.

Формально сравнение проведено одно. И тем не менее вероятность ложной тревоги здесь много выше 5 %. Причина в том, что при других данных были бы приняты другие решения. Окажись вытянутым вправо не время реакции, а исходный показатель, преобразование применили бы к нему. Держись эффект у мужчин, разбили бы так же и написали бы тот же текст с заменой слова. Настоящее число проверок это множество анализов, которые исследователь провёл бы при разных исходах, и оно намного больше единицы.

Образ пришёл из рассказа Борхеса: в каждой точке анализа тропа расходится, пройдена всего одна, но множественность создают не пройденные тропы, а существовавшие. Отсюда следует граница поправок на множественность, которые вводил тринадцатый урок. Поправка требует, чтобы число проверок было известно. В саду троп его нельзя не только узнать, но и определить. Оно живёт не в данных, а в решениях, которые были бы приняты при другом исходе, и никакой протокол анализа его не восстановит.

Практическое следствие резкое: у сада расходящихся троп нет технического лекарства. Ни поправка, ни более строгий порог, ни лучшая модель не помогают, потому что чинить надо не расчёт, а порядок работы. Лекарств известно ровно три, и все они процедурные. Зафиксировать план анализа до того, как увидены данные. Разделить данные на две части, искать закономерность в первой, проверять во второй. Либо честно назвать анализ разведочным и не сопровождать его цифрой, которая для разведочного анализа не считается.

осторожноОтличие от урока 13

Тринадцатый урок считал вероятность ложной тревоги для известного числа сравнений: двадцать проверок, порог 0,05, поправка на двадцать. Здесь число сравнений неизвестно самому исследователю. Это не более сложная версия той же задачи, а другая задача: там не хватало поправки, здесь не хватает знания о том, что поправлять.

Гипотеза, придуманная задним числом

Отдельный приём, у которого есть устоявшееся английское название HARKing: hypothesizing after the results are known. Он состоит в том, чтобы сформулировать гипотезу после того, как посмотрели на результаты, и изложить её так, будто она была выдвинута заранее.

Разберём на числах. Измерено двадцать показателей, значимым оказался один: p = 0,04. Статья пишется о нём, и написана она безупречно, ведь показатель измерялся, различие получено, p посчитано верно. Читатель видит одну проверку и оценивает риск ложной тревоги в 5 %. Но вероятность получить хотя бы одно значение p ниже 0,05 среди двадцати независимых показателей при полном отсутствии эффекта равна 1 − 0,95²⁰, то есть примерно 0,64.

Обратите внимание, что ни одно предложение статьи не является ложным. Ложно умолчание: не сказано, что показателей было двадцать. Именно поэтому проверка на честность здесь бесполезна, ведь предъявить нечего, а разница между 5 % и 64 % огромна.

Второе, что стоит удержать: сама находка при этом не мусор. Результат, замеченный при разглядывании данных, вполне может оказаться верным, и разведочный анализ остаётся законной и необходимой частью работы. Испорчена не находка, а её статус. Разведочная гипотеза подана как проверенная, и вместе с ней читателю передана величина, которая для разведочной гипотезы не вычисляется. Правильный ход не «не смотреть на данные», а назвать вещи своими именами: вот что мы предполагали заранее, вот что заметили по ходу, и второе нуждается в отдельной проверке.

Есть и обратный приём, менее известный и не менее вредный: убрать из статьи гипотезу, которая была выдвинута и не подтвердилась. Текст после этого выглядит как безошибочное предвидение, а читатель снова теряет знаменатель, то есть число проверявшихся на самом деле предположений.

Почему умысла не требуется

Разницу с предыдущим уроком стоит проговорить. Там искажение вносил отбор публикаций, и этот механизм внешний по отношению к исследователю: работа написана честно, но не всякая написанная работа выходит. Здесь искажение возникает внутри одной работы, руками самого автора, и всё равно не требует злого намерения.

Работает это через простую асимметрию усилий. Никто не решает остановить сбор данных, потому что p стало меньше 0,05. Решают остановить, потому что «данных уже достаточно». Но ощущение достаточности приходит раньше, когда результат получился, и позже, когда не получился. Точно так же выброс, портящий картину, разглядывают внимательнее и находят у него больше оснований для исключения, чем у выброса, который картину не портит. Проверка «а не сделать ли поправку на возраст» приходит в голову охотнее, если без поправки ничего не вышло.

Ни на одном шаге человек не думает, что жульничает, и формально он прав: каждое отдельное решение защитимо и часто просто верно. Смещение вносит не решение, а то, что оно принято после взгляда на данные, и что при другом исходе было бы принято другое.

Отсюда вывод, который стоит держать вместе с выводом двадцатого урока: объяснение через нечестность не просто неточно, оно вредно. Оно превращает вопрос о процедуре в вопрос о людях, а починить нужно процедуру. Из этого же следует, почему результат Simmons, Nelson и Simonsohn прочен: он не про мотивы исследователей, о которых спорить можно бесконечно, а про арифметику вариантов анализа, которую любой желающий воспроизводит симуляцией сам.

Что делает результат подтверждающим

Ответ, к которому пришла практика за полтора десятилетия, состоит из двух частей: разделять два типа анализа и раскрывать решения.

Разделение. Подтверждающим называют анализ, план которого зафиксирован до данных: какая гипотеза, какой показатель главный, сколько будет наблюдений, какое правило исключения, как обрабатываются выбросы. Всё остальное попадает в разведочный анализ, и он полезен ровно как источник гипотез. Проекты по воспроизводимости, о которых пойдёт речь в следующем уроке, к этому и пришли: в работе Camerer и др. (2018) планы анализа были зарегистрированы до сбора данных, и это сделано не из бюрократии, а ровно затем, чтобы сад троп не вырос по ходу дела.

Раскрытие. Отчёт обо всех измеренных показателях, всех условиях эксперимента, правиле исключения наблюдений и правиле остановки. Это требование дешёвое: оно занимает несколько строк и не мешает ничему. И оно ровно про то, о чём говорит четвёртый принцип заявления ASA (2016): корректный вывод требует полной отчётности и прозрачности. Без знания о том, сколько проверок было сделано, отдельное p-значение остаётся числом без истолкования.

Для читателя из этого следует практический приём. Оговорки об ограничениях есть везде и обычно ритуальны, так что ищите в статье не их, а четыре конкретные вещи: список всех измеренных показателей, описание всех условий, правило исключения и правило остановки. Наличие всех четырёх ещё не гарантирует правоты, но позволяет вам самому посчитать, на скольких тропах стоял этот результат. Отсутствие всех четырёх означает не обвинение автору, а сообщение о том, что число в статье нечем истолковать.

И последнее, что стоит унести из урока: описанное здесь не редкость и не порок отдельного поля. Свобода решать по ходу дела встроена в любой анализ данных, будь то отчёт о продажах, проверка рекламной кампании или собственный эксперимент с расписанием тренировок. Разница между исследованием и самообманом проходит не по добросовестности, а по тому, было ли решение принято до того, как стал виден результат.

на заметкуДешёвая проверка на себе

Прежде чем смотреть на собственные данные, запишите на бумаге: что считаете главным показателем, при каком результате признаете гипотезу неподтверждённой и когда прекратите сбор. Три строки, две минуты. Расхождение записанного с тем, что вы сделали потом, и есть размер вашего сада троп.

Ключевые работы

Simmons, Nelson, Simonsohn, «False-Positive Psychology», Psychological Science 22(11), 1359-13662011Симуляцией и двумя реальными экспериментами показано: при свободе выбирать момент остановки, набор ковариат, набор условий и способ обработки выбросов вероятность получить значимый результат при полном отсутствии эффекта поднимается существенно выше 5 %. В демонстрационном эксперименте авторы «доказали», что прослушивание песни делает участников младше.
Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-1332016Четвёртый принцип: корректный вывод требует полной отчётности и прозрачности. Прямое основание для требования раскрывать все измерения, условия, исключения и правило остановки.
Camerer и др., Nature Human Behaviour2018Повторение 21 социально-научного эксперимента из Nature и Science с предрегистрированными планами анализа. Рабочий пример того, как разделяют подтверждающий и разведочный анализ.

Что здесь путают

выдержалоИсследовательские степени свободы это установленный результат, который воспроизводит любой желающий.

Это не предположение о том, как ведут себя люди, а расчёт того, что даёт процедура. Simmons, Nelson и Simonsohn (2011) подтвердили его симуляцией и двумя реальными экспериментами, и любой желающий воспроизводит расчёт сам. На данных без всякого эффекта перебор нескольких защитимых вариантов анализа поднимает долю значимых результатов существенно выше 5 %. Спорить тут можно о величине надбавки для конкретного набора приёмов, но не о наличии механизма.

отвергнутоp-хакинг это подтасовка, и добросовестному исследователю бояться нечего.

Сад расходящихся троп не требует ни умысла, ни единого сомнительного действия. Исследователь проводит один анализ, докладывает его целиком и ничего не скрывает. Каждое решение по отдельности верно, будь то медиана вместо среднего, исключение отвечавших наугад или разбивка выборки по полу. Множественность создаётся тем, что при других данных решения были бы другими. Отсюда следствие: добросовестность не является защитой, а защитой является фиксация плана до данных.

сильно ослабленоОт множественности анализов защищает поправка на число сравнений.

Поправка работает, когда сравнения перечислены заранее и посчитаны: этому посвящён тринадцатый урок, и в своей области приём остаётся правильным. В саду троп поправлять не на что, ведь сравнение проведено одно, а лишние проверки существуют только как решения, которые были бы приняты при ином исходе. Их число неизвестно и самому автору. Поэтому средство здесь процедурное, а не расчётное: предрегистрация, проверка на отложенной части данных или прямое указание, что анализ разведочный.

Термины

исследовательские степени свободыresearcher degrees of freedom
Решения об анализе, допускающие несколько равно защитимых вариантов и обычно не описываемые в статье: момент остановки сбора, набор ковариат, набор условий, правило обработки выбросов.
p-хакингp-hacking
Перебор вариантов анализа до получения значимого результата с последующим докладом одного из них.
сад расходящихся тропgarden of forking paths
Положение, при котором выполнен один анализ, но выбор его зависел от увиденных данных: при другом исходе был бы выбран другой. Недобросовестности не требуется, а объявленный порог значимости к результату уже не относится.
гипотеза задним числомHARKing, hypothesizing after the results are known
Формулирование гипотезы после того, как результаты увидены, и изложение её так, будто она была выдвинута до сбора данных.
выборочная остановкаoptional stopping
Решение прекратить сбор данных, принятое по промежуточному результату. При неограниченном применении приводит к значимому результату почти наверняка даже при нулевом эффекте.
ковариатаcovariate
Дополнительно измеренная величина, поправка на которую может быть включена в анализ или не включена. Каждая ковариата удваивает число возможных вариантов расчёта.
подтверждающий анализconfirmatory analysis
Анализ по плану, зафиксированному до того, как данные увидены. Только для него объявленный порог значимости означает то, что означает.
разведочный анализexploratory analysis
Поиск закономерностей в уже собранных данных без заранее заданной гипотезы. Законный и необходимый способ находить гипотезы, но не проверять их: сопровождать его обычными p-значениями нельзя.
избирательная отчётностьselective reporting
Умолчание о части измеренных показателей, условий или проведённых проверок. Не содержит ложных утверждений и при этом лишает читателя знаменателя.

Практикум · Пересчитать тропы в чужой работе

Понадобится один текст с числами: научная статья в открытом доступе, отчёт компании или подробная новость об исследовании, лишь бы были описаны процедура и результат. Задача не в том, чтобы оценить работу, а в том, чтобы посчитать, на скольких тропах стоял её вывод.

  1. Выпишите доложенный анализ одной строкой: какой показатель сравнивался, между какими группами, на скольких наблюдениях, какие наблюдения исключены.
  2. По каждой из четырёх степеней свободы запишите, сколько правдоподобных альтернатив было у авторов: сколько ещё показателей они наверняка измерили, сколько условий могло быть в эксперименте, сколько правил исключения защитимо, сколько раз можно было остановить сбор. Перемножьте четыре числа, и получится N.
  3. Посчитайте 1 − 0,95 в степени N. Запишите рядом с 5 % и допишите одной фразой, почему настоящее число меньше полученного, но больше 5 %.
  4. Проверьте текст на четыре раскрытия: список всех измеренных показателей, описание всех условий, правило исключения, правило остановки. Отметьте, каких нет.
  5. Найдите в тексте признаки гипотезы задним числом: сформулирована ли она до описания результата, объясняется ли значимый эффект в подгруппе так, будто подгруппа была выбрана заранее. Завершите одним предложением: какое единственное сведение перевело бы этот результат из разведочного в подтверждающий.

Вопросы для самопроверки

Вопрос 1

В работе было два возможных момента остановки сбора, два варианта набора ковариат и два правила обработки выбросов. Сколько получается вариантов анализа и что можно сказать о вероятности ложного срабатывания?

  • Восемь вариантов, при независимости около 34 %, на деле меньше, но заметно выше 5 %
  • Восемь вариантов, и вероятность остаётся 5 %, раз доложен один анализ: считается то, что сделано, а не то, что могло быть сделано
  • Шесть вариантов, вероятность ровно 30 %: три развилки по два варианта дают шесть сочетаний
  • Три варианта, вероятность около 15 %: развилок три, и каждая добавляет свои 5 %
Вопрос 2

Исследователь провёл ровно один анализ, ничего не перебирал, но способ обработки данных выбрал после того, как их увидел. Что верно?

  • Достаточно применить поправку на число рассмотренных ковариат: она возвращает p-значению объявленный смысл
  • Это сад расходящихся троп: множественность создают анализы, которые были бы проведены при других данных
  • Это чистая работа: на одно сравнение одно p-значение, и объявленный порог сохраняет свой смысл
  • Это p-хакинг, а он по определению требует умысла, поэтому без умысла проблема не возникает
Вопрос 3

Измерено двадцать показателей, значимым оказался один, и статья написана о нём как о заранее выдвинутой гипотезе. Каждое утверждение в тексте истинно. В чём проблема?

  • Проблема в том, что девятнадцать показателей измерены впустую
  • Проблемы нет: результат получен и описан правдиво
  • Проблема в размере выборки: для двадцати показателей он мал
  • Читателю передано p-значение, посчитанное для одной проверки, тогда как проверок было двадцать
Вопрос 4

Что превращает закономерность, замеченную при разглядывании данных, в подтверждённый результат?

  • Поправка на число показателей, упомянутых в статье: она возвращает объявленному p-значению его смысл
  • Увеличение выборки в том же наборе данных
  • Проверка на новых данных по плану, зафиксированному до их сбора
  • Повторный расчёт на тех же данных другим статистическим методом: согласие двух независимых методов и есть подтверждение
Вопрос 5

Что показал демонстрационный эксперимент Simmons, Nelson и Simonsohn с прослушиванием песни?

  • Что данные в психологических исследованиях часто подделывают
  • Что порог значимости следует снизить с 0,05 до 0,005
  • Что музыка влияет на то, каким человек ощущает свой возраст
  • Что обычными, никем не запрещёнными приёмами анализа можно получить значимый результат для заведомо невозможного эффекта

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Simmons, Nelson, Simonsohn, «False-Positive Psychology», Psychological Science, 2011: Смотреть стоит таблицу с надбавками: там видно, какой приём насколько поднимает долю ложных срабатываний и сколько дают четыре приёма вместе.
  • Camerer и др., Nature Human Behaviour, 2018: Пример организации проверки с предрегистрированными планами анализа. Числа этого проекта разбираются в следующем уроке.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?