Множественные сравнения в статистике
Почему одна находка из двадцати проверок это ровно то, что обещает случайность
При множественных проверках ожидаемое число ложных находок равно числу проверок, умноженному на порог: двадцать проверок при пороге 0,05 дают вероятность хотя бы одной ложной тревоги около 64 %. Сад расходящихся троп это та же множественность без перебора: выполнен один анализ, но его выбор зависел от увиденных данных. Поправка на множественность исправляет только объявленные сравнения и снижает мощность.
Simmons и др., 2011 · Data 8, гл. 11 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Доводить до конца арифметику множественных проверок и называть ожидаемое число ложных находок
- Перечислять исследовательские степени свободы по Simmons, Nelson и Simonsohn (2011)
- Отличать намеренный подбор результата от сада расходящихся троп, где недобросовестность не требуется
- Объяснять, что делает и чего не делает поправка на множественность
Интернет-магазин проверил двадцать изменений на странице товара: другой цвет кнопки, другой порядок отзывов, другая формулировка доставки и так далее. Девятнадцать не дали ничего. Двадцатое изменение, перенос блока отзывов выше, дало прирост конверсии с p = 0,04. Его внедрили.
Теперь вопрос: сколько «значимых» результатов ожидалось бы в этом эксперименте, если бы ни одно из двадцати изменений не работало вообще?
Ответ: одно. Ровно одно, и это не оценка на глаз, а произведение двадцати на 0,05.
Компания не сделала ничего нечестного. Она проверила двадцать идей, одна выстрелила, о ней и сообщила. Именно так выглядит проблема множественных сравнений в её самом безобидном виде, и именно поэтому она такая частая.
Арифметика двадцати проверок
Доведём счёт до конца, потому что вся тема держится на нём.
Порог 0,05 означает: если нулевая гипотеза верна, вероятность ложной тревоги в одной проверке равна 0,05, а вероятность обойтись без неё составляет 0,95. Проверок двадцать, и пусть они независимы. Тогда вероятность, что ни одна не даст ложной тревоги, равна 0,95 в двадцатой степени.
Считаем по шагам: 0,95 в квадрате даёт 0,9025, в пятой степени примерно 0,774, в десятой примерно 0,599, в двадцатой примерно 0,359. Значит, вероятность получить хотя бы одну ложную находку равна 1 − 0,359, то есть около 64 %.
Второй способ посчитать то же самое проще и запоминается лучше: ожидаемое число ложных тревог это число проверок, умноженное на порог. Двадцать проверок при пороге 0,05 дают в среднем одну ложную находку. Пять проверок дают четверть находки, и вероятность хотя бы одной уже 23 %. Сто проверок дают пять ложных находок, и вероятность обойтись без них меньше одного процента.
Отсюда главное следствие. p = 0,04 у победившего изменения посчитано верно, но верно оно для процедуры «провести одну проверку». Фактическая процедура была другой: «провести двадцать проверок и сообщить о лучшей». У этой процедуры доля ложных тревог не 5 %, а 64 %.
p-значение относится к процедуре, а не к числу. Меняется процедура, меняется и то, что значит результат, хотя арифметика внутри отдельной проверки осталась прежней. Именно поэтому четвёртый принцип заявления ASA (2016) требует полной отчётности и прозрачности: без знания о том, сколько проверок было сделано, прочитать одно опубликованное p-значение невозможно.
Услышав об одном значимом результате, спрашивайте: сколько всего сравнений было проведено и сколько было бы проведено, если бы данные выглядели иначе. Первое число иногда указано. Второе не указано почти никогда, а нужно оно даже больше первого.
Четыре степени свободы
В 2011 году Джозеф Симмонс, Лиф Нельсон и Ури Симонсон опубликовали в Psychological Science работу «False-Positive Psychology». Они показали симуляцией и двумя реальными экспериментами, что множественность прячется не только в явных сравнениях, но и в решениях об обработке данных.
Авторы перечислили четыре свободы, которыми исследователь пользуется буднично: выбирать момент остановки сбора данных, выбирать набор ковариат, то есть на что вводить поправку, выбирать набор условий, которые сравниваются, и выбирать способ обработки выбросов. Каждая из этих свобод создаёт несколько версий анализа, и вероятность получить p < 0,05 при полном отсутствии эффекта поднимается существенно выше 5 %.
Демонстрация была устроена так, чтобы не оставить места для возражений. В одном из экспериментов авторы, пользуясь только этими свободами и не нарушая ни одного формального правила, получили статистически значимый результат: прослушивание песни делает участников младше. Не «чувствовать себя моложе», а младше по дате рождения. Поскольку заявленный эффект физически невозможен, сомнений в источнике результата не остаётся.
Самая коварная из четырёх свобод это момент остановки. Процедура кажется бережливой и разумной: собрать двадцать наблюдений, посмотреть на p-значение, при неудаче добрать ещё десять, снова посмотреть. На деле каждая промежуточная проверка добавляет ещё одну возможность случайно перескочить порог, и итоговая вероятность ложной тревоги оказывается заметно выше объявленной.
В курсе у этого результата статус выдержало. Это не спорная гипотеза о поведении исследователей, а свойство процедуры, которое любой может воспроизвести симуляцией на случайных числах.
Сад расходящихся троп
Теперь самое важное различение урока.
Подбор результата это когда исследователь перебирает варианты анализа, пока не получит p < 0,05, и сообщает только удавшийся. Здесь есть намерение, и такое поведение осуждается всеми.
Сад расходящихся троп это когда исследователь проводит одну проверку и честно сообщает о ней, но выбор именно этой проверки зависел от того, как выглядели данные. Никакого перебора не было. Намерения обмануть не было. Проблема осталась.
Разберём на числах. Пусть исследователь принимает по ходу анализа четыре решения, у каждого по два разумных варианта: исключать ли необычно долгие ответы, брать основной показатель или дополнительный, вводить ли поправку на возраст, разбивать ли выборку по полу. Четыре двоичных решения дают 2 × 2 × 2 × 2 = шестнадцать возможных анализов. Если бы они были независимы, вероятность получить хотя бы один значимый результат при полном отсутствии эффекта составила бы 1 − 0,95 в шестнадцатой степени, то есть около 56 %. Реальные варианты анализа между собой зависимы, и настоящее число меньше, но остаётся во много раз выше объявленных 5 %.
А теперь ключевой поворот: этот расчёт остаётся в силе, даже если исследователь выполнил ровно один анализ из шестнадцати. Достаточно того, что при других данных он выбрал бы другую тропу. Разбиение по полу пришло в голову потому, что на графике мужчины и женщины разошлись. Поправка на возраст не понадобилась, потому что группы по возрасту совпали. Каждое такое решение выглядит как здравый смысл, и каждое сделано после того, как данные увидены.
Отсюда вывод, который стоит принять до конца: для того чтобы p-значение перестало значить объявленное, недобросовестность не требуется. Достаточно решать по ходу дела. Это делает проблему гораздо шире, чем вопрос научной этики: под неё попадают добросовестные люди, аналитики в компаниях и все, кто смотрит на данные прежде, чем решить, что с ними делать.
Спросите себя: если бы данные вышли другими, я бы делал тот же самый анализ? Если хотя бы одно решение (исключение наблюдений, выбор показателя, разбиение на подгруппы) принято после взгляда на результат, объявленный порог значимости к вашему выводу не относится. Не потому, что вы схитрили, а потому, что проверок было больше одной.
Поправки: идея без техники
Раз ожидаемое число ложных тревог это число проверок, умноженное на порог, напрашивается очевидный ход: разделить порог на число проверок.
Для двадцати сравнений порог становится 0,05 : 20 = 0,0025. Проверим, что это работает: вероятность обойтись без ложной тревоги в одной проверке теперь 0,9975, в двадцати примерно 0,951, значит, вероятность хотя бы одной ложной находки около 0,049. Мы вернули общую долю ложных тревог на объявленный уровень. Это простейшая поправка на множественность, и техника её здесь не нужна, нужна идея.
Цена известна и берётся прямо из прошлого урока: ужесточение порога снижает мощность. При пороге 0,0025 значимости достигают только очень крупные расхождения, и настоящие эффекты пропускаются чаще. Существуют более экономные подходы, например контроль не вероятности хотя бы одной ошибки, а ожидаемой доли ложных среди объявленных находок. Они теряют меньше мощности и уместны, когда проверок сотни. Но обмен между ложными тревогами и пропусками никуда не девается, он лишь распределяется иначе.
И главное ограничение, из-за которого поправка не решает проблему. Она исправляет только те проверки, которые вы объявили. Тропы, по которым вы не пошли, в знаменатель не попадают: в поправку нельзя подставить решения, которые вы приняли бы при других данных, потому что вы сами их не пересчитывали. Поэтому поправка справляется со стандартной таблицей из двадцати сравнений и не справляется с садом расходящихся троп.
Что действительно помогает
Спасает от множественности не расчёт, а порядок работы: решения об анализе принимаются до того, как данные увидены.
Первой идёт предрегистрация: заранее опубликованное описание того, какая гипотеза проверяется, какой показатель основной, какие наблюдения исключаются и по какому правилу, когда сбор данных прекращается. Всё, что записано до данных, тропами не является. Всё, что решено после, тропами и оказывается.
Вторым идёт разделение разведки и проверки. Разведочный анализ полезен и необходим: именно так находят гипотезы. Незаконно не искать закономерности в данных, а объявлять найденное проверенным. Гипотеза, добытая перебором, проверяется на новых данных, и тогда у неё снова одна проверка, а не шестнадцать.
Третьей идёт полная отчётность, четвёртый принцип ASA. Сообщать все проведённые сравнения, все собранные показатели, все исключённые наблюдения. Не для того чтобы каяться, а потому что без этого читатель не может интерпретировать ни одно из приведённых чисел.
Вернёмся к магазину из начала урока. Что ему делать с блоком отзывов? Не отказываться от находки, она вполне может быть настоящей. Проверить её отдельно: одно изменение, одна заранее объявленная метрика, новые пользователи. Если прирост воспроизведётся, это результат. Если нет, компания сэкономила на переделке страницы, а мы получили ровно то, что предсказывала арифметика: одну ложную находку из двадцати проверок.
Этот урок закрывает модуль о проверке гипотез. Логика нулевой модели, точный смысл p-значения, мощность и размер эффекта, множественность, вот четыре вещи, без которых чтение работы с числами превращается в доверие к слову «значимо». В седьмом модуле курс вернётся к тому же материалу с другой стороны: что происходит, когда эти механизмы действуют не в одном исследовании, а во всей опубликованной литературе сразу.
Двадцать проверок
Никакого эффекта нет ни в одном из показателей, все данные взяты из одного распределения. Проверяем двадцать показателей подряд и смотрим, сколько из них окажутся «значимыми».
Ключевые работы
| Simmons, Nelson, Simonsohn, «False-Positive Psychology», Psychological Science 22(11), 1359-1366 | 2011 | Симуляцией и двумя экспериментами показано: свобода выбирать момент остановки сбора данных, набор ковариат, набор условий и способ обработки выбросов поднимает вероятность получить p < 0,05 при полном отсутствии эффекта существенно выше 5 %. В демонстрационном эксперименте авторы получили значимый результат: прослушивание песни делает участников младше. |
| Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-133 | 2016 | Четвёртый принцип: корректный вывод требует полной отчётности и прозрачности, в том числе о числе проведённых сравнений. |
Что здесь путают
Simmons, Nelson и Simonsohn (2011) показали симуляцией и двумя экспериментами, что четыре обычных свободы (момент остановки сбора данных, набор ковариат, набор условий, обработка выбросов) поднимают вероятность получить p < 0,05 при полном отсутствии эффекта существенно выше 5 %. Демонстрация доведена до предела: пользуясь только этими свободами, авторы получили значимый результат о том, что прослушивание песни делает участников младше. Это не спорная гипотеза, а свойство процедуры, воспроизводимое симуляцией на случайных числах. Расхожее «способ обработки на результат почти не влияет» здесь и опровергнуто.
Намерение не требуется. Достаточно принимать решения об анализе после того, как данные увидены: исключить необычные наблюдения, взять другой показатель, разбить выборку по полу, потому что на графике заметно расхождение. Четыре таких двоичных решения дают шестнадцать возможных анализов, и объявленный порог 0,05 к результату уже не относится, даже если выполнен ровно один анализ из шестнадцати. Значение имеет не то, сколько проверок сделано, а то, сколько было бы сделано при других данных. Поэтому под проблему попадают вполне добросовестные исследователи и аналитики.
Для объявленного набора сравнений поправка работает: деление порога 0,05 на двадцать возвращает общую вероятность ложной тревоги примерно к 0,049. Но исправляет она только то, что пересчитано, а тропы, по которым исследователь не пошёл, в расчёт не попадают по определению. Вдобавок ужесточение порога снижает мощность, то есть покупает защиту от ложных тревог ценой пропусков. Против сада расходящихся троп поправка бессильна: там нужна не арифметика, а предрегистрация или проверка находки на новых данных.
Термины
- множественные сравненияmultiple comparisons
- Несколько проверок гипотез на одних данных. Ожидаемое число ложных тревог равно числу проверок, умноженному на порог.
- исследовательские степени свободыresearcher degrees of freedom
- Решения об анализе, допускающие несколько равно защитимых вариантов и обычно не описываемые в статье: момент остановки сбора, набор ковариат, набор условий, правило обработки выбросов.
- сад расходящихся тропgarden of forking paths
- Положение, при котором выполнен один анализ, но выбор его зависел от увиденных данных: при другом исходе был бы выбран другой. Недобросовестности не требуется, а объявленный порог значимости к результату уже не относится.
- подбор результата, p-хакингp-hacking
- Намеренный перебор вариантов анализа до получения p < 0,05 с сообщением только об удавшемся. Отличается от сада расходящихся троп наличием намерения. Подробно разбирается в двадцать первом уроке.
- поправка на множественностьmultiple comparisons correction
- Ужесточение порога с учётом числа проверок. Проще всего поделить порог на их число. Исправляет только объявленные сравнения и снижает мощность.
- групповая вероятность ошибкиfamily-wise error rate
- Вероятность получить хотя бы одну ложную тревогу во всём наборе проверок. При двадцати независимых проверках и пороге 0,05 составляет около 64 %.
- доля ложных открытийfalse discovery rate
- Ожидаемая доля ложных среди объявленных находок. Контролировать её дешевле по мощности, чем групповую вероятность ошибки. Уместно при сотнях проверок.
- предрегистрацияpreregistration
- Публичная запись плана исследования с меткой времени до сбора данных: гипотеза, основной исход, объём выборки, правило остановки, план обработки. Делает возможной публикацию по замыслу, а не по результату.
Практикум · Добыть значимость из ничего
Задание на тренажёре «Сад расходящихся троп» и на бумаге. Цель в том, чтобы получить p < 0,05 на данных, в которых эффекта нет по построению, и увидеть, сколько решений для этого потребовалось.
- Откройте тренажёр и получите набор данных, в котором эффекта нет: обе группы порождены одним и тем же механизмом. Проведите одну проверку, как она задумана, и запишите p-значение. Скорее всего, оно будет большим.
- Теперь пользуйтесь исследовательскими степенями свободы по очереди: исключите выбросы, смените основной показатель, добавьте поправку на ковариату, разбейте выборку на подгруппы. После каждого шага записывайте p-значение в столбик. Остановитесь, когда получите значение ниже 0,05.
- Посчитайте, сколько всего вариантов анализа вы перебрали, и выпишите их в строку. Затем посчитайте, сколько вариантов было доступно, но не опробовано: перемножьте число вариантов у каждого решения. Второе число обычно вдвое-втрое больше первого.
- Проверьте арифметику двадцати проверок на бумаге: посчитайте 0,95 в двадцатой степени и убедитесь, что вероятность хотя бы одной ложной тревоги около 64 %, а ожидаемое число ложных находок равно единице. Повторите расчёт для числа вариантов из шага 3.
- Напишите отчёт о своей находке в двух версиях. Первая написана так, как её обычно публикуют: только удавшийся вариант с его p-значением. Вторая идёт с полным перечнем проведённых и доступных проверок. Сравните, как читается один и тот же результат, и сформулируйте, какая информация делает разницу.
Вопросы для самопроверки
Проведено 20 независимых проверок при пороге 0,05, эффектов нет ни в одной. Какова вероятность получить хотя бы один значимый результат?
- Около 64 %: единица минус 0,95 в двадцатой степени
- 100 %, поскольку двадцать умножить на 0,05 равно единице
- 5 %, поскольку порог не менялся
- Около 36 %, как доля воспроизведённых результатов в проекте OSC
Исследователь провёл ровно один анализ, но решение разбить выборку по полу принял, увидев расхождение на графике. Что это означает для его p-значения?
- Ничего: анализ был один, значит, множественности нет, а поправка считается по числу выполненных проверок
- Ничего, если он честно сообщил о своём решении: раскрытие развилки возвращает p-значению объявленный смысл
- Результат недействителен, и данные надо выбросить: подсмотренная выборка для проверки гипотез больше не годится
- Объявленный порог к результату не относится: проверок фактически было больше одной
Что показали Simmons, Nelson и Simonsohn в работе 2011 года?
- Что психологи массово подделывают данные
- Что обычные свободы в обработке данных поднимают долю ложных находок существенно выше 5 %
- Что прослушивание музыки влияет на восприятие возраста
- Что большинство опубликованных результатов ложны
Для двадцати сравнений порог поделили на двадцать: 0,0025. Что это дало и чего не дало?
- Ничего не изменило: порог всё равно условен
- Полностью решило проблему множественности
- Вернуло общую долю ложных тревог примерно к 5 %, но снизило мощность и не учло непройденные тропы
- Повысило мощность, поскольку требования стали строже
Магазин из начала урока нашёл прирост конверсии в одном из двадцати изменений. Что делать дальше?
- Внедрять: p = 0,04 меньше порога, а порог для того и назначен, чтобы решать по нему
- Пересчитать все двадцать проверок с поправкой на число сравнений и внедрить, если хоть одна уцелеет: поправка возвращает находке силу подтверждения
- Отказаться от находки: при двадцати проверках она наверняка ложная, ведь одно срабатывание из двадцати ожидается и при полном отсутствии эффекта
- Проверить это изменение отдельно на новых пользователях с заранее объявленной метрикой
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Simmons, Nelson, Simonsohn, «False-Positive Psychology», Psychological Science, 2011: Короткая статья, изменившая практику целого поля. Читается за час, включая описание эксперимента с песней.
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 11: Проверка гипотез симуляцией: полезно вернуться к ней после этого урока и увидеть, как множественность выглядит в перестановочной постановке.