P-значение простыми словами
Шесть принципов ASA и три подмены, которые они закрывают
p-значение не показывает вероятность того, что гипотеза верна, и не измеряет вероятность того, что данные получены случайно. Это прямо сказано в шести принципах заявления Американской статистической ассоциации 2016 года. Главная ошибка чтения это перестановка условия: подмена «вероятности данных при гипотезе» на «вероятность гипотезы при данных». Большое p-значение говорит об отсутствии свидетельства эффекта, а не о его отсутствии.
заявление ASA 2016 · MIT 18.05, занятие 20 · 45 мин · обновлено 12.09.2026
После урока вы сможете
- Пересказывать шесть принципов заявления ASA (2016) своими словами
- Показывать на арифметике, почему p = 0,05 не означает пятипроцентного шанса ошибиться
- Отличать отсутствие свидетельства эффекта от свидетельства его отсутствия
- Излагать спор об отказе от порога значимости с аргументами обеих сторон
«Связь подтверждена с вероятностью 99 %: p = 0,01». Фраза из новости, и в ней две ошибки на семь слов.
Первая: p-значение не является вероятностью того, что связь есть. Вторая: 99 % не получается из 0,01 никаким вычитанием, потому что эти числа относятся к разным вопросам.
Такое чтение настолько распространено, что в 2016 году Американская статистическая ассоциация впервые более чем за 175 лет своего существования выпустила формальное заявление о конкретной статистической практике. Не о новом методе, а о том, как читать старый. Заявление написали Рональд Вассерстайн и Николь Лазар, оно занимает несколько страниц в The American Statistician и состоит из шести принципов.
Этот урок разбирает все шесть и три подмены, которые они закрывают. Из всего курса он самый практический: почти всё, что вы прочтёте в исследованиях и новостях, придётся переводить именно с этого языка.
Шесть принципов
Первый. p-значение показывает, насколько данные несовместимы с заданной статистической моделью. Ключевые слова здесь «с заданной моделью»: в неё входит не только отсутствие эффекта, но и все допущения о том, как данные получены.
Второй. p-значение не измеряет вероятность того, что гипотеза верна, и не измеряет вероятность того, что данные получены случайно. Это прямое опровержение обеих ошибок из новости выше.
Третий. Научные и деловые решения не должны приниматься только по тому, перешло ли p-значение определённый порог.
Четвёртый. Корректный вывод требует полной отчётности и прозрачности. p-значение, посчитанное на одной из двадцати проверок, о которых не сообщили, означает совсем не то, что p-значение единственной запланированной проверки. Этому посвящён тринадцатый урок.
Пятый. p-значение не измеряет ни величину эффекта, ни важность результата.
Шестой. Само по себе p-значение плохо мерит доказательность в пользу модели или гипотезы.
Отдельно в заявлении сказано: меньшие p-значения не обязательно означают больший или более важный эффект, а большие не означают отсутствия важности или эффекта. Дальше идут три подмены, каждая из которых нарушает один из принципов, и каждая разбирается на числах.
Ronald L. Wasserstein, Nicole A. Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-133, 2016. Это позиция самой профессиональной ассоциации, а не мнение отдельных критиков метода, и потому спорить с ней ссылкой на «так принято» не получается.
Подмена первая: p как вероятность гипотезы
Самая частая и самая дорогая. Звучит она так: «p = 0,03 значит, что вероятность случайности равна 3 %», или, в более наукообразной форме, «вероятность того, что эффекта нет, составляет три процента».
Вспомним определение из прошлого урока: p означает вероятность таких или более крайних данных при условии, что нулевая гипотеза верна. Условие и следствие здесь нельзя менять местами. «Вероятность промокнуть, если идёт дождь» и «вероятность того, что идёт дождь, если вы промокли» дают разные числа, и второе зависит от того, как часто вы принимаете душ.
Посмотрим, насколько сильно они расходятся, на учебном расчёте. Пусть некая область проверяет тысячу гипотез, и пусть верна из них каждая десятая, то есть сто гипотез. Пусть исследования там устроены так, что существующий эффект обнаруживается в шести случаях из десяти: тогда из ста верных гипотез значимый результат дадут шестьдесят. Из девятисот неверных значимый результат дадут сорок пять, попавшие в пятипроцентную зону ложных тревог.
Итого значимых результатов 105, и сорок пять из них ложные. Это около 43 %. То есть при пороге 0,05 доля ошибочных среди объявленных находок оказалась почти в девять раз выше самого порога, и никакой ошибки в расчёте нет, это простое деление 45 на 105.
Отчего так? Оттого, что доля ложных зависит от того, чего в p-значении нет вовсе: от доли истинных гипотез среди проверяемых. Проверяйте правдоподобные гипотезы, и доля ложных находок упадёт. Перебирайте наугад тысячи связей, и она вырастет при том же самом пороге 0,05. Ровно это показал Джон Иоаннидис в работе 2005 года «Why Most Published Research Findings Are False»: доля верных среди значимых результатов зависит от исходной доли истинных гипотез, от мощности исследований и от числа независимо работающих групп.
Оговорка, без которой ссылаться на эту работу нечестно: это эссе с модельным расчётом при заданных допущениях, а не подсчёт реальной доли ложных результатов. Заголовок сильнее содержания. Но сам механизм от этого никуда не девается, ведь он арифметический.
«Вероятность данных при гипотезе» и «вероятность гипотезы при данных» связаны теоремой Байеса, и для перехода от первого ко второму нужно знать, насколько гипотеза была правдоподобна до эксперимента. p-значение этого не знает и знать не может. Поэтому из него в принципе не выводится вероятность того, что вывод верен.
Подмена вторая: p > 0,05 как доказательство отсутствия эффекта
Формулировка в отчётах выглядит невинно: «различий не обнаружено», «связь не подтвердилась», «препарат не показал эффекта». Дальше это читается как «эффекта нет».
Правило, которое стоит запомнить целиком: отсутствие свидетельства эффекта не есть свидетельство отсутствия эффекта.
Числа показывают, насколько разрыв велик. Сначала скажем о единице измерения. Разницу средних удобно делить на стандартное отклонение, и это приём стандартизации из третьего урока, применённый не к одному значению, а к разнице. Получается величина, не зависящая от того, в чём мерили: разница в пять баллов при разбросе баллов в десять это половина стандартного отклонения. Пусть теперь эффект существует и равен трём десятым стандартного отклонения. При разбросе в десять баллов это три балла, сдвиг заметный. Проверим его в исследовании на пятидесяти наблюдениях в каждой группе. Вероятность, что такое исследование объявит результат значимым, составляет около 32 %. Значит, при живом эффекте примерно две трети исследований вернут «различий не обнаружено». Их авторы не ошиблись в расчётах: они просто взяли выборку, на которой этот эффект не виден.
Отсюда вывод, который переворачивает чтение отрицательных результатов: незначимость информативна ровно настолько, насколько велика была способность исследования заметить эффект. При малой выборке она не информативна почти совсем.
Что делать вместо этого? Смотреть не на p-значение, а на интервал возможных значений эффекта. Если исследование дало оценку разницы с интервалом от −0,4 до +0,5 стандартного отклонения, оно не исключило ничего: и внушительная польза, и внушительный вред остались совместимы с данными. Если интервал от −0,02 до +0,03, то отсутствие практически значимого эффекта действительно показано, и это уже содержательный результат, а не пустое место.
Разница между этими двумя случаями огромна, а p-значение в обоих больше 0,05 и выглядит одинаково. Именно это имеет в виду шестой принцип ASA, называя p-значение плохой мерой доказательности самой по себе.
Подмена третья: значимость как важность
О том, что значимость и важность это разные вещи, говорилось в первом уроке. Здесь стоит разобрать механику: почему они разошлись и в какую сторону.
Значимость это свойство пары «эффект и объём выборки», а не свойство эффекта. Одно и то же различие даёт разные p-значения при разных объёмах, и разброс огромен. Возьмём эффект в три десятых стандартного отклонения. При пятидесяти наблюдениях в группе p ≈ 0,13, значимости нет. При ста p ≈ 0,034, значимость есть. При четырёхстах p ≈ 0,00002. Явление одно, вывод меняется три раза, и меняет его только число участников.
Работает и обратное, что удивляет сильнее. Пусть в первом исследовании сорок человек в группе и обнаружен крупный эффект в 0,58 стандартного отклонения. Такое сочетание даёт p = 0,01. Спросим, какой эффект даст то же самое p при четырёх тысячах в группе. Ответ следует из правила корня: выборка больше в сто раз, корень из ста равен десяти, значит и эффект должен быть вдесятеро меньше, около 0,058. Одинаковое p-значение, десятикратная разница в величине. Поэтому фраза «результат высокозначим» ничего не сообщает о том, велик ли эффект.
Живой пример на реальном масштабе. Интернет-магазин проверяет новую страницу оформления заказа: полмиллиона посетителей на каждый вариант, конверсия 3,10 % против 3,20 %. Разница здесь одна десятая процентного пункта, p ≈ 0,004, результат уверенно значим. Содержательно это один дополнительный заказ на тысячу посетителей. Вопрос о том, стоит ли ради него переделывать страницу, упирается в деньги и трудозатраты, и ни p-значение, ни статистика вообще на него не отвечают.
И зеркальный случай: небольшая мастерская сравнивает два способа сборки на двадцати изделиях и получает разницу в четверть часа на изделие при p = 0,2. Незначимо. Экономически четверть часа на изделие это крупная величина, ради которой стоит собрать больше данных, а вовсе не повод закрыть тему.
Отсюда порядок чтения любой работы с числами: сначала размер эффекта и интервал, потом p-значение. Первое отвечает на вопрос «насколько много», а второе на вопрос «насколько это похоже на случайность». Второй вопрос без первого бессмыслен.
Встретив «результат статистически значим», ищите три вещи: величину эффекта в понятных единицах, интервал вокруг неё и объём выборки. Если в тексте есть только p-значение, работа не сообщила главного, и это верно независимо от того, насколько мало p.
Спор, который идёт сейчас
В 2019 году Валентин Амрайн, Сандер Гринленд и Блейк Макшейн опубликовали в Nature комментарий «Retire statistical significance», призыв отказаться от самого деления результатов на значимые и незначимые. Комментарий поддержали 854 подписанта. Предложение состоит не в том, чтобы запретить p-значения, а в том, чтобы перестать превращать их в двоичный вердикт и интерпретировать размеры эффектов и интервалы совместимости.
Аргумент сторонников: дихотомия порождает ровно те три подмены, которые разобраны выше, заставляет читать «незначимо» как «эффекта нет» и создаёт стимул подгонять анализ под порог.
Аргумент противников не менее серьёзен: решения принимать всё равно надо, и без формального критерия отбор превращается в вопрос вкуса и авторитета. Порог, при всей условности, дисциплинирует: он назначается заранее и не зависит от того, понравился ли результат. Отменив его, поле рискует получить не более тонкую интерпретацию, а произвол, замаскированный под неё.
Спор не закрыт. Ни ASA, ни журналы в целом порог не отменили, и статус этого предложения в курсе записан так: спор открыт. Знать надо обе позиции, а не одну.
Отдельный сюжет составляет эксперимент одного журнала. В 2015 году редакторы Basic and Applied Social Psychology Дэвид Трафимоу и Майкл Маркс запретили в своём издании процедуру проверки значимости нулевой гипотезы, p-значения и доверительные интервалы в их частотной трактовке. Это самый радикальный шаг, который кто-либо предпринял, и практикой поля он не стал: остальные журналы за ним не пошли. Показателен он другим. Проблема ощущалась достаточно остро, чтобы редакция пошла на такое решение.
Что делать читателю, пока профессия не договорилась: пользоваться p-значением как одним из показаний, а не как вердиктом. Оно измеряет совместимость данных с моделью, и эту работу оно делает честно. Все остальные работы на него навесили.
Ключевые работы
| Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-133 | 2016 | Первое за более чем 175 лет формальное заявление ассоциации о конкретной статистической практике: шесть принципов о том, что p-значение показывает и чего не показывает. |
| Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 305-307 | 2019 | Комментарий с 854 подписантами: отказаться от дихотомии «значимо / незначимо» в пользу интерпретации размеров эффекта и интервалов совместимости. |
| Trafimow, Marks, редакционная статья в Basic and Applied Social Psychology | 2015 | Журнал запретил проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Эксперимент отдельного издания, не ставший практикой поля. |
| Ioannidis, «Why Most Published Research Findings Are False», PLoS Medicine 2(8): e124 | 2005 | Модельный расчёт: доля верных среди значимых результатов зависит от исходной доли истинных гипотез, мощности и числа независимо работающих групп. |
Что здесь путают
p-значение вычисляется при условии истинности нулевой гипотезы и не является вероятностью гипотезы. Это прямо сформулировано во втором принципе заявления ASA (2016). Условие и следствие переставлять нельзя. Учебный расчёт из урока показывает масштаб расхождения: при пороге 0,05, доле верных гипотез в одну десятую и обнаружении эффекта в шести случаях из десяти доля ложных среди значимых результатов составляет около 43 %, а не 5 %. Чтобы перейти от вероятности данных к вероятности гипотезы, нужна исходная правдоподобность гипотезы, которой p-значение не содержит.
Отсутствие свидетельства эффекта не есть свидетельство отсутствия эффекта. При эффекте в три десятых стандартного отклонения и пятидесяти наблюдениях в группе исследование объявит результат значимым примерно в трети случаев, то есть две трети добросовестных проверок живого эффекта вернут «различий не обнаружено». Отрицательный результат становится информативным только вместе с интервалом: узкий интервал вокруг нуля исключает практически важный эффект, широкий не исключает ничего, а p-значение в обоих случаях выглядит одинаково.
Позиция Amrhein, Greenland и McShane (Nature, 2019) с 854 подписантами: дихотомия «значимо / незначимо» порождает систематические ошибки чтения, и вместо неё следует интерпретировать размеры эффектов и интервалы совместимости. Возражение: решения принимать всё равно нужно, а формальный критерий, назначенный заранее, защищает от подгонки под желаемое лучше, чем экспертное суждение. Ни ASA, ни журналы в целом порог не отменили. Запрет в Basic and Applied Social Psychology (2015) остался экспериментом одного издания. Профессия не сошлась, и обе стороны приводят содержательные доводы.
Термины
- перестановка условияtransposed conditional
- Подмена «вероятности данных при гипотезе» на «вероятность гипотезы при данных». Основа большинства ошибочных прочтений p-значения.
- базовая доля истинных гипотезbase rate of true hypotheses
- Какая часть проверяемых в области гипотез верна до всякого эксперимента. Чем она ниже, тем большая часть значимых результатов оказывается ложными срабатываниями.
- размер эффектаeffect size
- Величина различия или связи в единицах, которые можно истолковать: баллы, минуты, доли, стандартные отклонения. В отличие от p-значения, не зависит от объёма выборки.
- интервал совместимостиcompatibility interval
- То же построение, что доверительный интервал, под названием, предложенным в 2019 году: диапазон значений, совместимых с данными при принятой модели. Название подчёркивает, что интервал не выделяет истинное значение, а очерчивает не отвергнутые.
- свидетельство отсутствияevidence of absence
- Показанное отсутствие практически важного эффекта. Требует узкого интервала вокруг нуля, а не большого p-значения.
- дихотомизацияdichotomization
- Сведение непрерывной величины к двум категориям: превращение p-значения в вердикт «значимо / незначимо». Теряет почти всю информацию.
- проверка значимости нулевой гипотезыnull hypothesis significance testing, NHST
- Стандартная процедура: нулевая модель, тестовая статистика, порог. Именно её запретил в 2015 году журнал Basic and Applied Social Psychology.
- статистическая доказательностьstrength of evidence
- Степень поддержки гипотезы данными. Шестой принцип ASA: p-значение само по себе плохо её мерит.
Практикум · Перевод на точный язык
Задача тут не оценить исследования, а переписать утверждения так, чтобы они означали ровно то, что посчитано. Работа идёт на живом материале, понадобятся три текста с числами: новости, пресс-релизы вузов, аннотации статей.
- Найдите три текста, где встречается «статистически значимо», «достоверно», p-значение или «вероятность случайности». Выпишите из каждого одну фразу дословно.
- Под каждой фразой напишите, что она утверждает по мнению автора, и что на самом деле посчитано. Второе должно начинаться словами «при условии, что нулевая гипотеза верна…».
- Для каждого текста проверьте наличие трёх чисел: размер эффекта в понятных единицах, интервал вокруг него, объём выборки. Отметьте, каких из трёх нет. Обычно нет двух.
- Возьмите учебный расчёт: 1000 проверяемых гипотез, верна одна десятая, эффект обнаруживается в шести случаях из десяти, порог 0,05. Убедитесь, что значимых результатов получается 105 и ложных среди них 45. Затем пересчитайте то же самое, если верна только одна гипотеза из ста, и сравните доли.
- Выберите текст с отрицательным результатом («различий не обнаружено») или, если такого нет, представьте его. Напишите, какое дополнительное сведение превратило бы это в утверждение об отсутствии эффекта. Одно конкретное сведение, а не «побольше данных».
Вопросы для самопроверки
Исследование даёт p = 0,02. Какое прочтение соответствует второму принципу ASA?
- Вероятность того, что эффект существует, равна 98 %
- Вероятность того, что результат случаен, равна 2 %
- Данные плохо совместимы с нулевой моделью: такие или более крайние возникали бы при ней в двух случаях из ста
- Вероятность того, что нулевая гипотеза верна, равна 2 %
В области проверяют 1000 гипотез, верны 100, существующий эффект обнаруживается в шести случаях из десяти, порог 0,05. Какова доля ложных среди значимых результатов?
- 40 %, поскольку эффект обнаруживается в шести случаях из десяти
- 5 %, как и задано порогом
- 10 %, поскольку верна каждая десятая гипотеза
- Около 43 %: 45 ложных на 105 значимых
Два исследования дали одинаковое p = 0,01. В первом 40 человек в группе, во втором 4000. Что можно сказать об эффектах?
- Сравнить нельзя без знания стандартных отклонений
- Во втором исследовании эффект примерно в десять раз меньше
- Эффекты одинаковы, раз одинаковы p-значения
- Во втором исследовании эффект больше, потому что выборка больше
Испытание на 30 участниках не нашло различий: p = 0,3, интервал для эффекта от −0,4 до +0,5 стандартного отклонения. Что установлено?
- Установлено, что эффект меньше 0,5 стандартного отклонения, и этого достаточно
- Установлено, что нужна другая статистическая процедура
- Установлено, что эффекта нет
- Ничего: данные совместимы и с заметной пользой, и с заметным вредом
Комментарий в Nature (2019) призывает отказаться от деления результатов на значимые и незначимые. Каков статус этого предложения?
- Спор открыт: у обеих сторон есть содержательные доводы, порог не отменён
- Принято: ASA отменила порог значимости вслед за публикацией и рекомендовала журналам не печатать слово «значимо»
- Отвергнуто: авторов никто не поддержал, а редакция Nature позже опубликовала опровержение
- Принято в психологии и отвергнуто в медицине: психологические журналы отказались от порога после кризиса воспроизводимости
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Wasserstein, Lazar, «The ASA Statement on p-Values», The American Statistician, 2016: Первоисточник урока, открыт в свободном доступе. Короткий текст, который стоит прочитать целиком хотя бы раз.
- Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 2019: Две страницы призыва отказаться от дихотомии. Читать вместе с возражениями, а не вместо них.