К содержанию
Фонтум Основы статистики Урок 11 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль IV. Проверка гипотез · урок 11 из 24

P-значение простыми словами

Шесть принципов ASA и три подмены, которые они закрывают

p-значение не показывает вероятность того, что гипотеза верна, и не измеряет вероятность того, что данные получены случайно. Это прямо сказано в шести принципах заявления Американской статистической ассоциации 2016 года. Главная ошибка чтения это перестановка условия: подмена «вероятности данных при гипотезе» на «вероятность гипотезы при данных». Большое p-значение говорит об отсутствии свидетельства эффекта, а не о его отсутствии.

заявление ASA 2016 · MIT 18.05, занятие 20 · 45 мин · обновлено 12.09.2026

После урока вы сможете

  • Пересказывать шесть принципов заявления ASA (2016) своими словами
  • Показывать на арифметике, почему p = 0,05 не означает пятипроцентного шанса ошибиться
  • Отличать отсутствие свидетельства эффекта от свидетельства его отсутствия
  • Излагать спор об отказе от порога значимости с аргументами обеих сторон

«Связь подтверждена с вероятностью 99 %: p = 0,01». Фраза из новости, и в ней две ошибки на семь слов.

Первая: p-значение не является вероятностью того, что связь есть. Вторая: 99 % не получается из 0,01 никаким вычитанием, потому что эти числа относятся к разным вопросам.

Такое чтение настолько распространено, что в 2016 году Американская статистическая ассоциация впервые более чем за 175 лет своего существования выпустила формальное заявление о конкретной статистической практике. Не о новом методе, а о том, как читать старый. Заявление написали Рональд Вассерстайн и Николь Лазар, оно занимает несколько страниц в The American Statistician и состоит из шести принципов.

Этот урок разбирает все шесть и три подмены, которые они закрывают. Из всего курса он самый практический: почти всё, что вы прочтёте в исследованиях и новостях, придётся переводить именно с этого языка.

Шесть принципов

Первый. p-значение показывает, насколько данные несовместимы с заданной статистической моделью. Ключевые слова здесь «с заданной моделью»: в неё входит не только отсутствие эффекта, но и все допущения о том, как данные получены.

Второй. p-значение не измеряет вероятность того, что гипотеза верна, и не измеряет вероятность того, что данные получены случайно. Это прямое опровержение обеих ошибок из новости выше.

Третий. Научные и деловые решения не должны приниматься только по тому, перешло ли p-значение определённый порог.

Четвёртый. Корректный вывод требует полной отчётности и прозрачности. p-значение, посчитанное на одной из двадцати проверок, о которых не сообщили, означает совсем не то, что p-значение единственной запланированной проверки. Этому посвящён тринадцатый урок.

Пятый. p-значение не измеряет ни величину эффекта, ни важность результата.

Шестой. Само по себе p-значение плохо мерит доказательность в пользу модели или гипотезы.

Отдельно в заявлении сказано: меньшие p-значения не обязательно означают больший или более важный эффект, а большие не означают отсутствия важности или эффекта. Дальше идут три подмены, каждая из которых нарушает один из принципов, и каждая разбирается на числах.

об источникеЧто это за документ

Ronald L. Wasserstein, Nicole A. Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-133, 2016. Это позиция самой профессиональной ассоциации, а не мнение отдельных критиков метода, и потому спорить с ней ссылкой на «так принято» не получается.

Подмена первая: p как вероятность гипотезы

Самая частая и самая дорогая. Звучит она так: «p = 0,03 значит, что вероятность случайности равна 3 %», или, в более наукообразной форме, «вероятность того, что эффекта нет, составляет три процента».

Вспомним определение из прошлого урока: p означает вероятность таких или более крайних данных при условии, что нулевая гипотеза верна. Условие и следствие здесь нельзя менять местами. «Вероятность промокнуть, если идёт дождь» и «вероятность того, что идёт дождь, если вы промокли» дают разные числа, и второе зависит от того, как часто вы принимаете душ.

Посмотрим, насколько сильно они расходятся, на учебном расчёте. Пусть некая область проверяет тысячу гипотез, и пусть верна из них каждая десятая, то есть сто гипотез. Пусть исследования там устроены так, что существующий эффект обнаруживается в шести случаях из десяти: тогда из ста верных гипотез значимый результат дадут шестьдесят. Из девятисот неверных значимый результат дадут сорок пять, попавшие в пятипроцентную зону ложных тревог.

Итого значимых результатов 105, и сорок пять из них ложные. Это около 43 %. То есть при пороге 0,05 доля ошибочных среди объявленных находок оказалась почти в девять раз выше самого порога, и никакой ошибки в расчёте нет, это простое деление 45 на 105.

Отчего так? Оттого, что доля ложных зависит от того, чего в p-значении нет вовсе: от доли истинных гипотез среди проверяемых. Проверяйте правдоподобные гипотезы, и доля ложных находок упадёт. Перебирайте наугад тысячи связей, и она вырастет при том же самом пороге 0,05. Ровно это показал Джон Иоаннидис в работе 2005 года «Why Most Published Research Findings Are False»: доля верных среди значимых результатов зависит от исходной доли истинных гипотез, от мощности исследований и от числа независимо работающих групп.

Оговорка, без которой ссылаться на эту работу нечестно: это эссе с модельным расчётом при заданных допущениях, а не подсчёт реальной доли ложных результатов. Заголовок сильнее содержания. Но сам механизм от этого никуда не девается, ведь он арифметический.

осторожноПерестановка условия

«Вероятность данных при гипотезе» и «вероятность гипотезы при данных» связаны теоремой Байеса, и для перехода от первого ко второму нужно знать, насколько гипотеза была правдоподобна до эксперимента. p-значение этого не знает и знать не может. Поэтому из него в принципе не выводится вероятность того, что вывод верен.

Подмена вторая: p > 0,05 как доказательство отсутствия эффекта

Формулировка в отчётах выглядит невинно: «различий не обнаружено», «связь не подтвердилась», «препарат не показал эффекта». Дальше это читается как «эффекта нет».

Правило, которое стоит запомнить целиком: отсутствие свидетельства эффекта не есть свидетельство отсутствия эффекта.

Числа показывают, насколько разрыв велик. Сначала скажем о единице измерения. Разницу средних удобно делить на стандартное отклонение, и это приём стандартизации из третьего урока, применённый не к одному значению, а к разнице. Получается величина, не зависящая от того, в чём мерили: разница в пять баллов при разбросе баллов в десять это половина стандартного отклонения. Пусть теперь эффект существует и равен трём десятым стандартного отклонения. При разбросе в десять баллов это три балла, сдвиг заметный. Проверим его в исследовании на пятидесяти наблюдениях в каждой группе. Вероятность, что такое исследование объявит результат значимым, составляет около 32 %. Значит, при живом эффекте примерно две трети исследований вернут «различий не обнаружено». Их авторы не ошиблись в расчётах: они просто взяли выборку, на которой этот эффект не виден.

Отсюда вывод, который переворачивает чтение отрицательных результатов: незначимость информативна ровно настолько, насколько велика была способность исследования заметить эффект. При малой выборке она не информативна почти совсем.

Что делать вместо этого? Смотреть не на p-значение, а на интервал возможных значений эффекта. Если исследование дало оценку разницы с интервалом от −0,4 до +0,5 стандартного отклонения, оно не исключило ничего: и внушительная польза, и внушительный вред остались совместимы с данными. Если интервал от −0,02 до +0,03, то отсутствие практически значимого эффекта действительно показано, и это уже содержательный результат, а не пустое место.

Разница между этими двумя случаями огромна, а p-значение в обоих больше 0,05 и выглядит одинаково. Именно это имеет в виду шестой принцип ASA, называя p-значение плохой мерой доказательности самой по себе.

Подмена третья: значимость как важность

О том, что значимость и важность это разные вещи, говорилось в первом уроке. Здесь стоит разобрать механику: почему они разошлись и в какую сторону.

Значимость это свойство пары «эффект и объём выборки», а не свойство эффекта. Одно и то же различие даёт разные p-значения при разных объёмах, и разброс огромен. Возьмём эффект в три десятых стандартного отклонения. При пятидесяти наблюдениях в группе p ≈ 0,13, значимости нет. При ста p ≈ 0,034, значимость есть. При четырёхстах p ≈ 0,00002. Явление одно, вывод меняется три раза, и меняет его только число участников.

Работает и обратное, что удивляет сильнее. Пусть в первом исследовании сорок человек в группе и обнаружен крупный эффект в 0,58 стандартного отклонения. Такое сочетание даёт p = 0,01. Спросим, какой эффект даст то же самое p при четырёх тысячах в группе. Ответ следует из правила корня: выборка больше в сто раз, корень из ста равен десяти, значит и эффект должен быть вдесятеро меньше, около 0,058. Одинаковое p-значение, десятикратная разница в величине. Поэтому фраза «результат высокозначим» ничего не сообщает о том, велик ли эффект.

Живой пример на реальном масштабе. Интернет-магазин проверяет новую страницу оформления заказа: полмиллиона посетителей на каждый вариант, конверсия 3,10 % против 3,20 %. Разница здесь одна десятая процентного пункта, p ≈ 0,004, результат уверенно значим. Содержательно это один дополнительный заказ на тысячу посетителей. Вопрос о том, стоит ли ради него переделывать страницу, упирается в деньги и трудозатраты, и ни p-значение, ни статистика вообще на него не отвечают.

И зеркальный случай: небольшая мастерская сравнивает два способа сборки на двадцати изделиях и получает разницу в четверть часа на изделие при p = 0,2. Незначимо. Экономически четверть часа на изделие это крупная величина, ради которой стоит собрать больше данных, а вовсе не повод закрыть тему.

Отсюда порядок чтения любой работы с числами: сначала размер эффекта и интервал, потом p-значение. Первое отвечает на вопрос «насколько много», а второе на вопрос «насколько это похоже на случайность». Второй вопрос без первого бессмыслен.

методТри числа вместо одного

Встретив «результат статистически значим», ищите три вещи: величину эффекта в понятных единицах, интервал вокруг неё и объём выборки. Если в тексте есть только p-значение, работа не сообщила главного, и это верно независимо от того, насколько мало p.

Спор, который идёт сейчас

В 2019 году Валентин Амрайн, Сандер Гринленд и Блейк Макшейн опубликовали в Nature комментарий «Retire statistical significance», призыв отказаться от самого деления результатов на значимые и незначимые. Комментарий поддержали 854 подписанта. Предложение состоит не в том, чтобы запретить p-значения, а в том, чтобы перестать превращать их в двоичный вердикт и интерпретировать размеры эффектов и интервалы совместимости.

Аргумент сторонников: дихотомия порождает ровно те три подмены, которые разобраны выше, заставляет читать «незначимо» как «эффекта нет» и создаёт стимул подгонять анализ под порог.

Аргумент противников не менее серьёзен: решения принимать всё равно надо, и без формального критерия отбор превращается в вопрос вкуса и авторитета. Порог, при всей условности, дисциплинирует: он назначается заранее и не зависит от того, понравился ли результат. Отменив его, поле рискует получить не более тонкую интерпретацию, а произвол, замаскированный под неё.

Спор не закрыт. Ни ASA, ни журналы в целом порог не отменили, и статус этого предложения в курсе записан так: спор открыт. Знать надо обе позиции, а не одну.

Отдельный сюжет составляет эксперимент одного журнала. В 2015 году редакторы Basic and Applied Social Psychology Дэвид Трафимоу и Майкл Маркс запретили в своём издании процедуру проверки значимости нулевой гипотезы, p-значения и доверительные интервалы в их частотной трактовке. Это самый радикальный шаг, который кто-либо предпринял, и практикой поля он не стал: остальные журналы за ним не пошли. Показателен он другим. Проблема ощущалась достаточно остро, чтобы редакция пошла на такое решение.

Что делать читателю, пока профессия не договорилась: пользоваться p-значением как одним из показаний, а не как вердиктом. Оно измеряет совместимость данных с моделью, и эту работу оно делает честно. Все остальные работы на него навесили.

Ключевые работы

Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-1332016Первое за более чем 175 лет формальное заявление ассоциации о конкретной статистической практике: шесть принципов о том, что p-значение показывает и чего не показывает.
Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 305-3072019Комментарий с 854 подписантами: отказаться от дихотомии «значимо / незначимо» в пользу интерпретации размеров эффекта и интервалов совместимости.
Trafimow, Marks, редакционная статья в Basic and Applied Social Psychology2015Журнал запретил проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Эксперимент отдельного издания, не ставший практикой поля.
Ioannidis, «Why Most Published Research Findings Are False», PLoS Medicine 2(8): e1242005Модельный расчёт: доля верных среди значимых результатов зависит от исходной доли истинных гипотез, мощности и числа независимо работающих групп.

Что здесь путают

отвергнутоp = 0,03 значит, что вероятность случайности равна 3 %.

p-значение вычисляется при условии истинности нулевой гипотезы и не является вероятностью гипотезы. Это прямо сформулировано во втором принципе заявления ASA (2016). Условие и следствие переставлять нельзя. Учебный расчёт из урока показывает масштаб расхождения: при пороге 0,05, доле верных гипотез в одну десятую и обнаружении эффекта в шести случаях из десяти доля ложных среди значимых результатов составляет около 43 %, а не 5 %. Чтобы перейти от вероятности данных к вероятности гипотезы, нужна исходная правдоподобность гипотезы, которой p-значение не содержит.

отвергнутоp > 0,05 значит, что эффекта нет.

Отсутствие свидетельства эффекта не есть свидетельство отсутствия эффекта. При эффекте в три десятых стандартного отклонения и пятидесяти наблюдениях в группе исследование объявит результат значимым примерно в трети случаев, то есть две трети добросовестных проверок живого эффекта вернут «различий не обнаружено». Отрицательный результат становится информативным только вместе с интервалом: узкий интервал вокруг нуля исключает практически важный эффект, широкий не исключает ничего, а p-значение в обоих случаях выглядит одинаково.

спор открытОт порога статистической значимости пора отказаться совсем.

Позиция Amrhein, Greenland и McShane (Nature, 2019) с 854 подписантами: дихотомия «значимо / незначимо» порождает систематические ошибки чтения, и вместо неё следует интерпретировать размеры эффектов и интервалы совместимости. Возражение: решения принимать всё равно нужно, а формальный критерий, назначенный заранее, защищает от подгонки под желаемое лучше, чем экспертное суждение. Ни ASA, ни журналы в целом порог не отменили. Запрет в Basic and Applied Social Psychology (2015) остался экспериментом одного издания. Профессия не сошлась, и обе стороны приводят содержательные доводы.

Термины

перестановка условияtransposed conditional
Подмена «вероятности данных при гипотезе» на «вероятность гипотезы при данных». Основа большинства ошибочных прочтений p-значения.
базовая доля истинных гипотезbase rate of true hypotheses
Какая часть проверяемых в области гипотез верна до всякого эксперимента. Чем она ниже, тем большая часть значимых результатов оказывается ложными срабатываниями.
размер эффектаeffect size
Величина различия или связи в единицах, которые можно истолковать: баллы, минуты, доли, стандартные отклонения. В отличие от p-значения, не зависит от объёма выборки.
интервал совместимостиcompatibility interval
То же построение, что доверительный интервал, под названием, предложенным в 2019 году: диапазон значений, совместимых с данными при принятой модели. Название подчёркивает, что интервал не выделяет истинное значение, а очерчивает не отвергнутые.
свидетельство отсутствияevidence of absence
Показанное отсутствие практически важного эффекта. Требует узкого интервала вокруг нуля, а не большого p-значения.
дихотомизацияdichotomization
Сведение непрерывной величины к двум категориям: превращение p-значения в вердикт «значимо / незначимо». Теряет почти всю информацию.
проверка значимости нулевой гипотезыnull hypothesis significance testing, NHST
Стандартная процедура: нулевая модель, тестовая статистика, порог. Именно её запретил в 2015 году журнал Basic and Applied Social Psychology.
статистическая доказательностьstrength of evidence
Степень поддержки гипотезы данными. Шестой принцип ASA: p-значение само по себе плохо её мерит.

Практикум · Перевод на точный язык

Задача тут не оценить исследования, а переписать утверждения так, чтобы они означали ровно то, что посчитано. Работа идёт на живом материале, понадобятся три текста с числами: новости, пресс-релизы вузов, аннотации статей.

  1. Найдите три текста, где встречается «статистически значимо», «достоверно», p-значение или «вероятность случайности». Выпишите из каждого одну фразу дословно.
  2. Под каждой фразой напишите, что она утверждает по мнению автора, и что на самом деле посчитано. Второе должно начинаться словами «при условии, что нулевая гипотеза верна…».
  3. Для каждого текста проверьте наличие трёх чисел: размер эффекта в понятных единицах, интервал вокруг него, объём выборки. Отметьте, каких из трёх нет. Обычно нет двух.
  4. Возьмите учебный расчёт: 1000 проверяемых гипотез, верна одна десятая, эффект обнаруживается в шести случаях из десяти, порог 0,05. Убедитесь, что значимых результатов получается 105 и ложных среди них 45. Затем пересчитайте то же самое, если верна только одна гипотеза из ста, и сравните доли.
  5. Выберите текст с отрицательным результатом («различий не обнаружено») или, если такого нет, представьте его. Напишите, какое дополнительное сведение превратило бы это в утверждение об отсутствии эффекта. Одно конкретное сведение, а не «побольше данных».

Вопросы для самопроверки

Вопрос 1

Исследование даёт p = 0,02. Какое прочтение соответствует второму принципу ASA?

  • Вероятность того, что эффект существует, равна 98 %
  • Вероятность того, что результат случаен, равна 2 %
  • Данные плохо совместимы с нулевой моделью: такие или более крайние возникали бы при ней в двух случаях из ста
  • Вероятность того, что нулевая гипотеза верна, равна 2 %
Вопрос 2

В области проверяют 1000 гипотез, верны 100, существующий эффект обнаруживается в шести случаях из десяти, порог 0,05. Какова доля ложных среди значимых результатов?

  • 40 %, поскольку эффект обнаруживается в шести случаях из десяти
  • 5 %, как и задано порогом
  • 10 %, поскольку верна каждая десятая гипотеза
  • Около 43 %: 45 ложных на 105 значимых
Вопрос 3

Два исследования дали одинаковое p = 0,01. В первом 40 человек в группе, во втором 4000. Что можно сказать об эффектах?

  • Сравнить нельзя без знания стандартных отклонений
  • Во втором исследовании эффект примерно в десять раз меньше
  • Эффекты одинаковы, раз одинаковы p-значения
  • Во втором исследовании эффект больше, потому что выборка больше
Вопрос 4

Испытание на 30 участниках не нашло различий: p = 0,3, интервал для эффекта от −0,4 до +0,5 стандартного отклонения. Что установлено?

  • Установлено, что эффект меньше 0,5 стандартного отклонения, и этого достаточно
  • Установлено, что нужна другая статистическая процедура
  • Установлено, что эффекта нет
  • Ничего: данные совместимы и с заметной пользой, и с заметным вредом
Вопрос 5

Комментарий в Nature (2019) призывает отказаться от деления результатов на значимые и незначимые. Каков статус этого предложения?

  • Спор открыт: у обеих сторон есть содержательные доводы, порог не отменён
  • Принято: ASA отменила порог значимости вслед за публикацией и рекомендовала журналам не печатать слово «значимо»
  • Отвергнуто: авторов никто не поддержал, а редакция Nature позже опубликовала опровержение
  • Принято в психологии и отвергнуто в медицине: психологические журналы отказались от порога после кризиса воспроизводимости

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Wasserstein, Lazar, «The ASA Statement on p-Values», The American Statistician, 2016: Первоисточник урока, открыт в свободном доступе. Короткий текст, который стоит прочитать целиком хотя бы раз.
  • Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 2019: Две страницы призыва отказаться от дихотомии. Читать вместе с возражениями, а не вместо них.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?