Байесовская статистика и частотный подход
Одни и те же данные, два разных вопроса. И два разных числа
Частотный и байесовский подходы отвечают на разные вопросы: p-значение говорит, насколько необычны данные, если гипотеза верна, а апостериорная вероятность отвечает, насколько вероятна гипотеза после этих данных. Для восьми орлов из десяти бросков p-значение равно 0,055, а апостериорная вероятность смещённости монеты в примере урока равна 43 %, и ошибки нет ни в одном числе. Первый подход не требует априора, второй требует, зато читается напрямую.
MIT 18.05, занятие 20 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Формулировать, на какой вопрос отвечает p-значение и на какой отвечает апостериорная вероятность
- Показывать на числах, почему при одних данных ответы двух подходов расходятся
- Называть, что требуется каждому подходу и чего он взамен не обещает
- Описывать спор о том, какой подход считать основным, не выдавая его за решённый
Монету подбросили десять раз, выпало восемь орлов. Вопрос: смещена ли она?
Первый отчёт: вероятность получить восемь или больше орлов у честной монеты равна 0,055. Второй отчёт: вероятность того, что монета смещена, составляет 43 %. Числа не сходятся никаким очевидным способом, но ошибки в них нет ни одной. Оба посчитаны из одних и тех же восьми орлов и отвечают на разные вопросы.
Урок про то, чем эти вопросы различаются, где расхождение ответов имеет значение и почему подмена одного другим порождает почти все ошибки в чтении статистики.
Два вопроса, а не два способа считать
Частотный вопрос: насколько необычны эти данные, если гипотеза верна? Гипотеза фиксируется, данные считаются случайными, и вычисляется вероятность увидеть наблюдённое или более крайнее при условии, что гипотеза верна. Ответ это p-значение.
Байесовский вопрос: насколько вероятна гипотеза после этих данных? Здесь фиксируются данные. Они уже получены и ни в каком смысле не случайны, а неопределённость приписывается гипотезе. Ответ это апостериорная вероятность.
Условие и следствие меняются местами. Первый подход считает вероятность данных при гипотезе, а второй берёт вероятность гипотезы при данных. Это разные величины, и в пятом уроке уже было видно, насколько сильно они расходятся: вероятность положительного результата теста при болезни и вероятность болезни при положительном результате различаются во много раз, если болезнь редка.
Отсюда и разная плата. Частотный вопрос можно задать, ничего не зная о том, насколько гипотеза правдоподобна сама по себе: достаточно уметь посчитать вероятности данных при нулевой модели. Байесовский вопрос без такого знания ответа не имеет. Чтобы получить вероятность гипотезы, нужен полный список гипотез и априорное распределение по ним. Ни один подход не выдаёт вероятность гипотезы бесплатно, а один её просто не обещает.
Восемь орлов из десяти: оба ответа целиком
Частотный расчёт. Нулевая гипотеза говорит, что монета честная и вероятность орла 0,5. Всего исходов десяти бросков 1024, и при честной монете они равновероятны. Исходов ровно с восемью орлами 45, с девятью орлами 10, с десятью орлами 1. Значит, вероятность получить восемь орлов или больше равна (45 + 10 + 1) / 1024 = 56 / 1024 ≈ 0,055. Это одностороннее p-значение, и читается оно так: если монета честная, такой или более сильный перекос случается примерно в 5,5 % повторений опыта.
Байесовский расчёт. Нужны хотя бы две гипотезы. Возьмём: монета честная (доля орлов 0,5) или заметно смещённая (доля орлов 0,8). Правдоподобием называют вероятность ровно того, что наблюдали, то есть восьми орлов из десяти.
При честной монете это 45 / 1024 ≈ 0,044. При смещённой монете получается 45, умноженное на 0,8 в восьмой степени и на 0,2 в квадрате, то есть примерно 0,302. Отношение правдоподобий равно 0,302 / 0,044 ≈ 6,9. Восемь орлов почти в семь раз вероятнее при смещённой монете, чем при честной. Это сила свидетельства, и она ни от чьих убеждений не зависит.
Дальше нужен априор. Если считать обе версии равновероятными, апостериорные шансы равны 6,9 к 1, то есть вероятность смещения около 87 %. Если считать смещённые монеты редкостью и взять априорные шансы 1 к 9, апостериорные будут 6,9 / 9 ≈ 0,76, то есть вероятность смещения около 43 %. При шансах 1 к 99 она составляет около 6,5 %.
Вот и расхождение, которое надо уметь читать. p-значение равно 0,055, на волосок от привычного порога. Апостериорная вероятность смещения по тому же наблюдению составляет 87 %, 43 % или 6,5 % в зависимости от того, насколько смещённые монеты вообще встречаются. Ни одно из этих чисел не равно 0,055 и не обязано ему равняться: 0,055 говорит про данные, а остальные три про гипотезу.
Частотный расчёт складывает вероятности исходов с восемью, девятью и десятью орлами, то есть учитывает результаты, которых не наблюдали. Байесовский берёт вероятность ровно того, что наблюдали. Отсюда следует, что p-значение зависит от того, что считать более крайним результатом, а значит, от плана эксперимента и от правила остановки. Отношение правдоподобий от этого не зависит.
Что даёт частотный подход
Перечислять надо честно, потому что у каждого подхода есть то, чего нет у другого.
Главное преимущество частотного подхода это контроль частоты ошибок. Процедура строится так, чтобы при многократном применении доля ложных тревог не превышала заданной величины. Если правило «отклонять нулевую гипотезу при p меньше 0,05» применить к тысяче исследований, где эффекта нет, примерно пятьдесят дадут ложное срабатывание, и это число известно заранее, независимо от того, во что верили исследователи. Гарантия относится к процедуре, а не к отдельному результату: в этом одновременно её сила и её предел.
Второе: априор не нужен. Расчёт делается без всяких предположений о том, насколько гипотеза правдоподобна сама по себе. Для регулятора, который принимает результаты от заинтересованной стороны, это не мелочь: никто не может подкрутить вывод, объявив свою гипотезу изначально вероятной.
Третье: процедуры проверяемы и одинаковы для всех. Весь аппарат, разобранный в третьем и четвёртом модулях (доверительный интервал, расчёт мощности, размер эффекта, заранее объявленный план анализа), устроен так, что чужую работу можно пересчитать, не выясняя, что автор думал до данных.
Ограничение ровно одно, и оно принципиальное: получить вероятность гипотезы частотным путём нельзя. p-значение отвечает на вопрос о данных при гипотезе, и никаким преобразованием оно не превращается в ответ на обратный вопрос.
Что даёт байесовский подход
Байесовский подход отвечает на тот вопрос, который обычно и хотят задать. Из этого следуют четыре практических достоинства.
Прямое выражение неопределённости. С утверждением «Вероятность смещения 43 %» можно работать: сопоставить с ценой ошибки, вложить в решение, передать дальше. Вероятностный интервал читается как диапазон, куда, по принятой модели, попадает величина, то есть так, как люди и без того ошибочно читают доверительный.
Естественное накопление свидетельств. Апостериорное распределение одного исследования становится априорным для следующего. Отдельная процедура объединения результатов не нужна: обновление и есть объединение, что показал разбор в прошлом уроке.
Возможность свидетельства в пользу отсутствия эффекта. Частотная проверка несимметрична: она может отклонить нулевую гипотезу, но не может её подтвердить, и незначимый результат означает «не показано», а не «показано, что нет». Отношение правдоподобий симметрично. Оно бывает и меньше единицы, и тогда данные говорят в пользу нулевой гипотезы, и это можно сказать вслух с числом.
Учёт того, насколько гипотеза правдоподобна изначально. Если в области проверяются в основном маловероятные гипотезы, доля верных среди значимых результатов будет низкой даже при безупречном соблюдении порога. Именно такой расчёт делает Ioannidis (2005): доля верных зависит от доли истинных гипотез среди проверяемых, от мощности и от числа работающих групп. Байесовский подход держит эту величину в расчёте с самого начала, а не задним числом.
Плата известна: нужен априор и нужен полный список гипотез. Ответ всегда условен относительно обоих, и сообщать об этом надо вместе с ответом.
Где путаница дороже всего
Самая частая ошибка чтения статистики состоит в том, что ответ на частотный вопрос читают как ответ на байесовский. «p = 0,03» превращается в «вероятность того, что это случайность, равна 3 %», а оттуда в «вероятность того, что эффект есть, равна 97 %». Оба перехода неверны, и заявление ASA (2016) говорит об этом прямо: p-значение не измеряет ни вероятность того, что гипотеза верна, ни вероятность того, что данные получены случайно.
Разобранный пример показывает цену ошибки в числах. p равно 0,055, почти «значимо». Но если смещённые монеты редки и априорные шансы 1 к 9, вероятность смещения составляет 43 %, то есть скорее нет, чем да. Читатель, подставивший 0,055 вместо 43 %, ошибается не на проценты, а в направлении вывода.
Разрыв тем больше, чем меньше априорные шансы гипотезы. Поэтому в областях, где проверяется много неправдоподобных гипотез, значимые результаты воспроизводятся плохо: это не загадка, а арифметика, и одиннадцатый урок разбирал ту же вещь с частотной стороны.
Обратная ошибка встречается реже, но она есть. Апостериорную вероятность иногда читают как объективное свойство данных, забывая, что она посчитана при определённом априоре. 87 % и 6,5 % в нашем примере получены из одного и того же наблюдения. Апостериорная вероятность без указания априора остаётся такой же половиной сообщения, как среднее без разброса из первого урока.
Услышав число, спросите, что в нём стоит после слова «при условии». Если условие звучит как «гипотеза верна», перед вами утверждение о данных, и вероятностью гипотезы оно не станет ни при каком пересчёте. Если условие звучит как «данные такие, какие есть», перед вами утверждение о гипотезе, и тогда надо спросить, при каком априоре оно получено.
Спор, который не решён
Естественно спросить, какой подход правильный. У профессии ответа нет, и знать это стоит в точной форме, а не в виде «идёт дискуссия».
Вот что установлено. Заявление ASA 2016 года это первое за более чем 175 лет существования ассоциации формальное высказывание о конкретной статистической практике. Оно критикует не частотный подход, а способ его применения: механические решения по порогу, неполную отчётность, чтение p-значения как меры доказательности. Байесовской альтернативы заявление не предписывает.
В 2019 году в Nature вышел комментарий Amrhein, Greenland и McShane с призывом отказаться от деления результатов на значимые и незначимые, и его подписали 854 человека. Это не отмена частотного подхода, а отказ от дихотомии внутри него в пользу размеров эффекта и интервалов. Возражают на это тем, что без порога решения принимать невозможно, а отказ откроет дорогу произволу. Ни ASA, ни журналы в целом порог не отменили.
Один журнал пошёл дальше. Редакционная статья Trafimow и Marks 2015 года в Basic and Applied Social Psychology запретила проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Практикой поля этот эксперимент не стал.
Практический вывод для читателя не в том, чтобы выбрать сторону. Он в том, чтобы каждый раз определять, на какой вопрос отвечает предъявленное число, и требовать недостающее: к p-значению нужны размер эффекта и интервал, к апостериорной вероятности априор и список гипотез. Оба подхода дают проверяемые ответы. Непроверяемым результат делает не выбор подхода, а умолчание о том, что в него заложено.
В курсе MIT 18.05 сравнению байесовского подхода с проверкой значимости отведено отдельное занятие, и стоит оно после того, как разобраны оба. Порядок там обратный привычному: байесовское обновление даётся на занятиях 11-13, а проверка значимости начинается с семнадцатого. Сравнение поэтому получается не спором школ, а разбором двух техник, каждая из которых уже посчитана руками.
Ключевые работы
| Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-133 | 2016 | Первое за более чем 175 лет формальное заявление ассоциации о статистической практике: p-значение не измеряет вероятность того, что гипотеза верна, и не измеряет вероятность того, что данные получены случайно. |
| Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 305-307 | 2019 | Комментарий с 854 подписантами: отказаться от дихотомии «значимо или незначимо» в пользу размеров эффекта и интервалов совместимости. Порог при этом ни ассоциацией, ни журналами не отменён. |
| Trafimow, Marks, редакционная статья в Basic and Applied Social Psychology | 2015 | Журнал запретил проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Эксперимент отдельного издания, не ставший практикой поля. |
| Ioannidis, «Why Most Published Research Findings Are False», PLoS Medicine 2(8): e124 | 2005 | Модельный расчёт: доля верных среди значимых результатов зависит от доли истинных гипотез среди проверяемых, от мощности и от числа независимо работающих групп. |
Что здесь путают
Профессия не сошлась, и обе стороны приводят содержательные доводы. За байесовский подход: он отвечает на тот вопрос, который обычно и хотят задать, то есть насколько вероятна гипотеза после данных. Он умеет говорить и в пользу отсутствия эффекта, чего частотная проверка не умеет. Свидетельства он накапливает перемножением, без отдельной процедуры объединения. Против: ответ всегда условен относительно априора и полноты списка гипотез, а договориться об априоре получается не всегда, например когда результат принимает регулятор от заинтересованной стороны. Частотная процедура взамен даёт то, чего у байесовской нет: заранее известную долю ложных тревог при многократном применении. Заявление ASA (2016) критикует применение порога значимости и байесовской альтернативы при этом не предписывает. Изображать вопрос закрытым нельзя ни в одну сторону. Корректная позиция состоит в том, чтобы знать, на какой вопрос отвечает каждый подход, и требовать того, чего в предъявленном числе не хватает.
p-значение вычисляется при условии, что нулевая гипотеза верна, и потому не может быть вероятностью этой гипотезы: условие нельзя одновременно предполагать и оценивать. Заявление ASA (2016) называет это прочтение прямо в числе того, чем p-значение не является. Разобранный пример показывает масштаб расхождения: при p, равном 0,055, вероятность того, что монета смещена, составляет 87 %, 43 % или 6,5 % в зависимости от априора, которого в p-значении нет вовсе.
Верно в узком смысле: априорного распределения по гипотезам частотная процедура действительно не требует, и это её реальное преимущество там, где договориться об априоре невозможно. Но выборов в ней не меньше. На p-значение влияет многое (какая модель принята за нулевую, какая величина взята статистикой, что считается более крайним результатом, когда прекращён сбор данных), и последний пункт особенно: изменение правила остановки меняет число, не меняя данных. Разница не в наличии допущений, а в том, что байесовский расчёт обязан их назвать, частотный же нет.
Термины
- частотная вероятностьfrequentist probability
- Вероятность как предельная доля исходов при многократном повторении опыта. Приписывается данным и процедурам, но не гипотезам.
- p-значениеp-value
- Вероятность получить такое же или более сильное расхождение с нулевой гипотезой, чем наблюдаемое, при условии что она верна. Не является вероятностью самой гипотезы.
- апостериорная вероятность гипотезыposterior probability
- Вероятность гипотезы после учёта данных. Всегда условна относительно априора и списка рассматриваемых гипотез.
- доверительный интервалconfidence interval
- Промежуток, построенный по выборке процедурой с известной долей накрытия истинного значения при многократном повторении. Про отдельный интервал вероятности не утверждается.
- вероятностный интервалcredible interval
- Интервал, в который апостериорное распределение помещает заданную долю уверенности. Требует априора, зато читается напрямую.
- частота ошибок первого родаtype I error rate
- Доля ложных отклонений верной нулевой гипотезы при многократном применении процедуры. Свойство процедуры, а не отдельного результата.
- нулевая модельnull model
- Полное описание того, как выглядели бы данные при отсутствии эффекта. Без него p-значение не определено.
Практикум · Одни данные, два ответа
Задача в том, чтобы посчитать оба ответа для одного набора данных и найти априор, при котором они начинают говорить разное. Нужны бумага и калькулятор, около сорока минут.
- Данные: 9 орлов из 12 бросков. Посчитайте одностороннее p-значение. Число исходов с девятью, десятью, одиннадцатью и двенадцатью орлами равно 220, 66, 12 и 1, а всего исходов 4096. Складываем и делим: (220 + 66 + 12 + 1) / 4096 ≈ 0,073.
- Посчитайте правдоподобие ровно девяти орлов при честной монете: 220 / 4096 ≈ 0,054. Сравните с числом из шага 1 и запишите одним предложением, почему они разные и какие исходы вошли в первое, но не во второе.
- Посчитайте правдоподобие тех же девяти орлов при гипотезе «доля орлов 0,75»: 220, умноженное на 0,75 в девятой степени и на 0,25 в кубе, даёт примерно 0,258. Разделите на результат шага 2, и отношение правдоподобий получится около 4,8.
- Переведите отношение в апостериорные вероятности смещения при трёх априорах. Шансы 1 к 1 дают около 83 %, шансы 1 к 4 около 55 %, шансы 1 к 9 около 35 %. Выпишите три числа в столбик рядом с p-значением из шага 1.
- Найдите априорные шансы, при которых апостериорная вероятность смещения падает ровно до 50 %: это примерно 1 к 4,8. Затем напишите два-три предложения о том, что означал бы вывод «p = 0,073, но при разумном априоре монета скорее честная» и какое дополнительное сведение нужно, чтобы такой априор назвать.
Вопросы для самопроверки
Исследование сообщает p = 0,04. Какое прочтение верно?
- Если нулевая гипотеза верна, такие или более крайние данные встречаются примерно в 4 % повторений
- Вероятность того, что эффект есть, равна 96 %
- Вероятность того, что результат получен случайно, равна 4 %
- Вероятность того, что нулевая гипотеза верна, равна 4 %
В разобранном примере p = 0,055, а апостериорная вероятность смещения монеты равна 43 %. Что это означает?
- Байесовский расчёт точнее, потому что учитывает больше сведений
- Числа отвечают на разные вопросы, и оба посчитаны верно
- В одном из двух расчётов есть ошибка
- Расхождение показывает, что данных слишком мало
Чего требует байесовский расчёт и не требует частотный?
- Полного списка гипотез и априорного распределения по ним
- Случайной выборки: частотная процедура работает с любыми данными, а байесовская требует случайного отбора
- Заранее заданного уровня значимости
- Большего объёма данных: априор приходится перевешивать, и для этого нужно больше наблюдений
Правило «отклонять нулевую гипотезу при p меньше 0,05» применили к тысяче исследований, где эффекта на самом деле нет. Что гарантирует частотный подход?
- Что 95 % опубликованных результатов окажутся верными
- Что в каждом отдельном случае вероятность ошибки равна 5 %
- Что доля верных среди значимых результатов составит 95 %
- Около 50 ложных срабатываний, и это число известно заранее
Как корректно описать положение дел в споре о двух подходах?
- Спор закрыт в пользу частотного подхода: байесовский признан субъективным и в рецензируемых журналах не публикуется
- Оба подхода дают одинаковые ответы, и спор чисто терминологический: p-значение и апостериорная вероятность совпадают при равных априорных шансах
- Профессия не сошлась: ASA критикует применение порога, но не отменяет его и не предписывает байесовскую альтернативу
- Байесовский подход признан основным после заявления ASA 2016 года, которое прямо рекомендовало перейти к нему
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- MIT 18.05, конспект занятия 20: Занятие 20, сравнение байесовского подхода и проверки значимости: одни данные, два вопроса, два ответа. Читается после того, как обе техники посчитаны руками.
- Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 2019: Аргумент за отказ от дихотомии значимости, вместе с тем, что этот призыв не предлагает и на что не претендует.