К содержанию
Фонтум Основы статистики Урок 19 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль VI. Байесовский взгляд · урок 19 из 24

Байесовская статистика и частотный подход

Одни и те же данные, два разных вопроса. И два разных числа

Частотный и байесовский подходы отвечают на разные вопросы: p-значение говорит, насколько необычны данные, если гипотеза верна, а апостериорная вероятность отвечает, насколько вероятна гипотеза после этих данных. Для восьми орлов из десяти бросков p-значение равно 0,055, а апостериорная вероятность смещённости монеты в примере урока равна 43 %, и ошибки нет ни в одном числе. Первый подход не требует априора, второй требует, зато читается напрямую.

MIT 18.05, занятие 20 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Формулировать, на какой вопрос отвечает p-значение и на какой отвечает апостериорная вероятность
  • Показывать на числах, почему при одних данных ответы двух подходов расходятся
  • Называть, что требуется каждому подходу и чего он взамен не обещает
  • Описывать спор о том, какой подход считать основным, не выдавая его за решённый

Монету подбросили десять раз, выпало восемь орлов. Вопрос: смещена ли она?

Первый отчёт: вероятность получить восемь или больше орлов у честной монеты равна 0,055. Второй отчёт: вероятность того, что монета смещена, составляет 43 %. Числа не сходятся никаким очевидным способом, но ошибки в них нет ни одной. Оба посчитаны из одних и тех же восьми орлов и отвечают на разные вопросы.

Урок про то, чем эти вопросы различаются, где расхождение ответов имеет значение и почему подмена одного другим порождает почти все ошибки в чтении статистики.

Два вопроса, а не два способа считать

Частотный вопрос: насколько необычны эти данные, если гипотеза верна? Гипотеза фиксируется, данные считаются случайными, и вычисляется вероятность увидеть наблюдённое или более крайнее при условии, что гипотеза верна. Ответ это p-значение.

Байесовский вопрос: насколько вероятна гипотеза после этих данных? Здесь фиксируются данные. Они уже получены и ни в каком смысле не случайны, а неопределённость приписывается гипотезе. Ответ это апостериорная вероятность.

Условие и следствие меняются местами. Первый подход считает вероятность данных при гипотезе, а второй берёт вероятность гипотезы при данных. Это разные величины, и в пятом уроке уже было видно, насколько сильно они расходятся: вероятность положительного результата теста при болезни и вероятность болезни при положительном результате различаются во много раз, если болезнь редка.

Отсюда и разная плата. Частотный вопрос можно задать, ничего не зная о том, насколько гипотеза правдоподобна сама по себе: достаточно уметь посчитать вероятности данных при нулевой модели. Байесовский вопрос без такого знания ответа не имеет. Чтобы получить вероятность гипотезы, нужен полный список гипотез и априорное распределение по ним. Ни один подход не выдаёт вероятность гипотезы бесплатно, а один её просто не обещает.

Восемь орлов из десяти: оба ответа целиком

Частотный расчёт. Нулевая гипотеза говорит, что монета честная и вероятность орла 0,5. Всего исходов десяти бросков 1024, и при честной монете они равновероятны. Исходов ровно с восемью орлами 45, с девятью орлами 10, с десятью орлами 1. Значит, вероятность получить восемь орлов или больше равна (45 + 10 + 1) / 1024 = 56 / 1024 ≈ 0,055. Это одностороннее p-значение, и читается оно так: если монета честная, такой или более сильный перекос случается примерно в 5,5 % повторений опыта.

Байесовский расчёт. Нужны хотя бы две гипотезы. Возьмём: монета честная (доля орлов 0,5) или заметно смещённая (доля орлов 0,8). Правдоподобием называют вероятность ровно того, что наблюдали, то есть восьми орлов из десяти.

При честной монете это 45 / 1024 ≈ 0,044. При смещённой монете получается 45, умноженное на 0,8 в восьмой степени и на 0,2 в квадрате, то есть примерно 0,302. Отношение правдоподобий равно 0,302 / 0,044 ≈ 6,9. Восемь орлов почти в семь раз вероятнее при смещённой монете, чем при честной. Это сила свидетельства, и она ни от чьих убеждений не зависит.

Дальше нужен априор. Если считать обе версии равновероятными, апостериорные шансы равны 6,9 к 1, то есть вероятность смещения около 87 %. Если считать смещённые монеты редкостью и взять априорные шансы 1 к 9, апостериорные будут 6,9 / 9 ≈ 0,76, то есть вероятность смещения около 43 %. При шансах 1 к 99 она составляет около 6,5 %.

Вот и расхождение, которое надо уметь читать. p-значение равно 0,055, на волосок от привычного порога. Апостериорная вероятность смещения по тому же наблюдению составляет 87 %, 43 % или 6,5 % в зависимости от того, насколько смещённые монеты вообще встречаются. Ни одно из этих чисел не равно 0,055 и не обязано ему равняться: 0,055 говорит про данные, а остальные три про гипотезу.

методОдна техническая деталь с большими последствиями

Частотный расчёт складывает вероятности исходов с восемью, девятью и десятью орлами, то есть учитывает результаты, которых не наблюдали. Байесовский берёт вероятность ровно того, что наблюдали. Отсюда следует, что p-значение зависит от того, что считать более крайним результатом, а значит, от плана эксперимента и от правила остановки. Отношение правдоподобий от этого не зависит.

Что даёт частотный подход

Перечислять надо честно, потому что у каждого подхода есть то, чего нет у другого.

Главное преимущество частотного подхода это контроль частоты ошибок. Процедура строится так, чтобы при многократном применении доля ложных тревог не превышала заданной величины. Если правило «отклонять нулевую гипотезу при p меньше 0,05» применить к тысяче исследований, где эффекта нет, примерно пятьдесят дадут ложное срабатывание, и это число известно заранее, независимо от того, во что верили исследователи. Гарантия относится к процедуре, а не к отдельному результату: в этом одновременно её сила и её предел.

Второе: априор не нужен. Расчёт делается без всяких предположений о том, насколько гипотеза правдоподобна сама по себе. Для регулятора, который принимает результаты от заинтересованной стороны, это не мелочь: никто не может подкрутить вывод, объявив свою гипотезу изначально вероятной.

Третье: процедуры проверяемы и одинаковы для всех. Весь аппарат, разобранный в третьем и четвёртом модулях (доверительный интервал, расчёт мощности, размер эффекта, заранее объявленный план анализа), устроен так, что чужую работу можно пересчитать, не выясняя, что автор думал до данных.

Ограничение ровно одно, и оно принципиальное: получить вероятность гипотезы частотным путём нельзя. p-значение отвечает на вопрос о данных при гипотезе, и никаким преобразованием оно не превращается в ответ на обратный вопрос.

Что даёт байесовский подход

Байесовский подход отвечает на тот вопрос, который обычно и хотят задать. Из этого следуют четыре практических достоинства.

Прямое выражение неопределённости. С утверждением «Вероятность смещения 43 %» можно работать: сопоставить с ценой ошибки, вложить в решение, передать дальше. Вероятностный интервал читается как диапазон, куда, по принятой модели, попадает величина, то есть так, как люди и без того ошибочно читают доверительный.

Естественное накопление свидетельств. Апостериорное распределение одного исследования становится априорным для следующего. Отдельная процедура объединения результатов не нужна: обновление и есть объединение, что показал разбор в прошлом уроке.

Возможность свидетельства в пользу отсутствия эффекта. Частотная проверка несимметрична: она может отклонить нулевую гипотезу, но не может её подтвердить, и незначимый результат означает «не показано», а не «показано, что нет». Отношение правдоподобий симметрично. Оно бывает и меньше единицы, и тогда данные говорят в пользу нулевой гипотезы, и это можно сказать вслух с числом.

Учёт того, насколько гипотеза правдоподобна изначально. Если в области проверяются в основном маловероятные гипотезы, доля верных среди значимых результатов будет низкой даже при безупречном соблюдении порога. Именно такой расчёт делает Ioannidis (2005): доля верных зависит от доли истинных гипотез среди проверяемых, от мощности и от числа работающих групп. Байесовский подход держит эту величину в расчёте с самого начала, а не задним числом.

Плата известна: нужен априор и нужен полный список гипотез. Ответ всегда условен относительно обоих, и сообщать об этом надо вместе с ответом.

Где путаница дороже всего

Самая частая ошибка чтения статистики состоит в том, что ответ на частотный вопрос читают как ответ на байесовский. «p = 0,03» превращается в «вероятность того, что это случайность, равна 3 %», а оттуда в «вероятность того, что эффект есть, равна 97 %». Оба перехода неверны, и заявление ASA (2016) говорит об этом прямо: p-значение не измеряет ни вероятность того, что гипотеза верна, ни вероятность того, что данные получены случайно.

Разобранный пример показывает цену ошибки в числах. p равно 0,055, почти «значимо». Но если смещённые монеты редки и априорные шансы 1 к 9, вероятность смещения составляет 43 %, то есть скорее нет, чем да. Читатель, подставивший 0,055 вместо 43 %, ошибается не на проценты, а в направлении вывода.

Разрыв тем больше, чем меньше априорные шансы гипотезы. Поэтому в областях, где проверяется много неправдоподобных гипотез, значимые результаты воспроизводятся плохо: это не загадка, а арифметика, и одиннадцатый урок разбирал ту же вещь с частотной стороны.

Обратная ошибка встречается реже, но она есть. Апостериорную вероятность иногда читают как объективное свойство данных, забывая, что она посчитана при определённом априоре. 87 % и 6,5 % в нашем примере получены из одного и того же наблюдения. Апостериорная вероятность без указания априора остаётся такой же половиной сообщения, как среднее без разброса из первого урока.

осторожноПроверка на подмену вопроса

Услышав число, спросите, что в нём стоит после слова «при условии». Если условие звучит как «гипотеза верна», перед вами утверждение о данных, и вероятностью гипотезы оно не станет ни при каком пересчёте. Если условие звучит как «данные такие, какие есть», перед вами утверждение о гипотезе, и тогда надо спросить, при каком априоре оно получено.

Спор, который не решён

Естественно спросить, какой подход правильный. У профессии ответа нет, и знать это стоит в точной форме, а не в виде «идёт дискуссия».

Вот что установлено. Заявление ASA 2016 года это первое за более чем 175 лет существования ассоциации формальное высказывание о конкретной статистической практике. Оно критикует не частотный подход, а способ его применения: механические решения по порогу, неполную отчётность, чтение p-значения как меры доказательности. Байесовской альтернативы заявление не предписывает.

В 2019 году в Nature вышел комментарий Amrhein, Greenland и McShane с призывом отказаться от деления результатов на значимые и незначимые, и его подписали 854 человека. Это не отмена частотного подхода, а отказ от дихотомии внутри него в пользу размеров эффекта и интервалов. Возражают на это тем, что без порога решения принимать невозможно, а отказ откроет дорогу произволу. Ни ASA, ни журналы в целом порог не отменили.

Один журнал пошёл дальше. Редакционная статья Trafimow и Marks 2015 года в Basic and Applied Social Psychology запретила проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Практикой поля этот эксперимент не стал.

Практический вывод для читателя не в том, чтобы выбрать сторону. Он в том, чтобы каждый раз определять, на какой вопрос отвечает предъявленное число, и требовать недостающее: к p-значению нужны размер эффекта и интервал, к апостериорной вероятности априор и список гипотез. Оба подхода дают проверяемые ответы. Непроверяемым результат делает не выбор подхода, а умолчание о том, что в него заложено.

об источникеЧто сравнивает занятие 20 в MIT 18.05

В курсе MIT 18.05 сравнению байесовского подхода с проверкой значимости отведено отдельное занятие, и стоит оно после того, как разобраны оба. Порядок там обратный привычному: байесовское обновление даётся на занятиях 11-13, а проверка значимости начинается с семнадцатого. Сравнение поэтому получается не спором школ, а разбором двух техник, каждая из которых уже посчитана руками.

Ключевые работы

Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-1332016Первое за более чем 175 лет формальное заявление ассоциации о статистической практике: p-значение не измеряет вероятность того, что гипотеза верна, и не измеряет вероятность того, что данные получены случайно.
Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 305-3072019Комментарий с 854 подписантами: отказаться от дихотомии «значимо или незначимо» в пользу размеров эффекта и интервалов совместимости. Порог при этом ни ассоциацией, ни журналами не отменён.
Trafimow, Marks, редакционная статья в Basic and Applied Social Psychology2015Журнал запретил проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Эксперимент отдельного издания, не ставший практикой поля.
Ioannidis, «Why Most Published Research Findings Are False», PLoS Medicine 2(8): e1242005Модельный расчёт: доля верных среди значимых результатов зависит от доли истинных гипотез среди проверяемых, от мощности и от числа независимо работающих групп.

Что здесь путают

спор открытБайесовский подход правильнее частотного и должен вытеснить его как основной.

Профессия не сошлась, и обе стороны приводят содержательные доводы. За байесовский подход: он отвечает на тот вопрос, который обычно и хотят задать, то есть насколько вероятна гипотеза после данных. Он умеет говорить и в пользу отсутствия эффекта, чего частотная проверка не умеет. Свидетельства он накапливает перемножением, без отдельной процедуры объединения. Против: ответ всегда условен относительно априора и полноты списка гипотез, а договориться об априоре получается не всегда, например когда результат принимает регулятор от заинтересованной стороны. Частотная процедура взамен даёт то, чего у байесовской нет: заранее известную долю ложных тревог при многократном применении. Заявление ASA (2016) критикует применение порога значимости и байесовской альтернативы при этом не предписывает. Изображать вопрос закрытым нельзя ни в одну сторону. Корректная позиция состоит в том, чтобы знать, на какой вопрос отвечает каждый подход, и требовать того, чего в предъявленном числе не хватает.

отвергнутоp = 0,03 означает, что вероятность нулевой гипотезы равна 3 %.

p-значение вычисляется при условии, что нулевая гипотеза верна, и потому не может быть вероятностью этой гипотезы: условие нельзя одновременно предполагать и оценивать. Заявление ASA (2016) называет это прочтение прямо в числе того, чем p-значение не является. Разобранный пример показывает масштаб расхождения: при p, равном 0,055, вероятность того, что монета смещена, составляет 87 %, 43 % или 6,5 % в зависимости от априора, которого в p-значении нет вовсе.

сильно ослабленоЧастотный подход объективен, потому что не требует априора.

Верно в узком смысле: априорного распределения по гипотезам частотная процедура действительно не требует, и это её реальное преимущество там, где договориться об априоре невозможно. Но выборов в ней не меньше. На p-значение влияет многое (какая модель принята за нулевую, какая величина взята статистикой, что считается более крайним результатом, когда прекращён сбор данных), и последний пункт особенно: изменение правила остановки меняет число, не меняя данных. Разница не в наличии допущений, а в том, что байесовский расчёт обязан их назвать, частотный же нет.

Термины

частотная вероятностьfrequentist probability
Вероятность как предельная доля исходов при многократном повторении опыта. Приписывается данным и процедурам, но не гипотезам.
p-значениеp-value
Вероятность получить такое же или более сильное расхождение с нулевой гипотезой, чем наблюдаемое, при условии что она верна. Не является вероятностью самой гипотезы.
апостериорная вероятность гипотезыposterior probability
Вероятность гипотезы после учёта данных. Всегда условна относительно априора и списка рассматриваемых гипотез.
доверительный интервалconfidence interval
Промежуток, построенный по выборке процедурой с известной долей накрытия истинного значения при многократном повторении. Про отдельный интервал вероятности не утверждается.
вероятностный интервалcredible interval
Интервал, в который апостериорное распределение помещает заданную долю уверенности. Требует априора, зато читается напрямую.
частота ошибок первого родаtype I error rate
Доля ложных отклонений верной нулевой гипотезы при многократном применении процедуры. Свойство процедуры, а не отдельного результата.
нулевая модельnull model
Полное описание того, как выглядели бы данные при отсутствии эффекта. Без него p-значение не определено.

Практикум · Одни данные, два ответа

Задача в том, чтобы посчитать оба ответа для одного набора данных и найти априор, при котором они начинают говорить разное. Нужны бумага и калькулятор, около сорока минут.

  1. Данные: 9 орлов из 12 бросков. Посчитайте одностороннее p-значение. Число исходов с девятью, десятью, одиннадцатью и двенадцатью орлами равно 220, 66, 12 и 1, а всего исходов 4096. Складываем и делим: (220 + 66 + 12 + 1) / 4096 ≈ 0,073.
  2. Посчитайте правдоподобие ровно девяти орлов при честной монете: 220 / 4096 ≈ 0,054. Сравните с числом из шага 1 и запишите одним предложением, почему они разные и какие исходы вошли в первое, но не во второе.
  3. Посчитайте правдоподобие тех же девяти орлов при гипотезе «доля орлов 0,75»: 220, умноженное на 0,75 в девятой степени и на 0,25 в кубе, даёт примерно 0,258. Разделите на результат шага 2, и отношение правдоподобий получится около 4,8.
  4. Переведите отношение в апостериорные вероятности смещения при трёх априорах. Шансы 1 к 1 дают около 83 %, шансы 1 к 4 около 55 %, шансы 1 к 9 около 35 %. Выпишите три числа в столбик рядом с p-значением из шага 1.
  5. Найдите априорные шансы, при которых апостериорная вероятность смещения падает ровно до 50 %: это примерно 1 к 4,8. Затем напишите два-три предложения о том, что означал бы вывод «p = 0,073, но при разумном априоре монета скорее честная» и какое дополнительное сведение нужно, чтобы такой априор назвать.

Вопросы для самопроверки

Вопрос 1

Исследование сообщает p = 0,04. Какое прочтение верно?

  • Если нулевая гипотеза верна, такие или более крайние данные встречаются примерно в 4 % повторений
  • Вероятность того, что эффект есть, равна 96 %
  • Вероятность того, что результат получен случайно, равна 4 %
  • Вероятность того, что нулевая гипотеза верна, равна 4 %
Вопрос 2

В разобранном примере p = 0,055, а апостериорная вероятность смещения монеты равна 43 %. Что это означает?

  • Байесовский расчёт точнее, потому что учитывает больше сведений
  • Числа отвечают на разные вопросы, и оба посчитаны верно
  • В одном из двух расчётов есть ошибка
  • Расхождение показывает, что данных слишком мало
Вопрос 3

Чего требует байесовский расчёт и не требует частотный?

  • Полного списка гипотез и априорного распределения по ним
  • Случайной выборки: частотная процедура работает с любыми данными, а байесовская требует случайного отбора
  • Заранее заданного уровня значимости
  • Большего объёма данных: априор приходится перевешивать, и для этого нужно больше наблюдений
Вопрос 4

Правило «отклонять нулевую гипотезу при p меньше 0,05» применили к тысяче исследований, где эффекта на самом деле нет. Что гарантирует частотный подход?

  • Что 95 % опубликованных результатов окажутся верными
  • Что в каждом отдельном случае вероятность ошибки равна 5 %
  • Что доля верных среди значимых результатов составит 95 %
  • Около 50 ложных срабатываний, и это число известно заранее
Вопрос 5

Как корректно описать положение дел в споре о двух подходах?

  • Спор закрыт в пользу частотного подхода: байесовский признан субъективным и в рецензируемых журналах не публикуется
  • Оба подхода дают одинаковые ответы, и спор чисто терминологический: p-значение и апостериорная вероятность совпадают при равных априорных шансах
  • Профессия не сошлась: ASA критикует применение порога, но не отменяет его и не предписывает байесовскую альтернативу
  • Байесовский подход признан основным после заявления ASA 2016 года, которое прямо рекомендовало перейти к нему

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • MIT 18.05, конспект занятия 20: Занятие 20, сравнение байесовского подхода и проверки значимости: одни данные, два вопроса, два ответа. Читается после того, как обе техники посчитаны руками.
  • Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 2019: Аргумент за отказ от дихотомии значимости, вместе с тем, что этот призыв не предлагает и на что не претендует.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?