Нулевая гипотеза
Как выглядел бы мир, в котором ничего не происходит
Нулевая гипотеза это модель порождения данных в мире без интересующего эффекта, заданная настолько полно, что по ней можно моделировать. p-значение равно вероятности получить такое же или более сильное расхождение с этой моделью, чем наблюдаемое, при условии что она верна. В перестановочном тесте его считают перемешиванием ярлыков групп: в задаче о десяти учениках нулевое распределение дают все 252 расклада жеребьёвки.
Data 8, гл. 11 · MIT 18.05, занятие 17 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Строить нулевую модель как процедуру, порождающую данные, а не как фразу «эффекта нет»
- Проводить перестановочный тест на маленьком наборе чисел, доводя счёт до конца
- Формулировать p-значение точно, вместе с условием, при котором оно вычислено
- Объяснять, почему порог 0,05 это соглашение, и что меняется при его сдвиге
В учебном центре десять человек. Жеребьёвкой их разделили на две группы по пять: одна занималась по новой программе, другая по прежней. В конце все написали один и тот же тест на сто баллов.
Новая программа: 62, 71, 74, 79, 84. Прежняя: 55, 58, 66, 68, 73. Средние получились 74 и 64, разница десять баллов в пользу новой.
Директор готов внедрять новую программу везде. Вопрос, ради которого написан этот урок, звучит иначе: насколько часто одна лишь жеребьёвка, при полном отсутствии разницы между программами, разводит этих десятерых по группам так, что средние расходятся на десять баллов и больше?
На этот вопрос можно ответить точно, не прикидкой, а пересчётом всех возможных исходов жеребьёвки. Их ровно 252.
Нулевая модель это процедура, а не фраза
Слова «эффекта нет» сами по себе ничего не позволяют посчитать. Чтобы получить число, нужна модель, порождающая данные: описание того, как выглядели бы наблюдения, если бы интересующего нас механизма не существовало.
В нашем случае такая модель формулируется отчётливо. Пусть каждый из десяти человек написал бы тест ровно на столько баллов, на сколько написал, независимо от программы: 84 это свойство человека, а не методики. Тогда случайность вносит только жеребьёвка, то есть распределение ярлыков «новая» и «прежняя» по уже готовым числам. Наблюдаемая разница средних появляется исключительно из-за того, кому какой ярлык достался.
Это и есть нулевая гипотеза в её рабочем виде. Обратите внимание, что она гораздо содержательнее фразы «программы одинаковы»: в неё зашито и то, что результат человека не зависит от состава его группы, и то, что жеребьёвка была честной, и то, что тест измерял одно и то же в обеих группах. Отвергая нулевую гипотезу, вы отвергаете весь этот пакет целиком, а не только пункт про программы.
Дальше нужны две вещи. Сначала альтернатива: в какую сторону считать расхождение существенным. Здесь директор ждёт роста, значит, нас интересуют исходы, где новая программа впереди. Затем тестовая статистика: одно число, которым измеряется расхождение. Мы берём разницу средних, но это выбор, а не необходимость: можно было взять разницу медиан или разницу долей сдавших выше семидесяти. Разные статистики дают разные ответы, поэтому статистика выбирается до того, как на данные посмотрели.
Логика теста после этого одинакова во всех задачах курса: построить нулевую модель, много раз прогнать её и посмотреть, как часто она сама выдаёт то, что мы увидели, или что-то ещё более крайнее. Никаких формул для этого не требуется.
Её можно выполнить руками. Если модель нельзя воспроизвести колодой карт, монетой или генератором случайных чисел, значит, она сформулирована не до конца и p-значение из неё не получить. Слова «эффекта нет» моделью не работают. А слова «Ярлыки распределены по десяти фиксированным числам случайно, все 252 расклада равновероятны» работают.
Пересчёт всех 252 исходов
Способов выбрать пятерых из десяти ровно 252, столько даёт число сочетаний, и при честной жеребьёвке каждый расклад равновероятен. Малый размер задачи позволяет обойтись без симуляции и перебрать всё.
Считать удобно так. Сумма всех десяти баллов, 690, не меняется от перетасовки. Если в группу с ярлыком «новая» попали числа с суммой S, то во вторую группу попадает 690 − S, а разница средних равна (2S − 690) : 5. Наблюдаемой разнице в десять баллов соответствует S = 370, и это ровно сумма исходной пятёрки: 62 + 71 + 74 + 79 + 84.
Значит, вопрос сводится к арифметике: у скольких из 252 пятёрок сумма 370 или больше? У двенадцати. Самая крупная возможная разница равна 14,4 балла, она получается, когда в одну группу собираются пять лучших результатов, а таких раскладов один.
Двенадцать из 252 дают 0,048. Вот и весь тест. Мы не подставляли ничего в формулу, не смотрели ни в какие таблицы, не предполагали нормальности: мы просто пересчитали, как часто честная жеребьёвка при полном отсутствии эффекта даёт то, что мы увидели, или больше.
Набор всех 252 разниц называется нулевым распределением. Оно симметрично, его центр в нуле, а края уходят до ±14,4. Так и должно быть: перестановка ярлыков не имеет причин тянуть в какую-то сторону. Наблюдённые десять баллов лежат близко к правому краю, но не на самом краю.
Когда наблюдений не десять, а тысяча, перебрать все расклады невозможно, и тогда делают то же самое приблизительно: перемешивают ярлыки десять тысяч раз и считают долю перемешиваний, давших разницу не меньше наблюдённой. Смысл числа при этом не меняется ни на йоту, меняется только способ его получить.
Определение, которое надо выучить дословно
p-значение это вероятность получить такое же или более сильное расхождение, чем наблюдённое, при условии, что нулевая гипотеза верна.
В этом определении три части, и каждая работает.
«Такое же или более сильное». Не «ровно такое». Вероятность получить в точности десять баллов разницы мала сама по себе и ничего не сообщает: у любого конкретного исхода из 252 вероятность 1 : 252, включая совершенно рядовые. Смысл появляется только у хвоста, у множества исходов, которые не менее необычны, чем наш. Поэтому в счёт идут все двенадцать раскладов с разницей 10 и выше, а не один наш.
«При условии, что нулевая гипотеза верна». Все 252 расклада существуют только внутри нулевой модели: это она объявила числа фиксированными, а ярлыки случайными. Мы посчитали свойство этого воображаемого мира. Число 0,048 описывает поведение жеребьёвки, а не программу обучения и не наши убеждения о ней.
«Вероятность». Она относится к процедуре, повторённой много раз, а не к нашему единственному результату. Правильная фраза: «в мире без эффекта такие данные или более крайние появлялись бы примерно в пяти случаях из ста». Неправильная: «вероятность того, что эффекта нет, равна 4,8 %». Вторая фраза говорит о гипотезе, а мы посчитали утверждение о данных. Разбору этой подмены целиком посвящён следующий урок.
Полезно держать в голове и обратное: маленькое p-значение не говорит, какая именно часть нулевой модели неверна. Оно говорит только, что данные плохо совместимы с ней в целом. Если жеребьёвку провели нечестно или в одной группе тест писали в другое время суток, p-значение получится маленьким без всякой разницы между программами.
Потому что редкость надо мерить не событием, а хвостом. Выпадение конкретной последовательности из двадцати бросков монеты имеет вероятность примерно одна миллионная, и всё же какая-то последовательность обязательно выпадет. Удивляться стоит не конкретному исходу, а тому, что он попал в заранее очерченную область необычных.
Порог 0,05 задан соглашением, а не законом природы
Полученные 0,048 меньше 0,05, и по общепринятому соглашению результат объявляется статистически значимым. Прежде чем радоваться, посмотрим, из чего это соглашение сделано.
Мы считали расклады с разницей десять и больше в пользу новой программы. Представим, что директора устраивало бы расхождение в любую сторону, например, он проверял бы, отличаются ли программы вообще. В счёт пошли бы и двенадцать симметричных раскладов, где на десять баллов и больше впереди прежняя программа. Тогда результат был бы 24 из 252, то есть 0,095, и о значимости речи бы не шло.
Одни и те же десять человек, одни и те же баллы, один и тот же расчёт. Значимость появилась или исчезла из-за решения, принятого до просмотра данных: какую именно альтернативу считать интересной.
Порог 0,05 соответствует примерно одному случаю из двадцати. В устройстве мира нет ничего, что менялось бы при переходе от девятнадцати к двадцати одному. Порог мог быть 0,01 или 0,1, но закрепился как удобная договорённость и остался ею. Заявление Американской статистической ассоциации 2016 года формулирует это прямо: научные и деловые решения не должны приниматься только по тому, перешло ли p-значение определённый порог.
Отсюда практический вывод, который стоит принять сразу: p = 0,048 и p = 0,052 это одно и то же свидетельство. Разница между ними меньше, чем разница между 0,048 и 0,004, хотя первые два попадают по разные стороны от порога, а вторые два по одну. Дихотомия «значимо / незначимо» выбрасывает почти всю информацию, которую p-значение несёт.
Уровень значимости 0,05 это доля ложных тревог, которую мы согласны терпеть, если эффекта нет. Он выбирается заранее, исходя из цены ошибки, и разумно ставить его строже там, где ложная тревога дорога. Он не является вероятностью ошибиться в данном конкретном случае и не превращает результат в установленный факт.
Что тест не сказал
Перечислим, чего в наших 0,048 нет. Этот список пригодится в оставшихся уроках модуля.
Он не сказал, что новая программа лучше на десять баллов. Десять баллов посчитаны по пяти наблюдениям в каждой группе, и эта оценка гуляет очень широко. Тест отвечал на вопрос о совместимости данных с нулевой моделью, а не на вопрос о величине выигрыша.
Он не сказал, что выигрыш важен. Стоит ли переучивать преподавателей ради десяти баллов из ста, решается не расчётом, а сопоставлением затрат и пользы.
Он не сказал, что нулевая гипотеза неверна. Двенадцать раскладов из 252 существуют: если бы программы были неотличимы, мы получили бы такой результат примерно в одном опыте из двадцати. Проведя двадцать таких сравнений подряд, один «значимый» результат стоит ожидать даже при полном отсутствии эффектов. Такова тема тринадцатого урока.
И самое важное для практики: тест ничего не сказал о том, что было бы при незначимом результате. Если бы разница составила три балла и p оказался равен 0,4, это не означало бы, что программы одинаковы. На пяти наблюдениях в группе нулевая модель порождает разницы до четырнадцати баллов запросто, так что и настоящий выигрыш в семь баллов утонул бы в этом разбросе незамеченным. Способность теста заметить существующий эффект называется мощностью, и ей посвящён двенадцатый урок.
Модуль устроен так: этот урок дал процедуру, следующий разбирает, что её результат означает и чего не означает, двенадцатый показывает, что происходит, когда процедура ошибается, а тринадцатый смотрит, что происходит, когда её запускают много раз подряд.
Ключевые работы
| Adhikari, DeNero, Wagner, «Computational and Inferential Thinking» | 2022 | Глава 11: проверка гипотез в Berkeley Data 8 вводится через нулевую модель и перестановку ярлыков, без формул и таблиц распределений. |
| Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-133 | 2016 | Принцип третий: научные и деловые решения не должны приниматься только по тому, перешло ли p-значение определённый порог. |
Что здесь путают
В таком виде из неё ничего не вычислить. Работающая нулевая гипотеза задаёт полную модель порождения данных, и кроме отсутствия эффекта в неё входят допущения о механизме отбора, независимости наблюдений и о том, что измерялось одно и то же. Отвергается всегда весь пакет, а не отдельный пункт. Поэтому маленькое p-значение совместимо и с неудачной жеребьёвкой, и с испорченным измерением: оно говорит «данные плохо согласуются с этой моделью», а вопрос о том, какая часть модели виновата, решается не расчётом.
Это соглашение, закрепившееся по удобству. В примере урока одни и те же данные дают 0,048 при одностороннем счёте и 0,095 при двустороннем, так что значимость возникает и исчезает от решения, принятого до просмотра данных. Заявление ASA (2016) прямо говорит, что решения не должны приниматься только по переходу порога. Практическое следствие: p = 0,048 и p = 0,052 несут одинаковое свидетельство, и разделять их на «показано» и «не показано» значит терять информацию, а не соблюдать строгость.
Он не требует предположения о форме распределения, и только. Допущение у него своё и жёсткое: при верной нулевой гипотезе все расклады ярлыков равновероятны. Это выполняется, когда ярлыки действительно назначались случайно, то есть в эксперименте с рандомизацией. Группы могли сложиться и сами, например, новую программу выбрали более мотивированные. Тогда перестановка перестаёт моделировать реальность, а p-значение остаётся аккуратно посчитанным ответом не на тот вопрос.
Термины
- нулевая гипотезаnull hypothesis
- Модель порождения данных, описывающая мир без интересующего эффекта. Её нужно задать настолько полно, чтобы по ней можно было моделировать.
- альтернативная гипотезаalternative hypothesis
- Указание, какие отклонения от нулевой модели считаются существенными и в какую сторону.
- тестовая статистикаtest statistic
- Одно число, которым измеряется расхождение данных с нулевой моделью: разница средних, разница долей, сумма рангов.
- нулевое распределениеnull distribution
- Распределение тестовой статистики, порождённое нулевой моделью. В примере урока его составляют все 252 возможные разницы средних.
- перестановочный тестpermutation test
- Проверка гипотезы перемешиванием ярлыков групп: доля перемешиваний, дающих расхождение не меньше наблюдённого, и есть p-значение.
- p-значениеp-value
- Вероятность получить такое же или более сильное расхождение с нулевой гипотезой, чем наблюдаемое, при условии что она верна. Не является вероятностью самой гипотезы.
- уровень значимостиsignificance level, alpha
- Порог, выбранный заранее. Доля ложных тревог, которую исследователь согласен терпеть при верной нулевой гипотезе.
- статистическая значимостьstatistical significance
- Свойство результата, у которого p-значение оказалось ниже выбранного порога. Свойство пары «данные и порог», а не самого явления.
- односторонний и двусторонний критерийone-tailed and two-tailed test
- Считать ли крайними отклонения в одну сторону или в обе. Решается до просмотра данных: двусторонний счёт примерно удваивает p-значение.
Практикум · Перестановочный тест колодой карт
Тест из этого урока делается руками за полчаса, без компьютера. Понадобятся десять карточек, ручка и лист бумаги. Цель состоит в том, чтобы получить своё нулевое распределение и увидеть, что p-значение это доля, а не магия.
- Выпишите на десять карточек баллы из урока, по одному числу на карточку. Это 62, 71, 74, 79, 84, 55, 58, 66, 68, 73. Или возьмите свои десять чисел с осмысленным делением на две пятёрки: время выполнения задач двумя способами, расходы в две недели, результаты до и после.
- Посчитайте наблюдаемую разницу средних между исходными группами и запишите её крупно вверху листа. Для данных урока это 10 баллов. Это ваш ориентир, дальше вы будете сравнивать с ним.
- Перемешайте все десять карточек, разложите на две кучки по пять, посчитайте разницу средних и запишите её в столбик. Повторите ровно двадцать раз. Считать удобно через суммы: разница средних равна разности сумм, делённой на пять.
- Отметьте в столбике все значения, которые не меньше вашего ориентира. Разделите их количество на двадцать, и получится оценка p-значения по вашим двадцати перемешиваниям. Для данных урока точный ответ 12 : 252, около 0,048, и ваши двадцать попыток дадут либо 0, либо 1 попадание.
- Запишите два предложения. Первое: что именно вы посчитали, причём фразой, начинающейся со слов «при условии, что…». Второе: почему двадцати перемешиваний мало и сколько их нужно, чтобы отличить 0,048 от 0,08. Подсказка: точность доли убывает как корень из числа повторений.
Вопросы для самопроверки
В перестановочном тесте из урока получилось 12 раскладов из 252 с разницей 10 баллов и больше. Что означает число 0,048?
- Вероятность того, что новая программа лучше, равна 95,2 %: единица минус p и есть уверенность в эффекте
- Из ста внедрений новой программы 4,8 % окажутся неудачными: p-значение переводится в долю неудач при массовом применении
- Если бы программы не различались, такую или большую разницу жеребьёвка давала бы примерно в пяти случаях из ста
- Вероятность того, что программы не различаются, равна 4,8 %: p-значение и есть вероятность нулевой гипотезы
Почему в счёт идут все 12 раскладов с разницей 10 и больше, а не только наблюдённый?
- Потому что необычность измеряется хвостом, а вероятность любого конкретного расклада одинаково мала
- Потому что остальные 11 раскладов тоже могли бы наблюдаться в этом эксперименте
- Потому что 12 раскладов дают более надёжную оценку, чем один
- Потому что так получается более круглое число
Те же данные при двустороннем счёте дают p = 0,095. Как это следует читать?
- Данные противоречивы, и тест применён неверно
- Двусторонний счёт точнее, значит, эффекта нет
- Односторонний счёт точнее, значит, эффект есть
- Свидетельство то же самое, а вывод о значимости зависит от заранее выбранной альтернативы
Директор другого центра провёл такой же тест и получил p = 0,4. Что он вправе заключить?
- Что данные хорошо совместимы с нулевой моделью, и только это
- Что программы одинаковы
- Что новая программа бесполезна и внедрять её не надо: при p = 0,4 данные не дают никаких оснований в её пользу
- Что нулевая гипотеза доказана: не отвергнуть при большом p значит то же самое, что принять
Группы сложились не жеребьёвкой: по новой программе занимались те, кто сам на неё записался. Перестановочный тест дал p = 0,03. Что не так?
- Тест неприменим, потому что выборка мала: при пяти наблюдениях в группе перебор 252 раскладов не даёт нужной точности
- Допущение о равновероятности раскладов не выполнено, и число посчитано для не того вопроса
- Ничего, но результат надо пересчитать двусторонним критерием: при самоотборе в группы односторонний счёт занижает p
- Ничего: перестановочный тест не требует допущений и работает с любыми данными, как бы они ни были получены
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», главы 11 и 12: Проверка гипотез и сравнение двух выборок целиком через перестановки. Ровно та подача, которой следует этот урок.
- MIT 18.05, конспект занятия 17: Та же логика в классическом изложении: области отклонения, z-критерий, уровень значимости. Полезно увидеть, что формулы считают то же самое, что перестановка.