К содержанию
Фонтум Основы статистики Урок 12 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль IV. Проверка гипотез · урок 12 из 24

Ошибки первого и второго рода, мощность

Почему маленькое исследование не только пропускает эффекты, но и завышает найденные

Мощность это вероятность обнаружить эффект заданной величины при условии, что он существует. Она равна единице минус вероятность ошибки второго рода. Порог значимости задаёт частоту ложных тревог, а мощность складывается из величины эффекта, разброса и объёма выборки. При малой мощности порог проходят лишь случайно крупные разницы, поэтому маленькое исследование не только пропускает эффекты, но и завышает найденные. Это проклятие победителя.

MIT 18.05, занятия 17-18 · Data 8, гл. 12 · 45 мин · обновлено 12.09.2026

После урока вы сможете

  • Различать ошибку первого и второго рода и понимать, почему они управляются по-разному
  • Считать, какая выборка нужна, чтобы заметить эффект заданной величины
  • Объяснять, почему при малой мощности опубликованные оценки эффекта систематически завышены
  • Отличать величину эффекта от надёжности его обнаружения

Директор учебного центра из десятого урока решил проверить программу как следует и спрашивает: сколько человек набирать?

Вопрос кажется техническим, но ответ на него требует двух решений, которые сама статистика принять не может. Первое: какую разницу между программами имеет смысл замечать, три балла, десять, двадцать? Второе: с какой вероятностью мы хотим её заметить, если она есть? В половине случаев, в четырёх из пяти, в девятнадцати из двадцати?

Пока эти два числа не названы, разговор об объёме выборки беспредметен. А когда они названы, объём вычисляется почти автоматически.

Этот урок посвящён второй половине проверки гипотез. Прошлые два разбирали, что делает тест, когда эффекта нет. Этот разбирает, что он делает, когда эффект есть.

Две ошибки, и они устроены по-разному

Тест может ошибиться двумя способами, и эти способы несимметричны.

Ошибка первого рода состоит в том, чтобы объявить эффект там, где его нет. Ложная тревога. Её вероятность мы задаём сами, выбирая порог: при 0,05 из тысячи проверок совершенно пустых гипотез примерно пятьдесят дадут значимый результат. Хотим меньше, ставим порог 0,01, и ложных тревог будет около десяти на тысячу.

Ошибка второго рода значит не заметить эффект, который есть. Пропуск. И вот её вероятность мы напрямую не задаём, она получается сама, из трёх обстоятельств: насколько эффект велик, насколько сильно величина разбросана и сколько наблюдений собрано.

Эта несимметричность объясняет многое в устройстве процедуры. Уровень значимости печатают во всех работах, потому что он выбран сознательно. Вероятность пропуска не печатают почти нигде, потому что её надо считать отдельно, и она у каждого исследования своя.

Между ошибками есть обмен. Ужесточив порог до 0,01, мы втрое сократили ложные тревоги и одновременно увеличили пропуски, потому что теперь для объявления находки требуется более крупное расхождение. Двигать одну ошибку, не трогая другую, можно только одним способом: собрав больше данных.

Мощность это вероятность обнаружить эффект при условии, что он существует, то есть единица минус вероятность пропуска. Формулировка «вероятность заметить то, что есть» удобнее, и дальше пользуемся ею.

методЧего нет в отрицательном результате

Читая «различий не обнаружено», ищите два числа: интервал для эффекта и мощность, с которой исследование планировалось. Без них фраза не значит ничего, ведь она одинаково совместима с отсутствием эффекта и с неспособностью его увидеть.

Мощность на числах

Величиной эффекта в долях стандартного отклонения одиннадцатый урок уже пользовался, а здесь у неё появляется имя. Разница средних, делённая на стандартное отклонение, называется стандартизованной разностью средних: во сколько типичных разбросов укладывается сдвиг. Пять баллов разницы при разбросе баллов в десять это 0,5.

Теперь цифры. Пусть настоящая разница между программами равна половине стандартного отклонения, порог 0,05, группы равные, проверка двусторонняя. Все числа ниже это доля значимых результатов в длинной серии одинаково устроенных исследований, и ровно её считает тренажёр урока: тысяча повторений при заданных эффекте и объёме. Прямо на нём проверяются строки с тридцатью и со ста участниками, а остальные объёмы за его шкалу выходят, но считаются точно так же.

При тридцати участниках в каждой группе вероятность заметить эффект составляет около 49 %. Монетка. Половина честно проведённых исследований этой программы вернёт «различий не обнаружено».

При шестидесяти четырёх в группе она составляет около 81 %. Это то самое «восемьдесят процентов мощности», которое считается приемлемым минимумом при планировании.

При ста в группе выходит около 94 %.

Теперь уменьшим эффект вдвое, до четверти стандартного отклонения. Чтобы сохранить те же 81 %, нужно 256 человек в группе, то есть вчетверо больше. Правило простое и стоит запоминания: вдвое меньший эффект требует вчетверо большей выборки. Мелкие эффекты дороги не немного, а квадратично.

Оттого малые эффекты и остаются в тумане. При эффекте в одну пятую стандартного отклонения и шестидесяти четырёх участниках в группе мощность составляет около 20 %: четыре исследования из пяти вернут «ничего не нашли», хотя эффект есть. Чтобы довести мощность до 81 %, нужно около четырёхсот в группе, а для 95 % около шестисот пятидесяти.

Размер эффекта не зависит от объёма выборки

Пункт, на котором стоит задержаться, потому что его путают чаще прочих.

p-значение зависит от объёма выборки. Размер эффекта не зависит. Это две принципиально разные величины, и они отвечают на разные вопросы.

Размер эффекта оценивает, насколько велико различие. Он измеряется в баллах, минутах, процентных пунктах или в стандартных отклонениях, и от того, сколько человек мы опросили, его истинное значение не меняется никак. Больше наблюдений дают более точную оценку, то есть более узкий интервал вокруг неё, но не более крупный эффект.

p-значение оценивает, насколько результат похож на случайный. Оно меняется от объёма радикально: при разнице в три десятых стандартного отклонения и пятидесяти наблюдениях в группе получится около 0,13, при ста около 0,034, при четырёхстах около 0,00002. Явление одно, вывод о значимости меняется трижды.

Отсюда практическое: когда в отчёте написано «на большей выборке эффект оказался сильнее», почти всегда имеется в виду «оказался значимее». Это разные утверждения, и подмена одного другим прямо нарушает пятый принцип заявления ASA (2016): p-значение не измеряет ни величину эффекта, ни важность результата.

Есть и вторая часть этого пункта, менее очевидная. Величину эффекта надо выбирать до исследования, а не после. Вопрос «какая разница нам интересна» решается содержательно: для учебного центра три балла из ста, вероятно, не стоят переобучения преподавателей, а десять стоят. Этот минимальный интересующий эффект и подставляется в расчёт выборки. Взять его из уже собранных данных нельзя: тогда расчёт превращается в пересказ результата.

Почему малая мощность завышает найденное

До сих пор недостаток мощности выглядел как проблема пропусков: маленькое исследование чаще ничего не находит. Это верно и это половина беды. Вторая половина хуже: малое исследование, когда всё-таки находит, находит слишком много.

Механизм чисто арифметический. Чтобы результат перешёл порог значимости, наблюдённая разница должна превысить примерно две стандартные ошибки. Стандартная ошибка это то, насколько гуляет оценка от выборки к выборке, и при малом объёме она велика. Значит, порог значимости преодолевают только те выборки, в которых разница вышла случайно крупной.

Считаем. Пусть настоящий эффект составляет одну пятую стандартного отклонения, в группе 64 человека. Разброс мы приняли за единицу, раз меряем эффект в стандартных отклонениях, поэтому стандартная ошибка среднего в каждой группе равна единице, делённой на корень из 64, и это 0,125. А разбросы двух средних складываются по правилу седьмого урока, через сумму квадратов: корень из 0,125 в квадрате плюс 0,125 в квадрате даёт около 0,18. Это и есть стандартная ошибка разности. Чтобы получить значимость, наблюдённая оценка должна быть не меньше примерно 1,96 × 0,18 ≈ 0,35.

Истина равна 0,20. Порог равен 0,35. Значит, любая опубликованная из такого исследования оценка завышена как минимум на три четверти, и это не ошибка авторов, а условие попадания в печать. Средняя оценка среди тех, что перешли порог, будет около 0,45, более чем вдвое выше истины.

Теперь тот же эффект при четырёхстах в группе. Тем же счётом: единица на корень из 400 это 0,05 в каждой группе и около 0,071 на разность. Минимальная значимая оценка выходит около 0,14, то есть ниже истинных 0,20. Значимыми становятся и заниженные оценки, и систематического перекоса нет. Мощность здесь 81 %, и она же лечит завышение.

Это тот же механизм отбора, что в уроке про выборку, только отбираются не люди, а результаты: в литературу проходят те, что дотянули до порога. У явления есть имя, проклятие победителя.

Сюда же укладывается закономерность, которую нашли большие проекты по воспроизводимости. У Open Science Collaboration (2015) средний размер эффекта в ста повторённых психологических исследованиях упал с r = 0,403 примерно до 0,20. У Camerer и др. (2018) размеры эффекта в репликациях составили около половины исходных, а у Camerer и др. (2016) в экономических экспериментах около двух третей. Систематическое снижение объясняется отбором по значимости и не требует предположения о недобросовестности кого бы то ни было. К этим проектам курс вернётся в двадцатом и двадцать втором уроках.

осторожноМалая выборка плюс крупный эффект дают повод насторожиться

Сочетание «маленькое исследование обнаружило внушительный эффект» выглядит убедительно, а означает ровно противоположное: при малой мощности значимым мог стать только внушительный эффект, каким бы ни было истинное значение. Ждать, что репликация подтвердит величину, оснований нет.

Расчёт до, а не после

Собрать расчёт целиком просто. Нужны четыре числа: порог значимости, желаемая мощность, минимальный интересующий эффект и разброс величины. Первые два сводятся к решению о цене ошибок, третий к содержательному решению, а четвёртый берётся из прошлых данных или из пилотного замера.

Для учебного центра: разница в пять баллов при разбросе в десять это эффект 0,5. Если директор хочет замечать такую разницу в четырёх случаях из пяти, ему нужно около 64 человек в каждой группе, то есть 128 всего. Если он готов довольствоваться мощностью 50 %, хватит тридцати в группе, но тогда половина проверок его же собственной программы закончится ничем.

Порядок важен: расчёт делается до сбора данных. Мощность, посчитанная после и по тому же результату, ничего не добавляет, она пересказывает уже полученное p-значение другими словами. Информативен только расчёт, опирающийся на заранее названную величину эффекта.

И последнее следствие, ради которого этот урок стоит в модуле. Слабое исследование не нейтрально. Оно не просто «менее полезно, чем сильное», оно поставляет в литературу завышенные оценки и незначимые результаты, которые потом читаются как отсутствие эффекта. Десять слабых исследований не складываются в одно сильное: они складываются в смещённую картину. Поэтому вопрос «какова была мощность» относится к тем немногим, которые стоит задавать любой работе с числами.

тренажёр урока 12

Мощность и завышение

Эффект существует и равен заданной величине. Проводим тысячу исследований подряд и смотрим, в скольких он будет замечен и каким он окажется в тех, что попали бы в публикацию.

Открыть тренажёр

Ключевые работы

Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science2015Сто повторённых психологических исследований: значимый результат в 97 % оригиналов и 36 % репликаций, средний размер эффекта упал с r = 0,403 примерно до 0,20.
Camerer и др., Nature Human Behaviour2018Двадцать один социально-научный эксперимент из Nature и Science с предрегистрированными планами анализа: воспроизвелись 13 из 21, размер эффекта составил около половины исходного.
Camerer и др., Science2016Восемнадцать лабораторных экономических экспериментов. Репликации по заранее опубликованным планам анализа, мощность не ниже 90 %: воспроизвелись 11 из 18, размер эффекта в среднем около двух третей исходного.

Что здесь путают

отвергнутоМощность нужна для того, чтобы не пропустить эффект.

Это лишь одно из её следствий, и не самое важное. Малая мощность вдобавок систематически завышает те эффекты, которые всё-таки объявлены найденными: при истинном эффекте в одну пятую стандартного отклонения и шестидесяти четырёх наблюдениях в группе порог значимости преодолевают только оценки от 0,35 и выше, то есть завышенные минимум на три четверти. И она же снижает долю верных среди объявленных находок, потому что уменьшает числитель, то есть число обнаруженных истинных эффектов, при неизменном числе ложных тревог. Недостаток мощности портит не только отрицательные результаты, но и положительные.

отвергнутоНа большей выборке эффект получается сильнее.

Путаница величины и надёжности. Объём выборки управляет точностью оценки и p-значением, а не самим эффектом: при разнице в три десятых стандартного отклонения p меняется от 0,13 при пятидесяти наблюдениях в группе до 0,00002 при четырёхстах, тогда как эффект всё это время один и тот же. Большая выборка даёт более узкий интервал вокруг оценки, и всё. Пятый принцип заявления ASA (2016) формулирует это прямо: p-значение не измеряет ни величину эффекта, ни важность результата.

выдержалоОтобранные по значимости оценки завышены, и повторение их уменьшает.

Держится под давлением и объясняется без предположения о недобросовестности. У Open Science Collaboration (2015) средний размер эффекта в репликациях упал примерно вдвое, у Camerer и др. (2018) составил около половины исходного, а у Camerer и др. (2016) в экономике около двух третей. Причина арифметическая: публикуются результаты, перешедшие порог значимости, а при недостаточной мощности перейти его могут только случайно завышенные оценки. Повторение с большей выборкой возвращает величину к истинной, и падение тут не аномалия, а ожидаемое поведение системы.

Термины

ошибка первого родаType I error
Объявление эффекта при верной нулевой гипотезе. Её вероятность задаётся исследователем через выбор порога.
ошибка второго родаType II error
Пропуск существующего эффекта. Её вероятность не задаётся напрямую, а складывается из величины эффекта, разброса и объёма выборки.
мощностьstatistical power
Вероятность обнаружить эффект заданной величины при условии, что он существует. Она равна единице минус вероятность ошибки второго рода. Низкая мощность делает незначимость неинформативной, а значимость завышенной.
стандартизованная разность среднихstandardized mean difference, Cohen's d
Разница средних, делённая на стандартное отклонение: во сколько типичных разбросов укладывается сдвиг. Позволяет сравнивать эффекты, измеренные в разных единицах.
расчёт мощностиpower analysis
Вычисление необходимого объёма выборки по порогу значимости, желаемой мощности, минимальному интересующему эффекту и разбросу. Делается до сбора данных.
минимальный интересующий эффектsmallest effect size of interest
Наименьшая величина различия, которую имеет смысл замечать. Решение содержательное, а не статистическое, и берётся оно из цены решения, а не из данных.
отбор по значимостиsignificance filter
Механизм, при котором в литературу попадают только результаты, перешедшие порог. Действует на результаты так же, как смещение выборки на людей.
проклятие победителяwinner's curse
Завышение оценок, прошедших отбор: при малой мощности порога значимости достигают лишь те выборки, где разница вышла случайно крупной, поэтому опубликованная величина систематически выше истинной.

Практикум · Сколько людей нужно, чтобы это заметить

Задание на тренажёре «Мощность» и на бумаге. Цель состоит в том, чтобы своими глазами увидеть, как мощность зависит от эффекта и объёма, и как малая мощность завышает найденное.

  1. Откройте тренажёр и поставьте эффект в половину стандартного отклонения. Меняя объём группы, найдите значения, при которых мощность равна примерно 50 %, 80 % и 95 %. Запишите три пары чисел.
  2. Уменьшите эффект вдвое, до четверти стандартного отклонения, и снова найдите объём для мощности 80 %. Сравните с результатом первого шага и проверьте правило: вдвое меньший эффект требует вчетверо большей выборки.
  3. Поставьте эффект 0,2 и объём 65 в группе, это ближайшее к шестидесяти четырём, что даёт шкала. Посмотрите на распределение получаемых оценок и отметьте, какие из них перешли порог значимости. Убедитесь, что порог преодолевают только оценки примерно от 0,35, тогда как истинное значение 0,20.
  4. Не меняя эффекта, доведите объём до трёхсот в группе, это потолок шкалы, и порог значимости там уже около 0,16, то есть ниже истинных 0,20. Повторите наблюдение и запишите одним предложением, что произошло с завышением значимых оценок и почему.
  5. Возьмите любое исследование или отчёт с отрицательным результатом вида «различий не обнаружено», «эффект не подтвердился». Найдите объём выборки и прикиньте по тренажёру, какой эффект это исследование заметило бы в четырёх случаях из пяти. Сформулируйте вывод: какие эффекты работа исключила, а какие не могла бы обнаружить в принципе.

Вопросы для самопроверки

Вопрос 1

Исследование планируют так, чтобы заметить эффект в половину стандартного отклонения. При тридцати участниках в группе мощность около 49 %. Что это означает?

  • Эффект будет обнаружен, но его величина будет занижена вдвое
  • Вероятность ошибки в этом исследовании равна 49 %
  • Если эффект такой величины существует, примерно половина таких исследований его не обнаружит
  • Примерно половина результатов такого исследования будет ложными
Вопрос 2

Настоящий эффект равен 0,2 стандартного отклонения, в группе 64 человека, порог значимости обычный. Какими окажутся опубликованные оценки этого эффекта?

  • Не меньше примерно 0,35, то есть завышенными как минимум на три четверти
  • Примерно 0,2: оценка несмещённая
  • Меньше 0,2, поскольку малые выборки занижают эффекты: шум размывает разницу и тянет оценку к нулю
  • Любыми: отбор по значимости на величину оценки не влияет, он лишь отсеивает часть работ целиком
Вопрос 3

Компания увеличила выборку A/B-теста со 100 до 10 000 пользователей на ветку. Что произойдёт с размером эффекта?

  • Эффект станет больше, потому что данных больше
  • Эффект станет меньше, потому что случайные колебания усреднятся
  • Оценка станет точнее, а сам эффект не изменится
  • Эффект станет значимее, а значит, и больше
Вопрос 4

Испытание на 40 участниках не обнаружило эффекта. Что нужно, чтобы прочитать этот результат осмысленно?

  • Повторение испытания на тех же сорока участниках
  • Интервал для эффекта и мощность, с которой исследование планировалось
  • Уточнение, применялся ли односторонний критерий
  • Точное значение p, а не просто «больше 0,05»
Вопрос 5

Почему средний размер эффекта в проектах по воспроизводимости систематически ниже исходного?

  • Авторы оригинальных работ подтасовывали данные: иначе одинаковое падение размера эффекта во всех проектах не объяснить
  • Эффекты в психологии со временем ослабевают: это известное явление затухания, и наблюдается оно только в психологии
  • Репликации проводились менее тщательно, чем оригиналы: у повторяющих нет ни материалов, ни опыта авторов
  • Публикуются результаты, перешедшие порог, а при малой мощности это преимущественно случайно завышенные оценки

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • MIT 18.05, конспекты занятий 17-18: Ошибки первого и второго рода, области отклонения, t-критерии в классическом изложении с формулами.
  • Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 12: Сравнение двух выборок у Berkeley: та же логика через перестановки, с оценкой различия, а не только с вердиктом о значимости.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?