К содержанию
Фонтум Основы статистики Урок 8 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль III. Вывод по выборке · урок 8 из 24

Доверительный интервал простыми словами

Девяносто пять процентов это свойство процедуры, а не вашего интервала

Доверительный интервал это промежуток, построенный по выборке процедурой, которая при многократном повторении накрывает истинное значение с известной долей случаев, например 95 %. Эти 95 % относятся к процедуре, а не к отдельному интервалу: конкретный промежуток либо содержит параметр, либо нет, случайность исчерпана выбором выборки. Ширина интервала учитывает только случайную ошибку отбора. Смещение в неё не входит.

MIT 18.05, занятия 22-23 · Data 8, гл. 13 · 45 мин · обновлено 12.09.2026

После урока вы сможете

  • Строить интервал из выборочного распределения, а не из готовой формулы
  • Формулировать, к чему относится «95 %», и не подменять это вероятностью для параметра
  • Читать интервал, включающий ноль, не как доказательство отсутствия эффекта
  • Называть, чего интервал не покрывает: смещение в него не входит

Первая из ста групп прошлого урока получила среднее время дороги 38,7 минуты по выборке в сто человек. Что ей писать в отчёте?

Написать «38,7» значит сообщить число, которое почти наверняка неверно: вероятность того, что истинное среднее по городу равно ровно 38,7, исчезающе мала. Написать «примерно от 35 до 43» значит сообщить и оценку, и её надёжность одним объектом. Второе выглядит слабее и на деле сильнее: из первого сообщения нельзя понять, что стоит за числом, из второго можно.

Урок о том, как такой интервал получается и что означает приписанное к нему «95 %». Второй вопрос важнее первого. Именно там находится самая устойчивая ошибка чтения статистики, и в реестре курса она стоит со статусом «отвергнуто».

Интервал из симуляции, а не из формулы

Начнём с положения всеведущего наблюдателя, в котором мы были в прошлом уроке. Истинное среднее равно 40 минутам при стандартной ошибке 2 минуты для выборки в сто человек, и сто групп дали сто средних, разбросанных вокруг сорока.

Возьмём эти сто чисел, отсортируем и отрежем два-три самых крайних с каждой стороны. Останется середина, примерно от 36 до 44 минут. В этом промежутке лежат 95 оценок из ста. Никакой формулы пока не понадобилось: мы просто посмотрели, где на самом деле оказываются оценки, и отрезали хвосты. Это и есть процентильный способ, на котором строит все свои интервалы Data 8.

Беда в том, что промежуток построен вокруг сорока, а сорока никто не знает. Спасает разворот. Если 95 оценок из ста отстоят от истины не больше чем на 4 минуты, то для тех же 95 случаев верно и обратное: истина отстоит от оценки не больше чем на 4 минуты. Значит, надо взять свою оценку и отложить по 4 минуты в обе стороны.

Что получается у наших групп. Первая: 38,7, интервал от 34,7 до 42,7, сорок внутри. Вторая: 41,4, интервал от 37,4 до 45,4, сорок внутри. Двадцать седьмая, та самая невезучая: 44,8, интервал от 40,8 до 48,8, а сорока внутри нет. Мы это видим, потому что знаем ответ. Сама двадцать седьмая группа не видит ничего, её отчёт неотличим от остальных.

Откуда взялись 4 минуты, если считать не симуляцией, а формулой: это две стандартные ошибки, точнее 1,96 стандартной ошибки, то самое правило двух отклонений из третьего урока. Для среднего оба пути дают почти одинаковый ответ. Но процентильный работает и там, где формулы нет: для медианы, для отношения, для любой величины с несимметричным выборочным распределением, где откладывать поровну в обе стороны просто неверно.

Ширина интервала подчиняется правилу корня. При ста опрошенных это плюс-минус 4 минуты, при четырёхстах плюс-минус 2, при 1600 плюс-минус одна минута. И отдельным рычагом работает уровень доверия. Если резать не по 2,5 % с каждого края, а по 0,5 %, отрезать придётся дальше от центра: вместо 1,96 стандартной ошибки берётся около 2,58, и интервал становится шириной примерно плюс-минус 5,2 минуты. Оба множителя это границы, за которыми у нормально распределённых оценок остаётся 5 % и 1 %. На симуляции они и получаются как места среза хвостов. Бесплатного обеда нет: при том же числе наблюдений можно быть либо увереннее, либо точнее.

методТри числа, которые задают интервал

Оценка (где центр), стандартная ошибка (насколько гуляет оценка) и уровень доверия (сколько хвостов отрезаем). Первые два берутся из данных, третье выбирает исследователь до того, как посмотрит на результат. Выбор уровня после взгляда на данные становится уже приёмом из тринадцатого урока, и он ломает всё.

Что означает «95 %»

Теперь главное. Возьмите готовый интервал первой группы: от 34,7 до 42,7. Истинное среднее равно 40. Оно либо лежит в этом промежутке, либо нет, и здесь уже не осталось ничего случайного. В нашем случае лежит, и говорить о вероятности 95 % бессмысленно: вероятность равна единице. У двадцать седьмой группы интервал от 40,8 до 48,8, истина в него не попала, и вероятность равна нулю. Промежуточных значений не бывает.

Случайность была раньше, в том, какая выборка досталась. Она и есть носитель вероятности: выборка случайна, поэтому случаен интервал, а параметр стоит на месте. Отсюда единственная корректная формулировка: процедура, применённая много раз, даёт интервалы, накрывающие истинное значение примерно в 95 % случаев. О конкретном интервале сказать нечего, кроме того, что он получен процедурой с такой долей успеха.

Реестровая позиция звучит так: «95-процентный доверительный интервал содержит истинное значение с вероятностью 95 %», статус отвергнуто. Не «неточно сказано», а именно неверно: в частотной трактовке у параметра нет распределения вероятностей, он не случайная величина, и приписывать ему вероятность не к чему.

Аналогия, которая держится лучше прочих: сеть, которую забрасывают на рыбу. О сети известно, что она накрывает рыбу в 95 забросах из ста. Заброс сделан, сеть лежит на дне. Рыба либо под ней, либо нет. Спрашивать, с какой вероятностью рыба под этой конкретной сетью, значит спрашивать не о том. Число 95 характеризует сеть и руку, а не результат броска.

Педантизм ли это? Нет, и вот два следствия, из-за которых различие рабочее. Первое: нельзя утверждать, что истинное значение «скорее всего ближе к центру интервала». Частотная процедура не приписывает точкам внутри интервала никаких вероятностей. Разговор о более и менее вероятных значениях параметра идёт уже на байесовском языке, а он требует априорного распределения. Второе: существует интервал, о котором законно сказать «параметр лежит здесь с вероятностью 95 %», и называют его байесовским вероятностным интервалом. Это другой объект, строится он иначе и требует априора. MIT 18.05 разводит их по разным занятиям, и курс вернётся к сравнению в девятнадцатом уроке. Интуитивное прочтение, стало быть, не глупость, просто оно относится к другой конструкции.

Насколько ошибка распространена, видно по реакции. В 2015 году журнал Basic and Applied Social Psychology редакционной статьёй Трафимоу и Маркса запретил у себя проверку значимости и p-значения. Под запрет попали и доверительные интервалы в их частотной трактовке, именно потому, что читатели систематически понимают их как вероятностные утверждения о параметре. Практикой поля этот запрет не стал, но как индикатор он показателен.

мифКак проговорить интервал корректно

Неверно: «истинное значение лежит между 34,7 и 42,7 с вероятностью 95 %». Верно: «интервал от 34,7 до 42,7 получен процедурой, которая накрывает истинное значение в 95 % повторений». Короткая рабочая формулировка: «данные совместимы со значениями от 34,7 до 42,7». Она не обещает вероятности и не теряет содержания.

Широкий интервал честнее узкой точки

Из сказанного легко сделать неверный вывод, будто интервал даёт способ снять с себя ответственность. Наоборот: точка её маскирует.

Пусть три группы работали с выборками не по сто человек, а по 25. Стандартная ошибка тогда 4 минуты, интервал выходит плюс-минус 8. Первая получила 35,2, вторая 44,0, третья 39,5. Как точки эти результаты выглядят противоречащими друг другу: между первым и вторым почти девять минут разницы, это повод для статьи о том, что исследования не сходятся.

Как интервалы они выглядят иначе: от 27,2 до 43,2, от 36,0 до 52,0 и от 31,5 до 47,5. Все три пересекаются в широкой области, и все три совместимы с одним и тем же значением 40. Никакого противоречия нет, есть три честных сообщения о том, что выборка в 25 человек не позволяет сказать больше.

Отсюда правило чтения, которое дальше в курсе не изменится: число без интервала, стандартной ошибки или хотя бы объёма выборки не позволяет понять, о чём оно. Широкий интервал не признак плохой работы, а точное описание того, что купили за эти деньги. Плохая работа это узкий интервал, полученный молчанием об источниках неопределённости.

Интервал, включающий ноль

Чаще всего интервалы строят не для среднего, а для разности: стало лучше или хуже, и насколько. Здесь возникает ошибка, к которой курс вернётся в одиннадцатом уроке, но подготовить её надо сейчас.

Пусть новая схема движения сократила время дороги в среднем на 3 минуты, интервал вышел от минус 1 до плюс 7. Ноль внутри. Стандартное чтение: «эффекта нет, различия незначимы».

Что интервал говорит на самом деле: данные совместимы и с ухудшением на минуту, и с отсутствием изменений, и с выигрышем в семь минут. Единственное, чего он не позволяет, это уверенно назвать знак. Объявить «эффекта нет» значит выбрать из всего промежутка одну точку, ровно ту, что удобна для короткого вывода, и выбросить остальные. Отсутствие свидетельства не есть свидетельство отсутствия.

Насколько это существенно, видно из сравнения двух исследований. Первое даёт интервал от минус 1 до плюс 7 минут. У второго он от минус 0,2 до плюс 0,4 минуты. Оба «включают ноль», и по дихотомии «значимо или незначимо» они неразличимы. Но второе сообщает много: эффект, если он есть, не превышает нескольких десятых минуты, то есть практически отсутствует. Первое не сообщает почти ничего: семь минут выигрыша это уже серьёзно, и они интервалом не исключены. Одинаковый ярлык, противоположное содержание.

Именно ширину выбрасывает разделение результатов на значимые и незначимые. На этом стоит предложение Амрайна, Гринленда и Макшейна в Nature (2019), подписанное 854 исследователями: отказаться от дихотомии и называть такие промежутки интервалами совместимости, интерпретируя их целиком, вместе с обоими концами.

осторожноДва вопроса к любому интервалу для разности

Первый: что означал бы верхний конец, если бы истина была там? Второй: что означал бы нижний? Если оба конца ведут к одному практическому решению, результат содержателен независимо от того, попал ли внутрь ноль. Если решения на концах противоположны, исследование не закончено, и слово «незначимо» этого не исправляет.

Чего интервал не покрывает

Интервал считает только случайную ошибку, ту, что возникает из-за одной выборки вместо всех возможных. Больше ничего в него не входит, и это ограничение сильнее всех прочих.

Вернёмся к опросу у выхода из метро, где истинное среднее по пассажирам метро равно 46 минутам при общегородском 40. Выборка в 2500 человек даёт стандартную ошибку 0,4 и интервал примерно от 45,2 до 46,8. Он аккуратный, узкий и не накрывает сорок, и не накроет никогда, сколько ни повторяй процедуру. При этом свои 95 % процедура честно выдерживает: она накрывает то, на что нацелен способ отбора. Смещение сдвинуло мишень, а стрельба осталась кучной.

То же и с ошибками измерения, с формулировкой вопроса, с неответом. Опрос Literary Digest из второго урока при возврате в 2,4 миллиона бюллетеней дал бы интервал вокруг своих 57 % шириной в доли процентного пункта, при итоговых 62 % у противоположного кандидата. Интервал был бы посчитан безупречно и не спас бы ни от чего.

Отсюда чтение фразы «плюс-минус три процентных пункта» в сообщениях об опросах. Это оценка только случайной части, и обычно она наименьшая из проблем такого опроса. Полная фраза звучала бы так: плюс-минус три пункта из-за того, что опрошены не все, плюс неизвестно сколько из-за того, кто именно был опрошен и кто согласился ответить.

Практический вывод простой. Интервал отвечает на вопрос «насколько моё число могло бы оказаться другим при другой такой же выборке». Он не отвечает на вопрос «насколько моё число близко к истине», и разница между этими двумя вопросами и есть весь второй урок.

тренажёр урока 8

Сто интервалов подряд

Истинное среднее совокупности нам известно, оно равно 100. Построим сто доверительных интервалов по ста разным выборкам и посчитаем, сколько из них накрыло истину.

Открыть тренажёр

Ключевые работы

Amrhein, Greenland, McShane, «Retire statistical significance», Nature 567, 305-3072019Комментарий с 854 подписантами: отказаться от дихотомии «значимо или незначимо» в пользу интерпретации размеров эффекта и интервалов совместимости целиком.
Trafimow, Marks, редакционная статья в Basic and Applied Social Psychology2015Журнал запретил проверку значимости нулевой гипотезы, p-значения и доверительные интервалы в частотной трактовке. Эксперимент одного журнала, практикой поля не ставший.
Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-1332016Среди шести принципов: большие p-значения не означают отсутствия эффекта или его важности, прямой аналог правила о ноле внутри интервала.

Что здесь путают

отвергнуто95-процентный доверительный интервал содержит истинное значение с вероятностью 95 %.

В частотной трактовке параметр не случайная величина, у него нет распределения вероятностей, и приписывать ему вероятность попадания некуда. Готовый интервал от 34,7 до 42,7 либо содержит истинное значение, либо нет: единица или ноль, ничего между. Число 95 % относится к процедуре, к доле интервалов, накрывающих параметр при многократном повторении отбора. Это не педантизм: из ошибочного прочтения следуют утверждения о том, что истина «скорее всего ближе к центру», а таких утверждений частотная процедура не даёт. Вероятностное высказывание о параметре законно только в байесовском вероятностном интервале, который строится иначе и требует априорного распределения.

отвергнутоЕсли интервал включает ноль, значит эффекта нет.

Интервал от минус 1 до плюс 7 совместим и с нулём, и с семью минутами выигрыша. Выбрать из него единственную точку, ноль, и объявить её результатом значит выбросить всё остальное. Отсутствие свидетельства эффекта не есть свидетельство отсутствия эффекта, и при малой выборке такой интервал почти неинформативен. Показательно сравнение: промежуток от минус 0,2 до плюс 0,4 тоже включает ноль, но говорит, что эффект в лучшем случае ничтожен. Одинаковый ярлык «незначимо», прямо противоположное содержание, и разницу между ними видно только по ширине.

спор открытРаз дихотомия «значимо или незначимо» вводит в заблуждение, от порога значимости надо отказаться и говорить только интервалами.

Такое предложение сделано в Nature в 2019 году Амрайном, Гринлендом и Макшейном и поддержано 854 подписантами. Возражение оппонентов содержательно. Решения о том, публиковать ли, регистрировать ли препарат, менять ли схему движения, принимаются дихотомически, и без явного порога место правила займёт негласное усмотрение, которое хуже поддаётся проверке. Ни Американская статистическая ассоциация, ни журналы в целом порог не отменили. Профессия здесь не сошлась, и обе позиции стоит знать в их сильной форме.

выдержалоЗаявленные 95 % это доля повторений процедуры, накрывающих истинное значение.

Показывается пересчётом, а не обещанием: сто групп, сто выборок, сто интервалов, и примерно 95 из них накрывают истинное среднее, остальные нет. Проверяема именно эта величина, потому что она свойство процедуры. Границ две, и обе жёсткие. О конкретном интервале сказать нечего: истина в нём либо есть, либо нет, и вероятности там уже не осталось. Обратное прочтение стоит в этом же уроке со статусом «отвергнуто». И покрытие считает только случайную ошибку: опрос у выхода из метро даёт интервал от 45,2 до 46,8 при истинных сорока и при этом честно выдерживает свои 95 %, ведь процедура накрывает то, на что нацелен способ отбора.

Термины

доверительный интервалconfidence interval
Промежуток, построенный по выборке процедурой с известной долей накрытия истинного значения при многократном повторении. Про отдельный интервал вероятности не утверждается.
уровень доверияconfidence level
Доля повторений, в которых процедура накрывает параметр: 95 %, 99 %. Выбирается до того, как посмотрели на данные.
накрытиеcoverage
Свойство процедуры: как часто построенные ею интервалы содержат истинное значение. Относится к процедуре, а не к отдельному интервалу.
предел погрешностиmargin of error
Половина ширины интервала, то самое «плюс-минус». Учитывает только случайную ошибку отбора.
процентильpercentile
Значение, ниже которого лежит заданный процент наблюдений. То же, что квантиль из третьего урока, только уровень назван в процентах: девяностый процентиль совпадает с квантилем уровня 0,9.
процентильный методpercentile method
Построение интервала отрезанием равных долей с обоих концов смоделированного выборочного распределения. Не требует симметрии и формул.
интервал совместимостиcompatibility interval
То же построение, что доверительный интервал, под названием, предложенным в 2019 году: диапазон значений, совместимых с данными при принятой модели. Название подчёркивает, что интервал не выделяет истинное значение, а очерчивает не отвергнутые.
интервальная оценкаinterval estimate
Сообщение о параметре в виде промежутка, а не одного числа. Содержит и оценку, и её надёжность.
байесовский вероятностный интервалcredible interval
Промежуток, о котором вероятностное утверждение о параметре законно. Требует априорного распределения. Разбирается в шестой части курса.

Практикум · Двенадцать интервалов и один промах

Задача в том, чтобы увидеть накрытие своими глазами. Ход упражнения возможен только потому, что истинное значение здесь известно заранее: у правильной игральной кости среднее равно 3,5, а стандартное отклонение 1,71. Нужны кость, бумага и около получаса.

  1. Выпишите заранее известное: истинное среднее 3,5, стандартное отклонение 1,71. При девяти бросках стандартная ошибка равна 1,71, делённое на 3, то есть 0,57, а полуширина интервала составит две стандартные ошибки, то есть 1,14.
  2. Бросьте кость девять раз, запишите выпавшие числа и посчитайте их среднее. Постройте интервал: среднее минус 1,14 и среднее плюс 1,14. Например, при среднем 4,0 получится промежуток от 2,86 до 5,14.
  3. Повторите шаг 2 двенадцать раз, всего 108 бросков. Выпишите двенадцать интервалов столбиком, ничего не пересчитывая и не отбрасывая неудачные.
  4. Отметьте галочкой интервалы, содержащие 3,5, и посчитайте долю. Ожидайте одиннадцать или двенадцать из двенадцати. Результат десять из двенадцати тоже не повод для паники, при двенадцати попытках такое случается.
  5. Найдите промахнувшийся интервал и ответьте письменно: чем его девять бросков отличались от остальных и мог ли экспериментатор, видя только эти девять чисел, понять, что промахнулся. Если промаха не случилось ни разу, запишите второй ответ: при доле накрытия 95 % двенадцать попаданий подряд выпадают примерно в 54 случаях из ста, так что это не подтверждение и не опровержение, а один исход из двух вероятных.

Вопросы для самопроверки

Вопрос 1

Группа построила 95-процентный интервал от 34,7 до 42,7 минуты. Какое утверждение корректно?

  • При повторном опросе новое среднее попадёт в этот интервал с вероятностью 95 %: именно эту долю попаданий и обещает уровень доверия
  • 95 % жителей города тратят на дорогу от 34,7 до 42,7 минуты: интервал очерчивает типичный разброс времени в пути
  • Истинное среднее лежит в этом интервале с вероятностью 95 %: после получения данных вероятность переносится с процедуры на готовый интервал
  • Интервал получен процедурой, которая при многократном повторении накрывает истинное значение в 95 % случаев
Вопрос 2

Одно исследование даёт интервал для выигрыша во времени от минус 1 до плюс 7 минут, а другое от минус 0,2 до плюс 0,4 минуты. Что верно?

  • Второе исследование опровергает первое
  • Оба исследования показали отсутствие эффекта
  • Первое исследование сильнее: у него оценка эффекта больше
  • Оба включают ноль, но второе ограничивает эффект долями минуты, а первое почти ничего не исключает
Вопрос 3

Группа хочет вдвое сузить свой интервал. Что для этого нужно?

  • Увеличить выборку в четыре раза
  • Перейти от среднего к медиане
  • Увеличить выборку в два раза
  • Понизить уровень доверия с 95 % до 90 %
Вопрос 4

Опрос у выхода из метро, 2500 человек, интервал от 45,2 до 46,8 минуты, а истинное среднее по городу равно 40. Выборку увеличивают до 25 000. Что произойдёт?

  • Интервал станет уже и начнёт накрывать 40
  • Смещение уменьшится примерно в три раза вместе со стандартной ошибкой
  • Интервал станет ещё уже и по-прежнему не будет накрывать 40
  • Интервал не изменится: он уже достиг предела точности
Вопрос 5

В новостях: «рейтинг партии 34 %, погрешность плюс-минус 3 процентных пункта». Чего эта цифра не учитывает?

  • Только погрешность округления до целых процентов: всё остальное, включая неответ, предел погрешности покрывает
  • Всего, кроме случайности отбора: неответа, формулировки вопроса, состава основы выборки
  • Ничего: это полная оценка возможной ошибки, в неё входят и отбор, и неответ, и формулировка вопроса
  • Ничего существенного, если выборка достаточно велика: при больших объёмах смещение отбора становится пренебрежимо малым

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 13: Оценивание: интервалы строятся отрезанием хвостов у смоделированного распределения оценки, без единой формулы с квантилями.
  • MIT 18.05, конспекты занятий 22-23: Классическое изложение доверительных интервалов с формулами. Полезно прочесть после этого урока и сверить два пути к одному ответу.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?