Нормальное распределение: откуда берётся колокол и где его искать не надо
Нормальное распределение это симметричное колоколообразное распределение, к которому стремится распределение выборочных средних, как бы ни была распределена исходная величина. Из-за этого оно занимает в статистике столько места. Но само по себе оно не свойство большинства реальных величин: доходы, размеры городов, продажи книг колоколом не описываются, и правило «два стандартных отклонения» к ним не применимо.
Нормальное распределение: симметричное колоколообразное распределение, к которому стремится распределение средних. Не свойство большинства реальных величин.
Откуда оно берётся
Центральная предельная теорема словами: если брать выборки одного размера из одной совокупности и считать по каждой среднее, то распределение этих средних при достаточно большом размере выборки будет близко к нормальному независимо от того, как распределена исходная величина. Разброс средних при этом сжимается по корню из размера выборки.
Отсюда и место нормального распределения в технике. Оно возникает не в данных, а в оценках: почти всё, что статистика считает по выборке, это среднее или величина, сводящаяся к среднему. Нормальность появляется на выходе процедуры, а не на входе, и путаница этих двух мест даёт самую частую ошибку в разговорах о «нормальности данных».
Где оно правдоподобно, а где нет
Величин, для которых нормальность правдоподобна, немного, и все они устроены как сумма множества мелких независимых вкладов: ошибки измерения, рост в однородной популяции, отклонения размера детали в стабильном процессе. Доход человека не сумма многих независимых сопоставимых слагаемых, а одна величина, полученная механизмом другого устройства. Реальные распределения доходов вытянуты вправо и имеют тяжёлый хвост.
Рабочая проверка для любого графика в виде колокола: о чём это распределение, о самих объектах или об их средних? Если о самих объектах, нормальность надо обосновывать данными, а не теоремой. Тренажёр урока берёт заведомо ненормальную величину и показывает, как форма исходных данных остаётся прежней, а средние выстраиваются в колокол.
Где ошибаются
Самое частое злоупотребление теоремой это вывод, что раз она универсальна, то и нормальное распределение встречается повсюду. Из теоремы этого не следует. Она говорит о суммах и средних многих независимых слагаемых, а не о любой величине.
Вторая ошибка практическая: применять правило «95 % значений лежат в пределах двух стандартных отклонений» к доходам, размерам страховых выплат или длительности обращений в поддержку. У величин с тяжёлым хвостом стандартное отклонение плохо описывает разброс, и «редкое» событие в четыре сигмы оказывается обычным.
Вопросы
- Какие параметры у нормального распределения?
- Два: среднее задаёт положение центра колокола, стандартное отклонение задаёт его ширину. Около 68 % значений лежат в пределах одного отклонения от среднего, около 95 % в пределах двух.
- Почему нормальное распределение называют гауссовым?
- По имени Карла Гаусса, который использовал его для описания ошибок измерения в астрономии в 1809 году. Раньше ту же кривую вывел де Муавр как предел биномиального распределения.
- Как проверить, нормально ли распределены данные?
- Сначала спросить, есть ли основания ждать нормальности: сумма ли это многих мелких вкладов. Потом смотреть на гистограмму и график квантилей. Формальные критерии при больших выборках отвергают нормальность почти всегда, при малых почти никогда, и сами по себе мало что решают.
Где это разобрано подробно
Понятие из урока 6 курса «Основы статистики»: Закон больших чисел и центральная предельная теорема. О самом курсе, его программе и источниках рассказано на странице курса.