К содержанию
Фонтум Понятия

Главная · Понятия · нормальное распределение

Нормальное распределение: откуда берётся колокол и где его искать не надо

Нормальное распределение это симметричное колоколообразное распределение, к которому стремится распределение выборочных средних, как бы ни была распределена исходная величина. Из-за этого оно занимает в статистике столько места. Но само по себе оно не свойство большинства реальных величин: доходы, размеры городов, продажи книг колоколом не описываются, и правило «два стандартных отклонения» к ним не применимо.

Нормальное распределение: симметричное колоколообразное распределение, к которому стремится распределение средних. Не свойство большинства реальных величин.

Откуда оно берётся

Центральная предельная теорема словами: если брать выборки одного размера из одной совокупности и считать по каждой среднее, то распределение этих средних при достаточно большом размере выборки будет близко к нормальному независимо от того, как распределена исходная величина. Разброс средних при этом сжимается по корню из размера выборки.

Отсюда и место нормального распределения в технике. Оно возникает не в данных, а в оценках: почти всё, что статистика считает по выборке, это среднее или величина, сводящаяся к среднему. Нормальность появляется на выходе процедуры, а не на входе, и путаница этих двух мест даёт самую частую ошибку в разговорах о «нормальности данных».

Где оно правдоподобно, а где нет

Величин, для которых нормальность правдоподобна, немного, и все они устроены как сумма множества мелких независимых вкладов: ошибки измерения, рост в однородной популяции, отклонения размера детали в стабильном процессе. Доход человека не сумма многих независимых сопоставимых слагаемых, а одна величина, полученная механизмом другого устройства. Реальные распределения доходов вытянуты вправо и имеют тяжёлый хвост.

Рабочая проверка для любого графика в виде колокола: о чём это распределение, о самих объектах или об их средних? Если о самих объектах, нормальность надо обосновывать данными, а не теоремой. Тренажёр урока берёт заведомо ненормальную величину и показывает, как форма исходных данных остаётся прежней, а средние выстраиваются в колокол.

Где ошибаются

Самое частое злоупотребление теоремой это вывод, что раз она универсальна, то и нормальное распределение встречается повсюду. Из теоремы этого не следует. Она говорит о суммах и средних многих независимых слагаемых, а не о любой величине.

Вторая ошибка практическая: применять правило «95 % значений лежат в пределах двух стандартных отклонений» к доходам, размерам страховых выплат или длительности обращений в поддержку. У величин с тяжёлым хвостом стандартное отклонение плохо описывает разброс, и «редкое» событие в четыре сигмы оказывается обычным.

Вопросы

Какие параметры у нормального распределения?
Два: среднее задаёт положение центра колокола, стандартное отклонение задаёт его ширину. Около 68 % значений лежат в пределах одного отклонения от среднего, около 95 % в пределах двух.
Почему нормальное распределение называют гауссовым?
По имени Карла Гаусса, который использовал его для описания ошибок измерения в астрономии в 1809 году. Раньше ту же кривую вывел де Муавр как предел биномиального распределения.
Как проверить, нормально ли распределены данные?
Сначала спросить, есть ли основания ждать нормальности: сумма ли это многих мелких вкладов. Потом смотреть на гистограмму и график квантилей. Формальные критерии при больших выборках отвергают нормальность почти всегда, при малых почти никогда, и сами по себе мало что решают.

Где это разобрано подробно

Понятие из урока 6 курса «Основы статистики»: Закон больших чисел и центральная предельная теорема. О самом курсе, его программе и источниках рассказано на странице курса.

Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?