Среднее, медиана, мода и разброс
Почему для зарплат среднее плохой выбор, а для роста хороший
Среднее арифметическое это точка равновесия распределения, чувствительная к выбросам. Медиана это значение, левее и правее которого поровну наблюдений, устойчивое к ним. В компании, где девять зарплат лежат между 60 и 80 тысячами, а десятая равна 900, среднее равно 151,7 тысячи, медиана равна 69, и контору описывает второе число. Меру центра выбирают по форме распределения, а разброс читают через размах, квартили и стандартное отклонение.
Data 8, гл. 7 и 14 · MIT 18.05, занятия 4-6a · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Выбирать меру центра исходя из формы распределения, а не по привычке
- Читать разброс через размах, квартили и стандартное отклонение
- Опознавать несимметричные и двугорбые распределения по косвенным признакам
- Объяснять, почему сводка из одного числа теряет именно то, что нужно для решения
Компания из десяти человек. Зарплаты в тысячах: 60, 62, 65, 65, 68, 70, 72, 75, 80 и 900. Последняя у основателя.
Средняя зарплата равна 151,7 тысячи. Ни один сотрудник столько не получает, и ближайший к среднему отстоит от него в двенадцать раз. Медиана составляет 69 тысяч: половина получает меньше, половина больше. Это число описывает контору, а первое нет.
Отсюда вопрос урока: когда среднее работает, когда нет и что смотреть вместо него.
Три меры центра и когда какая
Среднее арифметическое это сумма, делённая на количество. Его физический смысл сводится к точке равновесия: если бы значения были грузиками на невесомой линейке, среднее было бы точкой опоры. Отсюда и слабость: один тяжёлый грузик далеко от остальных утаскивает точку опоры за собой.
Медиана это значение, левее и правее которого поровну наблюдений. Её смысл в середине по счёту, а не по величине. Замените зарплату основателя с 900 на 9000, и среднее подскочит до 960, а медиана не сдвинется ни на рубль. Это свойство называется устойчивостью, и оно ровно то, что нужно для несимметричных величин.
Мода означает самое частое значение. Для непрерывных величин почти бесполезна, для категорий незаменима: у «среднего цвета автомобиля» смысла нет, у самого частого есть.
Правило выбора простое и почти всегда работает: при симметричном распределении без далёких выбросов подходит среднее, а при несимметричном или с выбросами медиана. Рост, вес, температура, время реакции обычно симметричны, среднее уместно. Доходы, цены на жильё, время ожидания, длительность болезни, число подписчиков, размеры городов почти всегда вытянуты вправо, и там медиана.
Признак, по которому легко узнать вытянутое вправо распределение, даже не видя данных: величина ограничена снизу нулём и не ограничена сверху. У зарплаты не может быть минус тридцати тысяч, а девятьсот бывает. Такая асимметрия встроена в саму величину.
Услышав «в среднем», спросите: а какова медиана? Если отвечающий не знает, данных о распределении у него нет. Если разница между средним и медианой велика, распределение вытянуто, и разговаривать надо о медиане. Расхождение этих двух чисел даёт самый дешёвый способ увидеть форму, не строя графика.
Разброс: три способа измерить
Центр без разброса остаётся половиной сообщения, о чём шла речь в первом уроке. Разброс измеряют тремя способами разной грубости.
Размах идёт от минимума до максимума. Честен и почти бесполезен: определяется двумя самыми экстремальными наблюдениями, поэтому от одного выброса меняется целиком. У наших зарплат размах 60-900, и это говорит больше об основателе, чем о компании.
Квартили и межквартильный размах. Первый квартиль отсекает нижнюю четверть, а третий верхнюю. Расстояние между ними накрывает середину половины наблюдений. Для наших десяти зарплат первый квартиль около 65, третий около 75, межквартильный размах примерно 10 тысяч. Вот это уже описание компании: половина сотрудников укладывается в десятитысячную вилку. Мера устойчива к выбросам ровно потому, что смотрит на порядковые места, а не на величины.
Стандартное отклонение равно корню из среднего квадрата отклонений от среднего. Словами: типичное расстояние от значения до центра. Считается сложнее и к выбросам чувствительно так же, как среднее, зато для симметричных распределений даёт удобное правило: примерно две трети наблюдений лежат в пределах одного стандартного отклонения от среднего, а около 95 % укладываются в пределах двух.
Это правило работает только для распределений, близких к нормальным, и применять его к зарплатам нельзя. Для наших десяти зарплат стандартное отклонение около 250 тысяч, и интервал «среднее плюс-минус одно отклонение» уходит далеко в отрицательные числа, верный признак того, что мера выбрана не та.
Форма важнее обеих сводок
Центр и разброс дают две цифры, а распределение может выглядеть очень по-разному при одинаковых обеих. Форму приходится смотреть отдельно, и для решений она часто важнее.
Симметричное с одним горбом и есть тот случай, ради которого придуманы среднее и стандартное отклонение. Рост взрослых мужчин, ошибки измерения, суммы многих независимых мелких вкладов.
Вытянутое вправо: доходы, цены, время ожидания. Большинство значений скучено слева, длинный хвост уходит вправо. Среднее сдвинуто относительно медианы в сторону хвоста, и разница между ними служит прямой мерой асимметрии.
Двугорбое остаётся самым коварным случаем, потому что среднее попадает во впадину между горбами, где наблюдений меньше всего. Классическим источником служит смесь двух разных групп в одних данных. Если измерить время выполнения задачи у смеси новичков и опытных, получится два горба, а среднее опишет несуществующего среднего работника. Двугорбость почти всегда сигнал, что данные надо разделить.
С тяжёлым хвостом даёт редкие, но очень крупные значения: страховые выплаты, продажи книг, размеры городов. Здесь и медиана не спасает, потому что решения определяются как раз хвостом. Средний ущерб по страховым случаям может быть невелик, а разорит компания одно событие из хвоста.
Отсюда общий принцип: сводка из одного числа теряет ровно то, ради чего обычно и смотрят данные. Гистограмма из десяти столбиков говорит больше, чем среднее и отклонение вместе.
Средний покупатель, средний пациент, средний сотрудник остаются конструкциями, у которых часто нет ни одного реального представителя. Особенно когда усредняют по нескольким признакам сразу: доля людей, средних одновременно по трём-четырём характеристикам, стремительно падает с числом характеристик. Проектирование под такого человека и есть верный способ не подойти никому.
Как это ломается в жизни
Три типичные ситуации, где выбор меры меняет вывод.
Зарплата в отчёте. «Средняя зарплата в компании выросла на 12 %» совместимо с тем, что у всех, кроме руководства, зарплата не изменилась. Проверку даёт медиана: если она стоит на месте, рост достался хвосту.
Время ответа службы поддержки. Среднее время ответа 4 минуты выглядит прилично, но распределение здесь всегда вытянуто вправо: большинство ответов быстрые, а часть тянется часами. Осмысленной величиной оказывается не среднее и даже не медиана, а квантиль: значение, ниже которого лежит заданная доля наблюдений. Именно так пишут соглашения об уровне сервиса, и именно поэтому там фигурирует «95 % обращений за N минут», а не среднее. Тот же порог, названный не долей, а процентом, зовут процентилем: девяностый процентиль это квантиль уровня 0,9. Слова два, объект один, и дальше в курсе встретятся оба.
Сравнение групп по средним. Две школы с одинаковым средним баллом могут отличаться радикально: в одной все около среднего, в другой половина отличников и половина отстающих. Решения о том, куда направить ресурсы, в этих двух случаях противоположны, а по средним они неразличимы.
Общая мораль урока прикладная: прежде чем сравнивать центры, посмотрите на формы. Сравнение средних осмысленно, когда распределения похожи по форме. Когда они разной формы, разница средних может не соответствовать ничему содержательному.
Пять чисел вместо одного
Есть компактный формат, который решает почти все перечисленные проблемы разом: пятичисловая сводка из минимума, первого квартиля, медианы, третьего квартиля, максимума.
Для наших десяти зарплат она выглядит так: 60, 65, 69, 75, 900. Пять чисел вместо одного, и картина восстанавливается целиком. Видно типичного сотрудника, 69. Видно, что основная масса умещается в вилку 65-75. Виден выброс: максимум оторван от третьего квартиля больше чем в десять раз, и это сразу говорит, что среднее считать бессмысленно.
Сравните с тем, что даёт одно среднее: 151,7. Из него не следует ни одно из трёх наблюдений выше, зато следует ложное представление о зарплатах в компании.
На этой сводке основан ящичковый график, где есть коробка от первого до третьего квартиля, черта на медиане, усы до крайних значений и точки для выбросов. Он придуман ровно для того, чтобы сравнивать группы, не теряя формы: два ящика рядом показывают и сдвиг центра, и разницу разбросов, и наличие хвостов.
Стоит завести привычку: прежде чем считать что-либо, выписать пять чисел. Это занимает минуту на отсортированных данных и сразу отвечает на вопрос, какой мерой центра дальше пользоваться.
Удалять выброс только за то, что он далеко, нельзя: в наших данных это не ошибка, а основатель компании, и он существует. Правильный ход состоит в том, чтобы назвать выброс, посчитать сводку с ним и без него и сказать, что изменилось. Если вывод переворачивается от одного наблюдения, об этом надо сообщать, а не выбирать удобный вариант.
Единицы, в которых считают
Последняя ловушка описания ждёт при сравнении величин в разных масштабах. Стандартное отклонение зарплаты в рублях и стандартное отклонение возраста в годах несопоставимы: у них разные единицы, и сказать, где разброс «больше», невозможно.
Для таких случаев есть два приёма. Первый из них это коэффициент вариации: стандартное отклонение, делённое на среднее. Величина безразмерная, и разбросы можно сравнивать. Работает только для положительных величин со средним, далёким от нуля.
Второй, более употребительный, называют стандартизацией: у каждого значения вычесть среднее и разделить на стандартное отклонение. Получается, на сколько отклонений значение отстоит от центра. Балл 85 при среднем 70 и отклонении 10 превращается в 1,5, то есть полтора отклонения выше среднего, и это число сравнимо с результатом другого экзамена в других баллах.
Стандартизованные значения будут постоянно встречаться дальше в курсе, потому что на них строится вся техника проверки гипотез. Смысл держать в голове стоит именно словесный: это расстояние до среднего, измеренное в единицах типичного разброса.
У приёма есть оборотная сторона, о которой стоит знать сразу. Стандартизация делает величины сравнимыми по форме, но не по важности: полтора отклонения по шкале тревожности и полтора отклонения по росту дают одинаковые числа с совершенно разными последствиями. Перевод в отклонения отвечает на вопрос «насколько это необычно», а не на вопрос «насколько это много». Смешение этих двух вопросов повторяет ту же ошибку, что и смешение надёжности и важности из первого урока, и встречается она чаще всего именно после стандартизации.
Ключевые работы
| Adhikari, DeNero, Wagner, «Computational and Inferential Thinking» | 2022 | Глава 14, «Почему среднее имеет значение»: связь среднего и стандартного отклонения с законом больших чисел, границы применимости правила двух отклонений. |
Что здесь путают
Только если распределение симметрично, а зарплаты не бывают симметричными: они ограничены снизу и не ограничены сверху. В примере из десяти сотрудников среднее в 151,7 тысячи не соответствует ни одному реальному человеку при медиане 69. Любая величина такого типа требует медианы или квантилей, будь то цены, время ожидания или число подписчиков, и подмена медианы средним в отчётах чаще всего не злой умысел, а привычка.
Правило выведено для нормального распределения и переносится на близкие к нему. Для вытянутых распределений оно даёт бессмыслицу: у зарплат из примера интервал «среднее минус одно отклонение» уходит в отрицательные числа. Полезный побочный признак: если такой интервал выходит за границы возможных значений величины, распределение точно не нормальное и мера выбрана неверно.
Две сводные цифры не определяют распределение. Одинаковые среднее и разброс совместимы с одним горбом, с двумя горбами и с почти любой асимметрией. Двугорбое распределение при этом хуже всего описывается средним, потому что оно попадает во впадину, где наблюдений меньше всего. Практическое следствие: смотреть гистограмму раньше, чем сравнивать сводки.
Термины
- среднее арифметическоеmean
- Сумма значений, делённая на их количество. Точка равновесия распределения. Чувствительно к выбросам.
- медианаmedian
- Значение, левее и правее которого поровну наблюдений. Устойчива к выбросам.
- модаmode
- Наиболее частое значение. Основная мера центра для категориальных величин.
- квартильquartile
- Значение, отсекающее четверть наблюдений: первый снизу, третий сверху.
- межквартильный размахinterquartile range, IQR
- Расстояние между первым и третьим квартилями. Накрывает середину половины наблюдений.
- стандартное отклонениеstandard deviation
- Корень из среднего квадрата отклонений от среднего. Типичное расстояние значения до центра.
- квантильquantile
- Значение, ниже которого лежит заданная доля наблюдений. Медиана и есть квантиль уровня 0,5. Тот же порог, названный в процентах, зовут процентилем: девяностый процентиль есть квантиль уровня 0,9.
- асимметрияskewness
- Несимметричность распределения. При вытянутости вправо среднее превышает медиану.
- двумодальное распределениеbimodal distribution
- Распределение с двумя горбами. Обычно признак смеси двух разных групп в одних данных.
- тяжёлый хвостheavy tail
- Свойство распределения, при котором очень крупные значения редки, но не пренебрежимо редки, и определяют сумму.
Практикум · Сводка, которая врёт
Работа с настоящими числами, а не с учебными. Нужен любой набор из двадцати и более значений: ваши расходы по дням, время в пути, длительность задач в трекере, цены на квартиры в одном районе.
- Соберите не меньше двадцати значений одной величины и запишите их в столбик.
- Посчитайте среднее и медиану. Отметьте, насколько они расходятся и в какую сторону: если среднее заметно больше, распределение вытянуто вправо.
- Отсортируйте значения и найдите границы: минимум, первый квартиль, медиану, третий квартиль, максимум. Эти пять чисел уже полноценная сводка.
- Постройте от руки гистограмму из шести-восьми столбиков. Проверьте: один горб или два. Если два, попробуйте объяснить, какие две группы смешались.
- Сформулируйте одним предложением, какое решение вы приняли бы по среднему и какое по пяти числам из шага 3. Если решения совпали, распределение симметрично. Если разошлись, вы только что увидели цену сводки из одного числа.
Вопросы для самопроверки
В районе средняя цена квартиры 14 млн, медианная 9 млн. Что это говорит о распределении?
- Оно симметрично: у симметричного распределения среднее и медиана расходятся всегда, и пять миллионов дают обычное расхождение
- Оно вытянуто влево: много дешёвых квартир
- Оно вытянуто вправо: есть дорогие объекты, тянущие среднее вверх
- В данных ошибка: медиана не бывает меньше среднего
Время ответа поддержки: среднее 4 минуты. Какая величина лучше опишет качество сервиса?
- Доля обращений, обработанных быстрее заданного порога
- Мода: самое частое время ответа
- Стандартное отклонение времени ответа
- Размах: от самого быстрого до самого долгого ответа
Гистограмма времени выполнения задачи имеет два чётких горба. Что это скорее всего означает?
- В данных смешаны две разные группы, и их стоит разделить
- В данных есть выбросы, которые надо удалить
- Выборка слишком мала: при увеличении числа наблюдений второй горб сгладится, как сглаживаются случайные неровности гистограммы
- Распределение нормальное, просто разброс велик
У двух школ одинаковый средний балл и одинаковое стандартное отклонение. Что можно утверждать?
- Что в обеих школах примерно поровну сильных и слабых учеников
- Ничего о форме распределения баллов
- Что распределения баллов практически совпадают
- Что различия между школами статистически незначимы
Для какой величины среднее и стандартное отклонение будут уместным выбором?
- Годовой доход домохозяйств
- Размер страховой выплаты
- Число подписчиков у авторов канала
- Рост взрослых мужчин
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», главы 7 и 14: Визуализация и глава «Почему среднее имеет значение»: там же границы правила о стандартных отклонениях.
- MIT 18.05, конспекты занятий 4-6a: Ожидание и дисперсия строго, с формулами. Читается после этого урока, если хочется формальной стороны.