Что такое статистика
Две разные задачи, которые постоянно путают
Статистика решает две разные задачи. Описание даёт сводку того, что содержится в собранных данных. Статистический вывод переносит заключение с выборки на генеральную совокупность и всегда сопряжён с риском ошибки. Половина ошибок в чтении чисел происходит оттого, что решение одной задачи принимают за решение другой. Разброс значений при этом не помеха измерению, а его предмет.
Data 8, гл. 1 · MIT 18.05, занятие 10 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Различать описание данных и вывод о том, что данных не видно
- Объяснять, почему разброс не помеха измерению, а его предмет
- Называть, что именно делает вывод из выборки рискованным
- Отличать вопросы, на которые статистика отвечает, от тех, на которые не отвечает
Городская поликлиника поменяла регистратуру: живую очередь заменила запись по времени. Через месяц среднее ожидание упало с 34 до 27 минут. Заведующий отчитывается: система работает, семь минут выиграли.
Вопрос, с которого начинается вся статистика, звучит скучно и меняет всё: а если бы ничего не меняли, сколько было бы? Не «стало ли лучше», а «насколько такая разница необычна для двух случайных месяцев». Может оказаться, что от месяца к месяцу ожидание и раньше гуляло на десять минут в обе стороны, и семь минут оказываются обычной рябью. А может оказаться, что раньше оно держалось в пределах минуты, и тогда семь минут уже событие.
Одни и те же семь минут в одном случае означают успех реформы, а в другом ничего. Различить эти случаи по одному среднему невозможно. Нужно знать, как сильно величина колеблется сама по себе.
Две задачи, которые постоянно путают
Статистика решает две разные задачи, и половина ошибок в чтении чисел происходит оттого, что решение одной задачи принимают за решение другой.
Описание отвечает на вопрос: что в этих данных? Сколько человек пришло, каково среднее ожидание, как оно распределено, есть ли выбросы. Здесь нет никакого риска ошибиться в выводе, потому что нет никакого вывода: вы просто пересказываете то, что записано. Если в таблице 812 посещений и среднее 27 минут, то это факт о таблице, и спорить с ним нельзя.
Вывод отвечает на другой вопрос: что происходит там, куда мы не смотрели? Будет ли ожидание таким же в следующем месяце. Работает ли новая система в других поликлиниках. Стало бы среднее меньше, если бы дело было не в системе, а в том, что месяц выдался тёплый и меньше народу болело. Здесь риск ошибиться есть всегда, и вся техника курса посвящена тому, как этот риск оценить и не соврать о его величине.
Граница проходит там, где заканчиваются собранные данные. Пока вы говорите о 812 посещениях, речь идёт об описании. Как только вы говорите о посещениях вообще, начинается вывод, и он требует обоснования.
Вернёмся к поликлинике. Заведующий сделал вывод, а предъявил описание: два средних. Чтобы вывод стал обоснованным, нужны данные, которых в отчёте нет. Как ожидание колебалось по месяцам до реформы. Если размах был от 30 до 38 минут, то 27 выпадает из привычного диапазона, а если от 24 до 40, то не выпадает ни на сколько. Сколько людей пришло в оба месяца: при падении потока на четверть очередь сократится сама, без всякой записи по времени. Считалось ли ожидание одинаково: если раньше отсчёт шёл от входа в поликлинику, а теперь от назначенного времени, сравниваются разные величины, и разговаривать не о чем.
Ни один из этих вопросов не требует статистической техники. Все они требуют одного: не принимать описание за вывод.
Услышав число, спросите: это утверждение о тех, кого измерили, или о тех, кого не измеряли? Первое проверяется пересчётом. Второе проверяется только рассуждением о том, как эти люди попали в данные.
Разброс не помеха, а предмет
В школьной физике разброс измерений означает досадную неточность прибора: истинное значение одно, а стрелка дрожит. В статистике всё наоборот: разброс и есть то, что изучается, потому что за ним стоит реальное разнообразие.
Возьмём пять посещений поликлиники с ожиданием 5, 12, 27, 41 и 50 минут. Среднее равно 27 минутам. Теперь другие пять: 25, 26, 27, 28 и 29 минут. Среднее то же самое, 27. Но это два совершенно разных мира. В первом человек не может планировать день: он рискует прождать почти час. Во втором он спокойно назначает встречу через сорок минут после приёма.
Среднее одинаково, а информация, которую оно несёт, противоположна. Поэтому число без указания разброса не сообщение, а его половина. Когда в новости сказано «в среднем на 12 % выше» и не сказано ничего больше, вы не знаете, идёт речь о сдвиге, который заметен у каждого, или о сдвиге, который тонет в собственных колебаниях величины.
Разброс к тому же определяет, какие решения на этих данных вообще можно принимать. Поликлинике со вторым распределением достаточно посадить одного администратора: поток ровный. Первой нужен запас на пиковые часы, иначе полтора часа ожидания в понедельник утром никуда не денутся, сколько бы ни было 27 минут в среднем по месяцу. Средним управлять нельзя, а управлять можно тем, из чего оно складывается.
Отсюда первое рабочее правило курса: всякий раз, когда вам называют центр, спрашивайте про разброс. Это не придирка, а восстановление недостающей половины сообщения. В третьем уроке разберём, чем измерять разброс и почему среднее вообще плохой выбор центра для несимметричных величин, таких как доходы, время ожидания, продолжительность болезни.
Почему интуиция здесь подводит
Человек хорошо распознаёт закономерности и плохо распознаёт их отсутствие. Дайте кому угодно последовательность из двадцати подбрасываний монеты, и в ней найдут «полосу везения» просто потому, что серии из четырёх-пяти орлов подряд в случайной последовательности из двадцати бросков вполне обычны, а выглядят они неслучайно.
Обратная ошибка не менее частая: человек считает случайным то, что случайным не является. Если в отделении на этой неделе три осложнения вместо обычного одного, первой приходит мысль «случайность, бывает». Иногда действительно бывает. Но отличить одно от другого на глаз нельзя, а можно только посчитав, насколько часто такое случалось бы при отсутствии причины.
Есть и третья ловушка, самая дорогая. Человек оценивает вероятность события по тому, насколько легко припоминается пример. После сообщения об авиакатастрофе полёты кажутся опаснее, хотя частота их не изменилась ни на сколько. Редкое и яркое вытесняет частое и скучное. В статистике этому соответствует систематическая ошибка, которая состоит в игнорировании того, насколько событие вообще распространено. Пятый урок показывает на числах, как это ломает интерпретацию медицинских тестов: при редкой болезни даже очень точный тест даёт больше ложных тревог, чем настоящих находок, и это чистая арифметика, а не парадокс.
Эта процедура состоит в том, чтобы посчитать, как выглядел бы мир без эффекта, и сравнить с тем, что видим. Она и есть ядро статистического вывода. К ней курс придёт в десятом уроке, и всё, что до него, готовит именно к ней: что такое случайность, как она распределяется и почему величины ведут себя предсказуемо в среднем, оставаясь непредсказуемыми поодиночке.
«Это не может быть совпадением» остаётся самой частой посылкой ошибочных выводов. У неё нет никакой доказательной силы: интуиция систематически недооценивает, сколько закономерностей возникает случайно, особенно когда закономерность выбирают уже после того, как посмотрели на данные. Разбору этого посвящён тринадцатый урок.
Чего статистика не делает
О пределах метода честнее сказать сразу, потому что завышенные ожидания порождают потом обратную реакцию: «статистикой можно доказать что угодно».
Статистика не доказывает в том смысле, в каком доказывают теоремы. Всякий вывод из данных условен: он верен при определённых допущениях о том, как данные получены. Если меняются допущения, меняется вывод, и спор о числах часто оказывается спором о допущениях.
Статистика не устанавливает причину сама по себе. Она может показать, что связь есть и что она не похожа на случайную. Вопрос, что чему причина, решается устройством исследования, а не расчётом. Этому посвящён семнадцатый урок.
Статистика не решает, что важно. Она может сказать, что различие в 0,3 килограмма надёжно установлено на выборке в сорок тысяч человек. Вопрос, важны ли эти 0,3 килограмма, содержательный, и ответа на него в данных нет. Смешение надёжности и важности становится одной из самых дорогих ошибок при чтении исследований, и к ней курс возвращается в одиннадцатом и двенадцатом уроках.
И наконец, статистика не чинит плохие данные. Если в выборку попали не те люди, никакая обработка этого не исправит: увеличение объёма уменьшает случайную ошибку и не трогает систематическую. Об этом следующий урок.
Что будет дальше
Курс идёт снизу вверх. Первые три урока разбирают данные и их описание. Второй модуль рассказывает про случайность: что такое вероятность, как считать её через частоты, почему средние ведут себя устойчиво, даже когда отдельные значения нет. Третий и четвёртый отвечают за вывод: как из одной выборки сказать что-то о том, чего не видели, и как проверить, что наблюдаемое различие не рябь.
Пятый модуль идёт про связь и причину: корреляция, регрессия, смешивающие факторы, парадокс Симпсона, устройство эксперимента. Шестой показывает байесовский взгляд, где неопределённость выражается прямо, а не через отвергнутые гипотезы.
Два последних модуля говорят о том, чего нет ни в одном из курсов-источников: что произошло со статистической практикой за последние двадцать лет, почему опубликованная литература систематически смещена и как читать работу с числами, зная всё вышеперечисленное.
Формул в курсе немного, и ни один вывод не зависит от умения их раскрывать. Почти всё, что в университетском курсе доказывается, здесь показывается симуляцией: так устроен курс Berkeley Data 8, и для самостоятельного обучения это работает лучше.
Ключевые работы
| Adhikari, DeNero, Wagner, «Computational and Inferential Thinking» | 2022 | Учебник Berkeley Data 8, глава 1: вводный курс статистики без пререквизита по матанализу, вывод строится симуляцией. |
| Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-133 | 2016 | Формальное заявление Американской статистической ассоциации: статистическая значимость не измеряет ни величину эффекта, ни его важность. |
Что здесь путают
Обычно эта фраза означает «я видел, как ею злоупотребляли», и это правда. Но из возможности злоупотребления не следует бесполезность метода: тем же рассуждением отменяется любой инструмент. К тому же злоупотребления обнаруживаются именно статистическими средствами, как в разборе исследовательских степеней свободы у Simmons, Nelson и Simonsohn (2011). Утверждение не выдерживает и собственной логики: если числами можно показать что угодно, то и вывод «числам нельзя верить» показать нечем.
Верно для повторных измерений одной и той же величины: там разброс действительно от прибора. Для данных о людях, фирмах или городах разброс и есть само явление. Средний рост не «истинный рост, замутнённый ошибками». Люди действительно разного роста. Отсюда следует, что описание распределения содержательнее описания центра, а не является уточнением к нему.
Прямо опровергнуто в заявлении ASA (2016): p-значение не измеряет ни величину эффекта, ни важность результата. На достаточно большой выборке значимым становится сколь угодно малое различие, а на малой выборке крупный и практически важный эффект может остаться незамеченным. Надёжность и важность остаются независимыми характеристиками, и путать их дорого.
Термины
- генеральная совокупностьpopulation
- Все объекты, о которых хочется сделать вывод: все посетители поликлиники, все избиратели страны, все партии деталей с этой линии.
- выборкаsample
- Подмножество генеральной совокупности, которое действительно измерили.
- описательная статистикаdescriptive statistics
- Сводка того, что содержится в собранных данных: центр, разброс, форма распределения. Выводов за пределы данных не делает.
- статистический выводstatistical inference
- Заключение о генеральной совокупности по выборке. Всегда сопряжён с риском ошибки, величину которого и требуется оценить.
- вариацияvariation
- Разброс значений величины. В данных о людях и организациях он не помеха измерению, а его предмет.
- параметрparameter
- Характеристика генеральной совокупности: истинное среднее ожидание у всех посетителей. Обычно неизвестен.
- статистика (как величина)statistic
- Характеристика, посчитанная по выборке: среднее по 812 наблюдениям. Известна, но меняется от выборки к выборке.
- случайная ошибкаrandom error
- Отклонение оценки от параметра из-за того, что выборка одна из многих возможных. Уменьшается с ростом объёма выборки.
- систематическая ошибкаbias
- Отклонение, вызванное способом получения данных. С ростом объёма выборки не уменьшается.
Практикум · Половина сообщения
Задача в том, чтобы увидеть, как часто числа в публичном пространстве подаются без второй половины. Работа на живом материале, не на учебных примерах.
- Соберите пять утверждений с числами из новостей, отчётов или постов за последнюю неделю. Годятся средние, проценты, «выросло на».
- Для каждого отметьте: это описание собранных данных или вывод о тех, кого не измеряли? Граница проходит там, где заканчивается упомянутая выборка.
- Для каждого проверьте, назван ли разброс: интервал, доля, распределение, хоть что-нибудь кроме центра. Обычно не назван ни в одном из пяти.
- Возьмите одно утверждение и сформулируйте, какое дополнительное число сделало бы его осмысленным. Одно конкретное число, а не «побольше данных».
- Для того же утверждения ответьте: что должно было бы быть верно о способе сбора данных, чтобы вывод переносился на всех? Запишите одним предложением. Это и есть допущение, о котором пойдёт речь в следующем уроке.
Вопросы для самопроверки
В отчёте сказано: «Средний чек в наших 40 кафе равен 780 рублям». Это описание или вывод?
- Описание, но только если кафе выбраны случайно
- Вывод, потому что чек у каждого посетителя разный
- Описание: утверждение о тех кафе, по которым собраны данные
- Вывод: любое среднее и есть вывод
Две бригады монтажников. У первой время выполнения заказа: 2, 2, 3, 3, 10 дней. У второй: 4, 4, 4, 4, 4. Что верно?
- Сравнивать нельзя, пока не известно число заказов
- Средние равны, но первой бригаде нельзя обещать заказчику срок
- Вторая бригада работает быстрее: у неё нет провалов
- Первая бригада работает быстрее: у неё большинство заказов за 2-3 дня
Исследование на выборке в 90 000 человек нашло: у любителей кофе давление в среднем на 0,4 мм рт. ст. выше, и различие статистически значимо. Что из этого следует?
- Что различие надёжно установлено, но о его важности данные не говорят
- Что различие случайно: 0,4 мм рт. ст. лежит внутри обычного суточного колебания давления, а значит, значимость получена по ошибке
- Что кофе повышает давление и это важно для здоровья
- Что различие важное, раз выборка такая большая
Опрос о доверии к банкам провели среди 200 клиентов одного банка в отделении. Что даст увеличение выборки до 20 000 клиентов того же банка в тех же отделениях?
- Уменьшит и случайную, и систематическую ошибку
- Ничего не изменит: выборка и так достаточная
- Сделает результат репрезентативным для всех жителей страны: при двадцати тысячах опрошенных состав выборки повторяет состав населения
- Уменьшит случайную ошибку и никак не тронет систематическую
Какой из вопросов статистика в принципе не может решить расчётом по данным наблюдения?
- Каков разброс значений в выборке
- Насколько необычна наблюдаемая разница
- Насколько сильно связаны две величины
- Что здесь причина, а что следствие
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 1: Учебник Berkeley Data 8, открыт по лицензии Creative Commons. Ту же логику «сначала вопрос, потом техника» курс наследует целиком.
- MIT 18.05 «Introduction to Probability and Statistics», материалы на OCW: Полный курс с задачами и решениями. Требует матанализа, но конспекты занятий 10 и 20 читаются и без него.