Выборочное распределение и стандартная ошибка
Сто исследователей, одна совокупность, сто разных ответов
Выборочное распределение это распределение значений оценки по всем возможным выборкам заданного объёма. Его элементом служит не отдельное наблюдение, а целое исследование. Разброс этого распределения называется стандартной ошибкой. Для среднего она равна стандартному отклонению величины, делённому на корень из объёма выборки. Отсюда правило корня: чтобы вдвое сузить разброс оценки, нужно вчетверо больше наблюдений.
Data 8, гл. 10 · MIT 18.05, занятие 10 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Различать распределение данных и распределение оценки, посчитанной по данным
- Считать стандартную ошибку среднего и предсказывать по ней разброс чужих результатов
- Объяснять, во сколько раз нужно увеличить выборку ради заданной точности
- Называть, чего стандартная ошибка не измеряет и почему размер совокупности в неё не входит
Городская транспортная служба хочет знать, сколько времени жители тратят на дорогу до работы. Станем на минуту всеведущими: пусть на самом деле среднее по всем четырёмстам тысячам работающих жителей равно 40 минутам при стандартном отклонении 20 минут. Ни один исследователь этого не знает. Знаем только мы, и знаем ровно для того, чтобы проверять чужие ответы.
Сто исследовательских групп независимо друг от друга опрашивают по сто случайно отобранных человек. Первая получает среднее 38,7 минуты. У второй выходит 41,4. У третьей 40,2. У четвёртой 36,9. У двадцать седьмой 44,8.
Ни одна не ошиблась, не смошенничала и не взяла плохой список. Просто каждой достались свои сто человек. Вопрос урока: насколько сильно расходятся эти сто ответов, отчего расхождение зависит и что из этого следует для того, у кого выборка одна. То есть для всех.
Три распределения, которые надо держать врозь
Слово «распределение» в этом сюжете относится к трём разным вещам, и почти вся путаница вокруг статистического вывода растёт из их смешения.
Распределение совокупности. Четыреста тысяч чисел, время дороги каждого жителя. Оно вытянуто вправо: у большинства двадцать-сорок минут, у части полтора часа, а меньше нуля не бывает ни у кого. Центр 40, разброс 20 минут. Это распределение существует независимо от того, изучает его кто-нибудь или нет.
Распределение выборки. Сто чисел, которые собрала первая группа. Оно похоже на предыдущее, и тем сильнее, чем больше выборка. По нему считают среднее 38,7 и выборочное стандартное отклонение, скажем 19,4. Форма та же, вытянутая вправо. Разброс примерно тот же, около двадцати минут.
Выборочное распределение оценки. Сто чисел 38,7 · 41,4 · 40,2 · 36,9 и так далее. Это распределение не времён поездки, а средних. Его элемент не человек, а целое исследование. Именно оно отвечает на вопрос «насколько другой могла бы оказаться моя оценка», и именно его в реальности никто не видит: у исследователя одна выборка, а не сто.
Держать их врозь помогает такой счёт. Разброс у первых двух около двадцати минут: люди действительно тратят на дорогу очень по-разному. Разброс у третьего две минуты. В десять раз меньше, и это при тех же самых данных. Оценка гуляет намного меньше, чем гуляют числа, из которых она посчитана, и весь вывод по выборке держится на этом различии.
У русского термина неудачное имя: «выборочное распределение» слишком похоже на «распределение в выборке». Если путаетесь, проговаривайте длинно: распределение оценки от выборки к выборке.
Проверка себя одним вопросом: что стоит за одной точкой распределения? Если человек, поездка, чек, то это распределение данных. Если целое исследование, свёрнутое в одно число, то выборочное.
Описать данные можно и без него: центр, разброс, форма, всё считается по одной выборке. Но вопрос «а насколько этому числу можно верить» относится не к данным, а к процедуре, которая их породила. Ответ на него живёт только в распределении оценки, и вся третья и четвёртая части курса показывают, как до этого распределения добраться.
Стандартная ошибка
Разброс выборочного распределения имеет собственное имя, стандартная ошибка. Это то же стандартное отклонение из третьего урока, но посчитанное не по наблюдениям, а по оценкам. Словами: типичное расстояние между оценкой и тем, что она оценивает.
Название неудачное во второй раз: никакой ошибки в смысле промаха здесь нет. Никто не ошибся, величина просто меняется от выборки к выборке, и стандартная ошибка измеряет, насколько сильно.
Для среднего она считается коротко: разброс одного наблюдения, делённый на корень из числа наблюдений. У нас это 20, делённое на корень из ста, то есть 20 разделить на 10, получается две минуты.
Теперь можно предсказать, как разойдутся сто групп, не проводя ни одного опроса. Примерно две трети средних попадут в промежуток от 38 до 42 минут, то есть плюс-минус одна стандартная ошибка. Примерно 95 из ста окажутся в промежутке от 36 до 44. И примерно пять групп из ста получат средние за его пределами, а одна-две уйдут дальше 35 или 45 минут.
Двадцать седьмая группа с её 44,8 и есть как раз такой случай. Оценка отстоит от истины на 4,8 минуты, то есть на 2,4 стандартной ошибки. Изнутри это никак не выглядит: их сто человек отобраны так же, как у всех, данные не хуже, отчёт аккуратный. Понять, что им досталась редкая выборка, они не могут в принципе, ведь истину знаем только мы.
Здесь же видно, что правило двух отклонений из третьего урока работает, хотя данные вытянуты вправо и на колокол не похожи совсем. Это следствие центральной предельной теоремы из шестого урока: колокол получается у распределения средних, а не у распределения самих времён поездки.
Остаётся практическая трудность: чтобы посчитать стандартную ошибку, нужен разброс в совокупности, а его никто не знает. Выход в том, чтобы подставить разброс, посчитанный по своей выборке. У первой группы это 19,4, и стандартная ошибка получается 1,94 вместо 2. Разница в сотых, и она тем меньше, чем больше выборка. Так ширину выборочного распределения удаётся оценить, имея одну-единственную выборку, и это первый приём курса, который делает вывод возможным.
Почему корень из n
Число наблюдений остаётся в этой формуле единственным, чем исследователь может управлять, поэтому стоит разобраться, как оно работает.
Правило словами: чтобы вдвое сузить разброс оценки, нужно вчетверо больше наблюдений. При разбросе в двадцать минут выборка в 25 человек даёт стандартную ошибку 4 минуты, в 100 человек 2 минуты, в 400 человек 1 минуту, в 1600 человек полминуты, в 10 000 человек 0,2 минуты.
Экономический смысл этой лесенки жёсткий. Переход от 25 опрошенных к 100 стоит вчетверо дороже и покупает две минуты точности. Переход от 1600 к 6400 стоит вчетверо дороже и покупает четверть минуты. Точность дёшева вначале и очень дорога потом, поэтому разумный объём выборки определяется тем, какая точность нужна для решения, а не желанием собрать побольше.
Откуда берётся корень, можно объяснить без выкладок. Отклонения отдельных наблюдений от центра случайны и разнонаправленны, поэтому при сложении частично гасят друг друга. Если бы они складывались как есть, разброс суммы рос бы пропорционально числу слагаемых. Если бы гасились полностью, был бы нулевым. Независимые отклонения ведут себя посередине: складываются не сами разбросы, а их квадраты. Проверим на числах: разброс суммы ста наблюдений, у каждого из которых разброс 20, равен 20, умноженному на десять, то есть 200. Среднее в сто раз меньше суммы, значит его разброс получается 200 разделить на 100, снова две минуты.
Из формулы следует и то, что почти всегда вызывает возражение: размер генеральной совокупности в неё не входит. Выборка в 1500 человек даёт одинаковую точность для города в четыреста тысяч жителей и для страны в сто сорок миллионов, но при условии, что отбор в обоих случаях случайный. Реплика «как можно судить о стране по полутора тысячам» неверна арифметически: точность определяется числом опрошенных, а не их долей.
Кулинарная аналогия здесь честная: чтобы понять, посолен ли суп, не нужно съедать половину кастрюли, хватит ложки, но суп должен быть перемешан. Перемешанность и есть случайность отбора. Если суп не перемешан, ложка не поможет никакого размера, и это ровно второй урок.
Не «достаточно ли 1500 человек», а «какая точность нужна для решения». Из нужной точности объём считается обратным ходом: хотите стандартную ошибку вдвое меньше, умножайте число наблюдений на четыре. Разговор о выборке, начатый не с решения, а с объёма, почти всегда заканчивается спором о том, что значит «много».
Чего стандартная ошибка не измеряет
Стандартная ошибка описывает разброс, вызванный тем, что выборка оказалась одной из многих возможных. Всё остальное она не описывает, и держать это в голове важнее, чем помнить формулу.
Смещение. Пусть опрос проводится на выходах из метро. Тогда в выборку попадают люди, у которых дорога устроена иначе, и пусть их истинное среднее равно 46 минутам. Сто групп, работающих этим способом, соберутся вокруг 46, а не вокруг 40, и разброс у них будет прежний: две минуты при выборке в сто человек. Стандартная ошибка меряет ширину распределения оценок, а не расстояние от него до истины. Увеличив выборку до 2500, группы получат стандартную ошибку 0,4, то есть очень уверенно и очень кучно промахнутся на шесть минут.
Ошибку измерения. Если опрашиваемые систематически округляют время дороги вверх, все сто групп получат завышенные средние, и ни одна величина, посчитанная по этим же данным, об этом не сообщит.
Несоответствие величины вопросу. Время дороги вытянуто вправо, и среднее для него не лучшая мера центра, как показал третий урок. Если содержательно нужна медиана, то и разброс нужен у медианы, а простой формулы вида «разброс, делённый на корень» для неё нет. Это одна из причин, по которым существует девятый урок.
Общее правило: стандартная ошибка умеет отвечать только на вопрос «насколько другой оказалась бы моя оценка, если бы мне досталась другая случайная выборка, набранная тем же способом». Слова «тем же способом» несут в этом предложении основную нагрузку.
Случайная ошибка измеряется стандартной ошибкой и убывает с объёмом выборки. Систематическая не измеряется ничем, что посчитано по тем же данным, и от объёма не зависит вовсе. Свести их в одно число «погрешность» нельзя, и когда в отчёте стоит одна такая цифра, это почти всегда только первая из двух.
Что из этого следует
Три практических вывода, которыми курс дальше будет пользоваться постоянно.
Первый. Оценка по выборке не число, а число с ореолом. Отчёт «среднее время дороги 38,7 минуты» читается как «около 39, плюс-минус пара минут», причём сколько именно минут в этом «плюс-минус», считается, а не угадывается. Восьмой урок превращает ореол в интервал.
Второй. Разницу двух оценок сравнивают не с нулём, а с её собственным разбросом. Пусть в районе A получено 38,7 минуты, а в районе B 41,4, разница 2,7. При стандартной ошибке 2 у каждой оценки разброс их разности получается около 2,8 минуты: складываются квадраты, а корень из 4 плюс 4 равен примерно 2,8. Наблюдаемая разница меньше собственного типичного колебания, и утверждать по ней, что районы различаются, нельзя. Вся четвёртая часть курса развёртывает это одно сравнение.
Третий. Повторение исследования даёт другое число, и это не признак недобросовестности, а свойство метода. Ожидать точного совпадения всё равно что ждать одинакового результата от двух бросков кости. Насколько сильно расходятся добросовестные повторы, стандартная ошибка как раз и говорит. А к тому, что происходит, когда расхождение оказывается больше ожидаемого, курс вернётся в двадцать втором уроке.
И последнее, ради чего урок стоит на этом месте. Выборочное распределение остаётся центральным понятием всего вывода, но увидеть его напрямую нельзя: для этого нужны сто выборок, а есть одна. Дальше курс делает два разных хода. Восьмой урок показывает, что с этим распределением делать, если известна его ширина. Девятый объясняет, как добыть его из единственной выборки, не зная о нём заранее ничего.
Ключевые работы
| Adhikari, DeNero, Wagner, «Computational and Inferential Thinking» | 2022 | Глава 10, выборка и эмпирические распределения: распределение статистики строится многократной симуляцией отбора, без формул. |
| Orloff, Kamrin, MIT 18.05 «Introduction to Probability and Statistics» | 2022 | Занятие 10, введение в статистику: оценка параметра по выборке и разброс оценки как отдельный объект изучения. |
Что здесь путают
В стандартную ошибку входит число опрошенных и не входит размер совокупности. Выборка в 1500 человек даёт одну и ту же точность для города в четыреста тысяч и для страны в сто сорок миллионов. Поправка на конечность совокупности существует, но становится заметной, только когда выборка составляет существенную её часть, а в опросах такого не бывает. Требование «не меньше десяти процентов населения» не имеет под собой ничего, а настоящий вопрос к любому опросу другой и задан во втором уроке: как человек попадал в список.
Центральная предельная теорема говорит о распределении суммы или среднего, а не о распределении самих величин. Четыреста тысяч времён поездки останутся вытянутыми вправо, сколько бы человек ни опросили: форма распределения совокупности от объёма выборки не зависит никак. Колокол появляется у ста средних, а не у ста тысяч поездок. Доходы, размеры городов и продажи книг нормальными не станут ни при каком объёме, и правило двух отклонений к ним по-прежнему неприменимо.
Верно только при отсутствии смещения, а это отдельное и сильное допущение. Корректная формулировка: чем больше выборка, тем ближе оценка к тому, что даёт этот способ отбора. В примере с опросом у метро увеличение выборки со ста человек до 2500 сужает стандартную ошибку с 2 минут до 0,4 и не сдвигает центр с 46 к 40 ни на сколько. Размер выборки управляет шириной распределения оценок, а способ отбора его положением. Это независимые вещи, и первая никогда не чинит вторую.
Термины
- выборочное распределениеsampling distribution
- Распределение значений оценки по всем возможным выборкам заданного объёма. Его элемент не наблюдение, а целое исследование.
- стандартная ошибкаstandard error
- Стандартное отклонение выборочного распределения оценки, то есть типичное расстояние между оценкой и оцениваемой величиной. Для среднего равна стандартному отклонению величины, делённому на корень из объёма выборки.
- точечная оценкаpoint estimate
- Одно число, предлагаемое в качестве значения параметра: среднее по выборке, доля, медиана.
- оценка параметраestimator
- Правило, по которому из выборки получают число: «взять среднее», «взять медиану». У разных правил разные выборочные распределения.
- несмещённая оценкаunbiased estimator
- Оценка, выборочное распределение которой центрировано на истинном значении параметра. Несмещённость не означает точности.
- изменчивость от выборки к выборкеsampling variability
- Расхождение результатов между добросовестными исследованиями, вызванное только тем, что выборки разные.
- правило корняsquare root law
- Стандартная ошибка среднего убывает как корень из объёма выборки: вчетверо больше наблюдений, вдвое уже разброс.
- эмпирическое распределениеempirical distribution
- Распределение значений в собранной выборке. Приближает распределение совокупности тем лучше, чем больше наблюдений.
Практикум · Двадцать пять выборок из пяти чисел
Задача в том, чтобы увидеть выборочное распределение целиком, а не смоделировать его. Совокупность здесь настолько мала, что все возможные выборки можно выписать на одном листе и проверить формулу руками. Нужны бумага и полчаса.
- Возьмите совокупность из пяти чисел: 1, 2, 3, 4, 5. Посчитайте её среднее (получится 3) и стандартное отклонение: отклонения равны −2, −1, 0, 1, 2, их квадраты 4, 1, 0, 1, 4, сумма 10, делённая на 5 даёт 2, корень из двух примерно равен 1,41.
- Выпишите все выборки объёма 2, взятые с возвращением: пар получится 25, от (1, 1) до (5, 5). Рядом с каждой поставьте её среднее.
- Сведите 25 средних в таблицу частот. Должно получиться так: значение 1,0 встречается один раз, 1,5 два раза, 2,0 три, 2,5 четыре, 3,0 пять, 3,5 четыре, 4,0 три, 4,5 два, 5,0 один раз. Нарисуйте два столбчатых графика рядом: пять исходных чисел (все столбики одинаковые) и 25 средних (треугольник с вершиной на тройке).
- Посчитайте среднее этих 25 средних, получится ровно 3, это и есть несмещённость. Посчитайте их стандартное отклонение: сумма квадратов отклонений от тройки равна 25, делить на 25, корень равен единице. Сравните с правилом корня: 1,41, делённое на корень из двух, тоже даёт единицу.
- Не выписывая 625 выборок, предскажите стандартную ошибку для выборок объёма 4 и объёма 16, а затем ответьте письменно на два вопроса: во сколько раз выборочное распределение уже исходного при n = 16 и почему при этом ни одно из пяти исходных чисел никуда не делось.
Вопросы для самопроверки
Стандартное отклонение времени поездки в городе равно 20 минутам. Группа опросила 400 человек. Какова стандартная ошибка среднего?
- 4 минуты
- 1 минута
- 20 минут
- 0,05 минуты
Две группы опросили по сто человек в одном и том же городе и получили 38,7 и 41,4 минуты. Что это значит?
- Между опросами в городе что-то изменилось
- Расхождение слишком велико, чтобы быть случайным
- Одна из выборок смещена, и надо выяснить какая
- Обычное расхождение двух добросовестных оценок: при стандартной ошибке 2 минуты такая разница ожидаема
«Опросили 1500 человек на страну в сто сорок миллионов, это одна стотысячная, никакого вывода отсюда не сделаешь». Что не так с этим рассуждением?
- Ничего: для надёжного вывода нужна выборка не меньше нескольких процентов
- Вывод возможен, только если совокупность однородна
- Точность зависит от числа опрошенных, а не от их доли в совокупности
- Ошибка в том, что 1500 человек для опроса такого рода слишком много
Группа хочет вдвое сузить разброс своей оценки. Что для этого нужно?
- Увеличить выборку в два раза
- Увеличить выборку в четыре раза
- Провести опрос дважды и усреднить два результата
- Уменьшить вдвое стандартное отклонение в данных
Опрос о времени дороги проводят у выходов из метро, а истинное среднее у пассажиров метро равно 46 минутам при общегородском 40. Выборку увеличили со ста человек до 2500. Что произойдёт?
- Оценки соберутся вокруг 46 ещё плотнее: стандартная ошибка упадёт с 2 до 0,4 минуты
- Оценка останется около 46, но её разброс не изменится
- Оценки начнут приближаться к 40, потому что выборка стала большой: с ростом объёма среднее сходится к среднему по городу
- Оценка станет несмещённой при 2500 наблюдениях
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 10: Выборка и эмпирические распределения. Там же наглядно показано, как распределение статистики собирается многократным повторением отбора.
- MIT 18.05, конспект занятия 10: Формальное введение в оценивание: та же тема с формулами и правдоподобием, читается после этого урока.