Репрезентативная выборка
Почему выборка в 2,4 миллиона проиграла выборке в десятки раз меньшей
Смещение выборки это систематическое расхождение между составом выборки и составом совокупности, связанное со способом отбора. Ростом объёма оно не лечится. Классический пример даёт опрос Literary Digest 1936 года: 2,4 миллиона ответов предсказали Лэндону 57 %, а Рузвельт получил 62 %. Гэллап с выборкой в десятки раз меньшей назвал победителя верно. Объём уменьшает лишь случайную ошибку, но не сдвиг от самоотбора и плохой основы выборки.
Data 8, гл. 10 и 2 · Squire, 1988 · Wald, 1943 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Разделять генеральную совокупность, основу выборки и полученные ответы
- Показывать на числах, почему объём выборки не уменьшает смещение
- Опознавать самоотбор и ошибку выжившего в готовых данных
- Формулировать, кого именно нет в конкретных данных и куда это сдвигает вывод
Осенью 1936 года журнал Literary Digest провёл, вероятно, самый крупный опрос в истории на тот момент. Разослали около десяти миллионов бюллетеней, вернулось около 2,4 миллиона. Прогноз: Альф Лэндон получит 57 % голосов против 43 % у Франклина Рузвельта.
Рузвельт получил 62 %. Джордж Гэллап с выборкой, меньшей в десятки раз, назвал победителя верно.
Это главный пример курса, и держать его в голове стоит целиком, потому что учебниковый пересказ у него неполный.
Три разные вещи, которые называют выборкой
Чтобы разобрать этот случай, нужно различить три сущности, которые в разговоре сливаются в одну.
Генеральная совокупность объединяет тех, о ком делается вывод. Здесь это все, кто придёт голосовать.
Основа выборки это список, из которого фактически отбирают. У Literary Digest это были телефонные справочники, списки подписчиков журнала, реестры клубов и регистрации автомобилей.
Полученные ответы это те, кто в итоге попал в данные. Из десяти миллионов разосланных бюллетеней вернулись 2,4 миллиона.
Каждый переход между этими тремя открывает возможность для смещения. Основа может не совпадать с совокупностью: в 1936 году телефон и автомобиль были признаком достатка, а достаток тогда сильно коррелировал с голосованием за республиканцев. И ответившие могут отличаться от тех, кому послали: возвращают бюллетень охотнее те, у кого есть мнение и мотив его высказать.
Разбор Певерилла Сквайра (1988) показал, что сработали оба механизма. Смещение самой рассылки дало около одиннадцати процентных пунктов ошибки, а смещение из-за избирательности ответивших добавило ещё около семи. Более того: если бы ответили все, кому послали, журнал как минимум назвал бы победителем Рузвельта.
Стандартный учебниковый пересказ останавливается на телефонах и автомобилях. Это реальный фактор, но он объясняет меньше двух третей ошибки. Вторую часть дал возврат бюллетеней: кто отвечает, а кто нет, становится отдельным источником смещения, и он работает в любом добровольном опросе, даже если список идеален.
Почему объём не помогает
Здесь стоит остановиться и проговорить механику, потому что интуиция сопротивляется: 2,4 миллиона это же огромная выборка.
Объём выборки управляет случайной ошибкой, тем отклонением, которое возникает оттого, что вам досталась одна выборка из многих возможных. Эта ошибка убывает примерно как единица, делённая на корень из объёма: чтобы вдвое сузить разброс оценки, нужно вчетверо больше наблюдений. При 2,4 миллиона она практически исчезает.
Но есть вторая, независимая от первой, систематическая ошибка. Она возникает, когда попадание в данные связано с тем, что измеряется. И объём на неё не влияет никак: удвоив число опрошенных богатых, вы получите вдвое более точную оценку мнения богатых, а не приближение к мнению всех.
Итог удобно держать в виде формулы словами: случайная ошибка убывает с объёмом, а систематическая остаётся. Поэтому смещённая выборка на миллион хуже случайной на тысячу: она даёт уверенный ответ на другой вопрос, и уверенность здесь работает против вас. Маленькая случайная выборка честно показывает свою неточность широким интервалом. Большая смещённая выдаёт узкий интервал вокруг неверного числа.
Гэллап выиграл не техникой подсчёта, а тем, что думал о составе опрошенных: он квотировал выборку по признакам, о которых знал, что они связаны с голосованием.
Не «сколько человек опросили», а «как человек попадал в этот список и мог ли отказаться». Первый вопрос почти никогда не важен, второй важен почти всегда.
Самоотбор
Механизм, который погубил Literary Digest наполовину, сегодня работает почти во всех данных, которые попадаются на глаза. Он называется самоотбором: в данные попадают те, кто сам решил в них попасть.
Голосование под постом, отзывы на маркетплейсе, форма обратной связи, опрос в телеграм-канале, оценка в приложении. Везде отвечает не случайный человек, а тот, у кого есть повод. Обычно поводом служит сильная эмоция в одну из сторон, поэтому распределение отзывов часто имеет два горба: пятёрки и единицы, а середина проваливается. Это не значит, что товар одновременно отличный и ужасный. Это значит, что довольные и разъярённые пишут, а равнодушные нет.
Простой количественный пример. Пусть в реальности среди тысячи покупателей 100 недовольны, 100 в восторге, 800 равнодушны. Пусть вероятность написать отзыв равна 0,4 у недовольных, 0,3 у восторженных и 0,02 у равнодушных. Тогда отзывов будет 40, 30 и 16 соответственно: всего 86. Доля недовольных в отзывах составит 40 из 86, почти половину, при реальной доле в одну десятую. Никакого обмана, никакой накрутки: одна лишь разница в готовности высказаться дала пятикратное искажение.
Отсюда практическое следствие, которое стоит переносить на любые пользовательские данные: доля в отзывах это не доля среди покупателей, а произведение реальной доли на готовность этой группы писать. Пока вторая величина неизвестна, первую из отзывов не восстановить.
Заметьте, что смещение здесь работает и в обратную сторону. Если магазин просит оставить отзыв только тех, кто оформил повторный заказ, готовность писать выравнивается, но выборка теперь состоит из вернувшихся, то есть из довольных по построению. Способ борьбы с одним механизмом породил другой, и это типичная история: исправлять смещение вслепую опаснее, чем оставить его и назвать.
Единственный надёжный ответ состоит в том, чтобы сделать попадание в выборку независимым от измеряемой величины. Практически это значит: не ждать, пока люди придут сами, а обращаться к отобранным и добиваться ответа от них. Дорого, медленно и работает.
Ошибка выжившего
Третий механизм отличается от предыдущих тем, что отбор происходит не при сборе данных, а до него, в самой реальности.
В 1943 году Абрахам Вальд работал в Statistical Research Group при Колумбийском университете над задачей: где усиливать броню бомбардировщиков. Данными служили карты попаданий на вернувшихся машинах, и пробоины на них распределялись неравномерно: много в фюзеляже и крыльях, мало в районе двигателей.
Вальд исходил из того, что попадания распределены по площади примерно равномерно. Тогда нехватка пробоин у двигателей означает не то, что туда не попадали, а то, что получившие туда попадание не вернулись и в данные не попали. Броню следовало ставить там, где у выживших дырок нет.
Стоит знать, чем реальная работа отличается от афоризма. Вальд решал количественную задачу, оценивал уязвимость по частям машины и выпустил восемь меморандумов с методом расчёта, а не одну остроумную реплику. Разбор его работы опубликован Мангелем и Саманиего в Journal of the American Statistical Association в 1984 году. Популярный пересказ сохраняет вывод и выбрасывает метод, из-за чего кажется, будто дело было в сообразительности, а не в статистике.
Механизм повсеместен и за пределами авиации. Истории успеха рассказывают дошедшие. Выборка «сто миллионеров» ничего не говорит о том, помогает ли бросать институт, пока не опрошены бросившие и не преуспевшие. Старые здания кажутся красивее новых, потому что уродливые снесли. Долгожители кажутся доказательством пользы своей привычки, хотя выборка состоит ровно из тех, кто дожил.
Разберём на числах, насколько сильно это искажает. Пусть из тысячи людей, начавших рискованное дело, преуспели 30, и пусть среди преуспевших 20 обладали некоторой привычкой, и доля выходит две трети. Кажется убедительным. Но если той же привычкой обладали 600 из тысячи начавших, то среди преуспевших ожидалась бы доля примерно та же самая, и никакой связи с успехом в этих числах нет. Знаменатель, которого нет в выборке успешных, решает всё: без него доля в числителе не значит ничего.
Именно поэтому вопрос «а сколько людей делали то же самое и не преуспели» разрушает большинство мотивационных выводов из биографий. Он не отменяет их, а требует данных, которых обычно не собирают, потому что провалившиеся не пишут книг.
Спросите: чтобы попасть в эти данные, что должно было произойти с объектом? Если ответ звучит как «дожить, дойти, не разориться, не бросить», то данные описывают дошедших, а не всех, и любой вывод «делай как они» держится на невидимом сравнении с теми, кого в таблице нет.
Что с этим делать
Полностью избавиться от смещения нельзя почти никогда, поэтому задача формулируется иначе: назвать направление сдвига. Не «данные плохие», а «в этих данных недопредставлены такие-то, и потому оценка завышена или занижена».
Три шага, которые дают этот ответ. Первый: описать основу выборки и назвать, из какого списка отбирали. Второй: описать неответ, то есть кто мог не попасть и связано ли это с измеряемой величиной. Третий: назвать знак. Если в опросе о рабочей нагрузке не ответили самые загруженные, средняя нагрузка занижена, и это утверждение проверяемо, в отличие от жалобы на качество данных.
Иногда смещение можно оценить численно. Если известно, что в выборке 70 % женщин, а в интересующей совокупности их 51 %, ответы можно взвесить. Именно так работают квоты, которые применял Гэллап. Но взвешивать можно только по тем признакам, которые вы знаете и измерили. По неизвестным признакам смещение остаётся, и утверждать, что после взвешивания выборка стала репрезентативной, нельзя.
И последнее. Все три механизма этого урока говорят о том, кто попал в данные. Ни один из них не лечится обработкой, и ни один не виден в самих числах: чтобы их заметить, надо знать, как данные собирались. Поэтому раздел «методы» в исследовании читается раньше раздела «результаты», а не после.
Объём против смещения
В городе 10 000 жителей, и мы точно знаем истинную долю тех, кто доволен транспортом. Наберите выборку тремя способами и посмотрите, что делает с оценкой увеличение объёма.
Ключевые работы
| Squire, «Why the 1936 Literary Digest Poll Failed», Public Opinion Quarterly | 1988 | Разложение ошибки опроса: около 11 процентных пунктов дала основа выборки, около 7 добавила избирательность ответивших. |
| Wald, «A Method of Estimating Plane Vulnerability Based on Damage of Survivors», Statistical Research Group | 1943 | Метод оценки уязвимости самолёта по повреждениям вернувшихся: отсутствие пробоин в зоне означает, что попадания туда были смертельны. |
| Mangel, Samaniego, «Abraham Wald's Work on Aircraft Survivability», JASA 79(386) | 1984 | Разбор и переиздание меморандумов Вальда. Восстанавливает количественный метод, который теряется в популярных пересказах. |
Что здесь путают
Фактор реальный, но это меньше двух третей ошибки. По разбору Squire (1988), основа выборки дала около 11 процентных пунктов, а избирательность ответивших добавила ещё около 7. При полном возврате бюллетеней журнал назвал бы победителя верно. Учебниковая версия удобна тем, что позволяет считать проблему решённой хорошим списком, а неответ портит и идеальный список.
Объём здесь ни при чём. При таком числе наблюдений случайная ошибка исчезающе мала, а ошиблись на девятнадцать процентных пунктов. Это лучший известный пример того, что объём выборки и её смещённость остаются независимыми характеристиками: первая управляет шириной интервала, вторая задаёт положение его центра.
Вывод по сути верен, но это не то, что Вальд сделал. Он выпустил восемь меморандумов с количественным методом оценки уязвимости частей самолёта по данным выживших. Задачей была оценка, а не афоризм. Популярный пересказ сохраняет остроумие и выбрасывает метод, из-за чего история читается как байка о сообразительности, а не как рабочий приём, который можно применить к своим данным.
Термины
- основа выборкиsampling frame
- Список, из которого фактически производится отбор. Расхождение основы с генеральной совокупностью служит первым источником смещения.
- смещение выборкиsampling bias
- Систематическое расхождение между составом выборки и составом совокупности, связанное со способом отбора.
- самоотборself-selection
- Ситуация, когда объект сам решает, попадать ли в данные. Порождает смещение всякий раз, когда решение связано с измеряемой величиной.
- смещение из-за неответаnonresponse bias
- Смещение, вызванное тем, что отказавшиеся отвечать отличаются от ответивших. Работает даже при идеальной основе выборки.
- ошибка выжившегоsurvivorship bias
- Вывод по объектам, дошедшим до момента наблюдения, без учёта не дошедших.
- случайная выборкаrandom sample
- Отбор, при котором вероятность попадания в выборку известна и не связана с измеряемой величиной.
- квотная выборкаquota sample
- Отбор с соблюдением заданных долей по известным признакам: полу, возрасту, региону.
- взвешиваниеweighting
- Пересчёт результатов с поправкой на известное расхождение состава выборки и совокупности. Исправляет только те перекосы, которые измерены.
- репрезентативностьrepresentativeness
- Соответствие выборки совокупности по признакам, существенным для вопроса. Не свойство объёма.
Практикум · Кого нет в этих данных
Задача не в том, чтобы оценить качество данных, а в том, чтобы назвать направление сдвига. Формулировка «данные плохие» не считается ответом. Считается «недопредставлены такие-то, поэтому оценка завышена».
- Найдите три набора данных, которые видели на этой неделе: отзывы о товаре, опрос в канале, рейтинг, статистика из отчёта.
- Для каждого выпишите три сущности отдельными строками: о ком хотели сделать вывод, из какого списка отбирали, кто в итоге попал в данные.
- Отметьте, где произошёл самоотбор: мог ли объект решить не попадать в данные и связано ли это решение с тем, что измеряют.
- Проверьте на ошибку выжившего: что должно было случиться с объектом, чтобы он попал в таблицу. Если ответ включает «дойти», «дожить», «не закрыться», механизм работает.
- Для каждого набора напишите одно предложение вида «оценка завышена (занижена), потому что не попали такие-то». Если знак назвать не получается, сформулируйте, какое дополнительное сведение позволило бы его назвать.
Вопросы для самопроверки
Онлайн-опрос на сайте фитнес-клуба: «87 % людей тренируются три и более раз в неделю». Какой механизм здесь главный?
- Самоотбор: отвечают посетители сайта фитнес-клуба
- Смещение из-за неответа: часть посетителей не открыла опрос
- Ошибка выжившего: не опрошены бросившие тренировки
- Случайная ошибка: выборка слишком мала
Компания хочет уточнить оценку удовлетворённости и увеличивает опрос со 100 до 10 000 клиентов, рассылая ту же форму тем же способом. Что произойдёт?
- Ничего не изменится: сотни было достаточно
- Оценка станет репрезентативной для всех клиентов
- Интервал оценки сузится, а её центр останется смещённым
- И точность, и правильность оценки вырастут
«Мы опросили 100 человек старше девяноста лет: половина из них курила всю жизнь. Значит, вред курения преувеличен». Что не так?
- Ничего: данные собраны корректно, вывод следует
- В выборку по построению попали только дожившие до девяноста
- Опрос ретроспективный: люди неточно помнят, сколько курили, и эта неточность полностью объясняет полученную половину
- Сто человек слишком малая выборка: при таком объёме доля курильщиков могла отклониться от истинной на десятки пунктов
В опросе о нагрузке на работе ответили 30 % сотрудников. Известно, что самые загруженные чаще не отвечают. Что можно сказать о средней нагрузке по ответам?
- Она завышена: отвечают те, кому есть на что жаловаться
- Смещения нет, если ответивших достаточно много
- Сказать нельзя ничего, данные непригодны
- Она занижена, и знак смещения назван
Выборку взвесили по полу, возрасту и региону, приведя доли к данным переписи. Что теперь верно?
- Взвешивание бесполезно, если был самоотбор
- Перекос по этим трём признакам исправлен, а по остальным нет
- Выборка стала репрезентативной: приведение к переписи по полу, возрасту и региону и есть определение репрезентативности
- Взвешивание убрало и случайную ошибку, и систематическую
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Squire, «Why the 1936 Literary Digest Poll Failed», Public Opinion Quarterly, 1988: Разбор, который стоит прочесть именно потому, что он расходится с учебниковой версией: источников ошибки было два, и второй опаснее.
- Mangel, Samaniego, «Abraham Wald’s Work on Aircraft Survivability», JASA, 1984: Что Вальд сделал на самом деле: с методом, а не с афоризмом.
- Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», главы 2 и 10: Выборка и эмпирические распределения у Berkeley. Глава 2 ставит вопрос о причинности до всякой техники.