Ошибка выжившего и ловушки выборки
Кого нет в данных, почему среднее часто врёт и как проверяют знаменитые истории
В выборку попадает та часть совокупности, о которой реально собраны данные, и вывод законен ровно о той совокупности, на которую выборка похожа. Кривую выборку не лечит размер: в 1936 году Literary Digest собрал больше 2,3 миллиона бюллетеней и предсказал победу Лэндона, а победил Рузвельт. Ошибка выжившего работает так же: вывод делают по тем, кто дошёл до наблюдения, не считая тех, кто не дошёл.
Модуль IV. Числа и данные · навыки Г2, Г3, Г5 · 19 мин · обновлено 12.09.2026
После урока вы сможете
- Спрашивать, кто попал в данные и кто в них не попал, прежде чем читать саму цифру.
- Отличать смещение выборки от смещения неответивших.
- Читать среднее вместе с медианой и разбросом.
- Видеть вывод, сделанный по дошедшим до наблюдения, без тех, кто не дошёл.
Вторая мировая. Американские бомбардировщики возвращаются с заданий изрешечёнными, и военные хотят усилить броню, но всю машину не обошьёшь, тяжело. Куда ставить металл? Естественный ход: посмотреть, куда чаще попадает, и укрепить эти места.
Статистик Абрахам Вальд возразил: наоборот. Смотреть надо туда, где у вернувшихся пробоин нет. Потому что данные собраны только по вернувшимся. Самолёт с простреленным крылом долетел домой и попал в подсчёт, а значит, крыло переживаемо. Машина с пробитым двигателем в подсчёт не попала: она лежит где-то в Ла-Манше. Чистые места на схеме значат не «туда не попадают», а «попадание туда смертельно».
Это ошибка выжившего, самая коварная ловушка данных, потому что она прячется не в цифрах, а в том, чьи цифры вообще собраны. Сегодня у нас три ловушки одной природы: мы смотрим на данные и не спрашиваем, кто в них попал, кто выпал и что скрывает итоговое число.
Ловушка 1: выборка и кто попал в данные
«Опрос показал: 87 % регулярно тренируются». Впечатляет, пока не узнаёшь, что опрос висел на сайте фитнес-клуба. Это самоотбор: в данные попали те, кто сам пришёл, а пришедшие отличаются от остальных ровно тем, о чём спрашивают. Отзывы пишут восторженные и разгневанные, а тихая середина молчит. На опрос «довольны ли вы сервисом» в аккаунте бренда отвечают лояльные: недовольные давно отписались.
Классикой жанра стала история 1936 года. Американский журнал Literary Digest разослал десять миллионов бюллетеней о президентских выборах, получил обратно больше 2,3 миллиона и уверенно предсказал победу Лэндона. Вернулось меньше четверти рассылки, но по тем временам выборка всё равно неслыханная. Победил Рузвельт, с разгромом. Кривую выборку не лечит размер. Эту мораль стоит выбить в камне, и она верна.
А вот дальше начинается место, где почти все пересказы, включая прежнюю редакцию этого урока, говорят увереннее, чем позволяют данные. Обычно пишут: адреса брали из телефонных книг и списков автовладельцев, а телефон и автомобиль были у обеспеченных, которые голосовали иначе. Звучит убедительно. Вопрос в том, сколько именно этот перекос объясняет, и здесь спор не закрыт.
Спор, который стоит знать целиком
Обе стороны считают в процентных пунктах, и они не сходятся.
Сквайр в 1988 году поднял опрос Гэллапа мая 1937 года, где людей прямо спрашивали, получали ли они бюллетень Digest, возвращали ли его и за кого голосовали. По его расчёту смещение самой выборки дало около 11 пунктов, а проблемы с ответами добавили ещё около 7. То есть больший вес у списка рассылки, и привычное объяснение в целом работает.
Лузинки в 2012 году переанализировал те же данные со взвешиванием к известным характеристикам населения и получил обратное соотношение: смещение выборки 5,9 пункта, смещение неответивших 13,7. И один результат, который бьёт по «телефонной» версии прямо: после взвешивания большинство владельцев телефона и автомобиля, 53,9 %, голосовали за Рузвельта. Различалась не позиция, а готовность отвечать. Бюллетень вернули 16,9 % сторонников Рузвельта против 34,5 % сторонников Лэндона.
Сходятся обе работы в одном, и это самое интересное: при полном возврате бюллетеней Digest назвал бы победителя верно. Лор и Брик в 2017 году добавили, что и без полного возврата хватило бы взвешивания. По вопросу о голосовании 1932 года прогноз давал Рузвельту 276 выборщиков вместо 161, хотя ошибка в долях осталась бы очень большой. Приоритет, о котором обычно забывают: Кэлахан и Мейер показали то же самое ещё в 1939 году, за сорок девять лет до Сквайра.
Что делать читателю с этим спором. Мораль урока он не отменяет, а уточняет. Кривую выборку размер не лечит, и тут всё верно. Но у «кривизны» есть по меньшей мере две разные причины: кого позвали и кто откликнулся, и вторая в этом случае, возможно, была сильнее первой. Проверять надо обе.
И вторая половина той же истории, обычно рассказываемая одной фразой. Молодой Джордж Гэллап на выборке в десятки раз меньшей назвал победителя верно, причём по плану, а не по спискам подписчиков. Точный размер той выборки курс раньше называл («около пятидесяти тысяч»), а подтвердить его нам не удалось, и мы его убрали. Зато подтверждается другое: по величине Гэллап промахнулся почти так же грубо, как Digest. Он предсказал Рузвельту 55,7 % двухпартийного голоса при фактических 62,5 %, то есть недооценил на 6,8 пункта. Правильно собранная выборка дала верного победителя, а не точное число. Это честнее исходной морали и полезнее.
И вторая сторона той же монеты в том, что маленькие выборки дико скачут. Кафе с тремя пятизвёздочными отзывами против кафе с 4,4 по четырём сотням: «чистая пятёрка» здесь слабее, а не сильнее. Три отзыва могла оставить семья владельца.
Ловушка 2: среднее и что скрывает итоговое число
«Средний доход жителей района 900 тысяч». В районе один элитный ЖК, и его жильцы утащили среднее вверх, точно как директор с окладом в два миллиона делает «среднюю зарплату отдела» 560 тысяч, которых не получает никто. Среднее чувствительно к выбросам. Когда распределение перекошено (а доходы перекошены всегда), спрашивай медиану, то есть доход человека ровно посередине списка.
Правило чтения простое. Если среднее и медиана рядом, распределение спокойное, одна цифра его описывает. Когда среднее уехало от медианы, в данных сидят выбросы, и «типичного» среднее не описывает. Разница между ними сама по себе информация: она говорит, в какую сторону вытянут хвост.
Второй фокус среднего: оно стирает форму. Два курса с рейтингом 4,0. У одного все ставят четвёрки, у другого половина ставит пятёрки и половина тройки. Средние одинаковы, опыт противоположен: стабильность против лотереи. Поэтому вместе со средним всегда спрашивай про разброс: «а как распределено?» Гистограмма из десяти столбиков объясняет больше, чем любая одна цифра.
Третий фокус касается подвижного знаменателя, и он самый вредный. Средний чек, средний балл, средняя зарплата меняются не только когда меняются люди, но и когда меняется состав. Уволили младший персонал, и средняя зарплата выросла, никому не подняв ни тенге. Ушли мелкие клиенты, и средний чек вырос без единой новой покупки. Число растёт, а происходит плохое.
Ловушка 3: выживший и кто выпал из данных
Вальда ты уже знаешь. Теперь примерь его очки на мирную жизнь. «Он бросил университет и стал миллиардером, значит, диплом не нужен»: мы видим одного дожившего до обложки и не видим тысяч бросивших, которые никуда не пришли, ведь их истории не публикуют. «Старая техника была надёжнее, вон бабушкин холодильник сорок лет работает»: до наших дней дожили удачные экземпляры, а сломанные давно на свалке и в сравнении не участвуют. «Секреты успешных компаний» из бизнес-бестселлеров: автор изучил выживших и не проверил, была ли та же «смелая ставка на инновации» у сотни разорившихся.
Универсальный вопрос против выжившего: «кого нет в этих данных и почему их нет?» Если отсутствие связано с самим исходом (не вернулся, разорился, сломался, отписался, бросил), данные систематически врут, и врут в предсказуемую сторону: выжившие всегда выглядят лучше, чем полная картина.
Отдельно стоит запомнить, что ошибка выжившего не всегда про людей. Она живёт везде, где наблюдение возможно только после отбора. Отзывы на маркетплейсе оставляют те, чья посылка дошла. Судьбу вложений считают по фондам, которые дожили до конца периода, а закрывшиеся из индекса выпадают. Про метод лечения судят по пациентам, вернувшимся на повторный приём. В каждом случае отбор происходит по тому самому исходу, который мы собрались измерять, и это гарантирует ошибку в известную сторону.
«Опросили сто долгожителей: половина никогда не занималась спортом. Выходит, спорт для долголетия не важен». Чьих данных здесь не хватает и как они могли бы перевернуть вывод?Показать ответ
не хватает тех, кто до опроса долгожителей не дожил. Если среди них доля незанимавшихся спортом заметно выше, картина переворачивается: возможно, спорт как раз помогал доживать, просто неспортивные долгожители и есть редкие везунчики, которых ошибка выжившего выставила типичными. Опрашивать надо когорту целиком, с самого начала, а не финалистов.
А что было у самого Вальда
Историю про самолёт рассказывают везде, и почти всегда с картинкой: силуэт бомбардировщика, густо усыпанный красными точками, с чистыми пятнами на двигателях и кабине. Картинку эту стоит разобрать, потому что она служит отличным примером того, чему учит урок.
В восьми меморандумах Statistical Research Group, которые Вальд написал в 1943 году и которые переизданы в 1980-м, нет ни схемы самолёта, ни слов «броня», «защита», «усилить». Полнотекстовый поиск по этим словам даёт ноль вхождений. Там решается вероятностная задача: восстановить ненаблюдаемое распределение поражений по сбитым машинам из наблюдаемого распределения по вернувшимся.
Знаменитую схему с точками нарисовали в 2021 году, и в описании самого файла честно сказано, что она вольно основана на неиллюстрированном отчёте Вальда. Числа, которые иногда выдают за «данные Вальда» (400 самолётов, разбивка 320, 32, 20, 4, 2, 2), взяты из статьи Мангеля и Саманьего 1984 года, где раздел так и называется: гипотетический набор данных.
Метод настоящий, вывод настоящий, слава заслуженная. Схема осталась позднейшей иллюстрацией к пересказу. Разница между «так рассуждал Вальд» и «вот документ Вальда» ровно того же сорта, что разница между «учёные доказали» и «в статье написано». Курс, который учит эту разницу видеть, обязан начинать с себя.
Сервис хвастается: «Средний чек наших клиентов вырос за квартал на 40 %». Какие два вопроса из сегодняшней лекции обязаны прозвучать до аплодисментов?Показать ответ
про среднее, а что с медианным чеком и распределением? Один корпоративный клиент-кит мог сделать весь «рост» в одиночку. И про состав выборки, не изменился ли он: если за квартал ушли мелкие клиенты, средний чек оставшихся вырос сам собой, без единой новой покупки. Число может расти, когда бизнесу становится хуже.
Конспект
Выборка (Г2): самоотбор приводит в данные тех, кто сам пришёл, а кривую выборку не лечит размер (Literary Digest: больше 2,3 миллиона вернувшихся бюллетеней и провал). Но у кривизны две разные причины: кого позвали и кто откликнулся. В этом случае вклад неответивших мог быть даже больше вклада списка, 5,9 против 13,7 пункта у Лузинки при 11 и 7 у Сквайра. После взвешивания большинство владельцев телефона и автомобиля голосовали за Рузвельта. Гэллап назвал победителя верно, но по величине ошибся на 6,8 пункта. Малые выборки скачут: три отзыва не рейтинг. Среднее (Г3): чувствительно к выбросам, поэтому спрашивай медиану. Оно стирает форму, и тут нужен вопрос про разброс. Меняется оно и от смены состава, а не только от смены людей. Выживший (Г5): данные собраны с вернувшихся, и вопрос против него звучит как «кого нет в данных и почему?». У самого Вальда ни схемы самолёта, ни слова «броня» нет: метод настоящий, а картинка служит позднейшей иллюстрацией. Тренажёр: Г2, Г3, Г5.
Одно среднее, три конторы
В трёх компаниях зарплаты устроены по-разному. Сначала оцените типичную зарплату по одному лишь среднему, потом посмотрите на распределение.
Ключевые работы
| Wald | 1943 | Восемь меморандумов Statistical Research Group: метод оценки уязвимости самолёта по повреждениям вернувшихся, то есть восстановление ненаблюдаемого распределения поражений сбитых машин из наблюдаемого по уцелевшим. |
| Squire | 1988 | Переанализ опроса 1937 года о провале Literary Digest: рассылали 10 миллионов бюллетеней, вернулось более 2,3 миллиона (менее 25 %). Вклад смещения выборки оценён примерно в 11 процентных пунктов, а вклад неответивших примерно в 7. |
| Lusinchi | 2012 | Тот же опрос со взвешиванием к известным популяционным значениям: вклад смещения выборки 5,9 пункта против 13,7 у неответивших. После взвешивания большинство владельцев телефона и автомобиля (53,9 %) голосовали за Рузвельта, а различалась готовность отвечать, 16,9 % против 34,5 %. |
| Lohr & Brick | 2017 | Если бы Literary Digest взвесил ответы по вопросу о голосовании 1932 года, прогноз назвал бы победителем Рузвельта (276 выборщиков вместо 161), но ошибка в оценке долей всё равно осталась бы очень большой. |
Разбор
Обе стороны считают в процентных пунктах и не сходятся. Сквайр (1988) на данных опроса Гэллапа 1937 года оценивает вклад смещения выборки примерно в 11 пунктов, а вклад проблем с ответами в 7. Лузинки (2012), взвесив те же данные, получает обратное: 5,9 против 13,7 в пользу неответивших. И прямой удар по «телефонной» версии: после взвешивания большинство владельцев телефона и автомобиля (53,9 %) голосовали за Рузвельта, а различалась готовность вернуть бюллетень, 16,9 % против 34,5 %. Сходятся обе работы в том, что при полном возврате победитель был бы назван верно.
Победителя Гэллап действительно назвал верно и правильным методом, а это главное и это в силе. Но названный размер выборки в первоисточниках подтвердить не удалось: там есть выборка в 3 000 человек, и она про предсказание результата самого опроса Digest, а не выборов. А по величине Гэллап промахнулся почти так же грубо, как Digest: 55,7 % двухпартийного голоса при фактических 62,5 %, недооценка на 6,8 пункта. Правильная выборка дала верного победителя, а не точное число.
В восьми меморандумах Statistical Research Group (1943, переизданы в 1980-м) нет ни картинки самолёта, ни слов «броня», «защита», «усилить», и полнотекстовый поиск даёт ноль вхождений. Там вероятностная задача о восстановлении распределения поражений по сбитым машинам. Знаменитую схему нарисовали в 2021 году, и в описании файла сказано, что она вольно основана на неиллюстрированном отчёте. Числа «400 самолётов, 320/32/20/4/2/2» взяты из статьи Мангеля и Саманьего 1984 года, где раздел назван гипотетическим набором данных.
Термины
- выборкаsample
- Та часть интересующей нас совокупности, о которой реально собраны данные. Вывод законен ровно о той совокупности, на которую выборка похожа.
- репрезентативностьrepresentativeness of a sample
- Свойство выборки повторять состав совокупности по признакам, влияющим на ответ. Размером не заменяется: миллион ответов из одного источника остаётся данными об этом источнике.
- самоотборself-selection
- Попадание в данные по собственной инициативе, через отзыв, подписку, регистрацию. Опасен тем, что решение прийти обычно связано с тем самым, о чём спрашивают.
- смещение неответившихnon-response bias
- Перекос, который создают не те, кого не позвали, а те, кто позван и не ответил. Отдельная причина ошибки: список рассылки может быть кривым и при идеальном списке.
- ошибка выжившегоsurvivorship bias
- Вывод по тем, кто дошёл до наблюдения, без тех, кто не дошёл. Опознаётся вопросом «кого нет в этих данных и связано ли их отсутствие с исходом?».
- медианаmedian
- Значение ровно посередине упорядоченного списка: половина случаев меньше, половина больше. В отличие от среднего, почти не двигается от нескольких огромных значений.
- среднее арифметическоеarithmetic mean
- Сумма значений, делённая на их количество. Хорошо описывает симметричные данные и плохо справляется с перекошенными, потому что чувствительно к выбросам.
- разбросspread
- Насколько значения расходятся между собой. Два набора с одинаковым средним могут различаться разбросом до противоположности, как стабильность против лотереи.
Практикум · Кого нет в данных
Задание модуля из курса: разбор новости с числами. Начинаем с вопроса, кто в выборку не попал.
- Найдите новость или пост, где приводится процент или средняя величина.
- Ответьте на пять вопросов к цифре: эксперимент или наблюдение? кто в данных и кого в них нет? среднее или медиана? проценты от какой базы? не сделан ли вывод на экстремуме?
- Отдельно проверьте на самоотбор: как люди попадали в эту выборку, их выбирали или они пришли сами?
- Найдите пример ошибки выжившего в своей области: чьи истории вы слышите, а чьи нет?
- Напишите 500 слов: что утверждается, что показано на самом деле, какие альтернативные объяснения есть, какого данного не хватает.
Вопросы для самопроверки
Магазин провёл опрос в своём Instagram: «92% довольны нашим сервисом!» Почему цифре нельзя верить?
- Instagram занижает охваты, и опрос увидела лишь часть подписчиков
- Процент слишком круглый: похоже, цифру подогнали
- Опрошены подписчики, уже лояльные магазину люди, а недовольные давно отписались
- 92% это мало: для сервиса норма ближе к ста
«Средний доход жителей района 900 тысяч». В районе стоит один элитный ЖК. Что не так с цифрой?
- Богатый ЖК тянет среднее вверх, типичный житель живёт на другие деньги, поэтому нужна медиана
- Ничего: средняя посчитана по всем жителям района без исключения, а значит, описывает типичного
- Цифра занижена: один элитный ЖК должен был поднять её сильнее
- Доходы вообще нельзя усреднять: у них слишком разные источники
«Он бросил университет и стал миллиардером. Значит, высшее образование не нужно». Что не так?
- Он просто оказался удачливым: удачу не скопируешь, а образование доступно каждому, кто захочет
- Мы видим только выживших: тысячи бросивших и не ставших миллиардерами в статистику не попали
- Университеты обидятся на такой вывод
- Один пример ничего не доказывает: для вывода об образовании нужна хотя бы сотня таких биографий
«Опросил коллег в нашем IT-офисе, все за удалёнку. Значит, страна за удалёнку». В чём проблема?
- Коллеги стеснялись возражать вслух при своём же начальнике и потому соглашались за компанию
- Выборка нерепрезентативна: IT-офис не похож на страну ни по профессиям, ни по возрасту
- Проблемы нет: сотрудники такие же жители страны, и мнение у них ровно такое же, как у всех
- Коллег слишком мало: опросить нужно было весь офис, а ещё лучше всю компанию до единого
«Средний чек вырос на 40%! Наш маркетинг работает!» Что стоит проверить прежде, чем праздновать?
- Не сделал ли один-два крупных заказа весь рост: посмотреть медианный чек и распределение
- Не поменяли ли цвет ценников и выкладку у кассы
- Настроение кассиров: от него зависит допродажа
- Не выросло ли число чеков: если покупок стало больше, средний чек обязан был вырасти
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Lusinchi, «"President" Landon and the 1936 Literary Digest Poll», Social Science History, 2012: Переанализ, из-за которого «всё дело в телефонах» перестало быть решённым вопросом. Читается как детектив: старый опрос 1937 года, взвешивание, и знаменитое объяснение разваливается пополам.
- Wald, «A Method of Estimating Plane Vulnerability Based on Damage of Survivors», Center for Naval Analyses, отчёт CRC 432, 1980 (переиздание меморандумов 1943 года): Первоисточник самой известной истории о выживших. Стоит открыть хотя бы для того, чтобы своими глазами убедиться: схемы самолёта там нет, и слова «броня» тоже.
- Курс статистики школы «Фонтум», урок 2 «Откуда берутся данные и кого в них нет»: Добавка, а не условие: там те же ловушки разбираются как устройство выборочного метода, с планами отбора и весами. Здесь достаточно уметь задать вопрос, там учат на него отвечать.