Парадокс Симпсона и конфаундеры
Как одни и те же данные дают противоположные ответы
Парадокс Симпсона это ситуация, когда направление связи в объединённых данных противоположно направлению в каждой подгруппе. Хрестоматийный пример дал приём в аспирантуру Беркли в 1973 году. В целом приняты 44 % мужчин и 35 % женщин, но по отдельным факультетам перекоса не было. За парадоксом стоит смешивающий фактор: переменная, связанная и с признаком, по которому сравнивают, и с исходом. Здесь это выбранное направление.
Bickel и др., 1975 · Hernán & Robins, ч. 1 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Проверять фактор на смешивающий по двум условиям сразу, а не по одному
- Показывать на числах, как направление связи меняется при разбиении данных
- Различать смешивающий фактор и посредника и понимать, почему поправка на них даёт разное
- Читать фразу «учли такие-то факторы» как утверждение с проверяемыми границами
Осень 1973 года, приём в аспирантуру Калифорнийского университета в Беркли. Подано 12 763 заявления: 8 442 от мужчин и 4 321 от женщин. Приняты 3 738 мужчин, или 44 %, и 1 494 женщины, то есть 35 %.
Девять процентных пунктов на выборке в двенадцать тысяч человек дают разницу, которую случайностью не объяснить. Университет запросил разбор, и разбор дал результат, ставший с тех пор учебниковым: при рассмотрении факультетов по отдельности картина исчезала. Значимых отклонений почти не было, а факультетов, где доля принятых женщин выше, оказалось примерно столько же, сколько обратных.
Одни и те же заявления, один и тот же критерий, две противоположные картины, и выбор между ними зависит от того, считать всё вместе или по частям. Урок о том, почему так выходит, как узнать этот случай заранее и какой из двух ответов верный. Забегая вперёд: не всегда тот, что получен разбиением.
Смешивающий фактор: два условия сразу
Определение короткое и требует аккуратности. Смешивающий фактор это то, что связано и с признаком, по которому сравнивают, и с исходом, который измеряют. Оба условия обязательны: фактор, связанный только с одним из двух, картину не искажает.
Проверим на приёме в аспирантуру. Возьмём в кандидаты на роль смешивающего фактора выбранное направление. Связано ли оно с полом? Да: женщины чаще подавали на одни направления, мужчины на другие. Связано ли оно с исходом? Да, и очень сильно: на разных факультетах доля принятых различалась в разы. Оба условия выполнены, значит, сравнение общих долей смешивает два разных вопроса, насколько охотно принимали и куда подавали.
Теперь противоположный пример. Пусть при поступлении собирают ещё и месяц рождения. Он, вероятно, никак не связан с полом и никак не связан с решением приёмной комиссии. Разбивать по нему данные бессмысленно: доли внутри групп будут теми же, что и в целом, с точностью до случайных колебаний. Не всякая имеющаяся переменная требует поправки, и здесь как раз тот случай, когда лишняя поправка ничего не даёт.
У Эрнана и Робинса, чья первая часть книги как раз про такие вопросы без всяких моделей, определение даётся глубже, через то, сопоставимы ли группы между собой. К этому курс придёт в следующем уроке. Пока достаточно двойного условия: связан с тем, что сравниваем, и связан с тем, что измеряем.
Два вопроса подряд, оба должны получить «да». Первый: различаются ли сравниваемые группы по этому фактору? Второй: влияет ли этот фактор на исход сам по себе, безотносительно к группам? Один «да» из двух, и фактор не смешивающий, поправка на него ничего не исправит. Два «да», и сравнение без поправки отвечает не на тот вопрос, который задан.
Разворот на числах
Разберём механику на маленьком выдуманном примере, где всё пересчитывается в уме. Два факультета, по шестьсот заявлений от мужчин и шестьсот от женщин.
Факультет А, принимает щедро. Мужчины: подали 500, приняты 300, это 60 %. Женщины: подали 100, приняты 65, это 65 %.
Факультет Б, принимает скупо. Мужчины: подали 100, приняты 20, доля 20 %. Женщины: подали 500, приняты 125, доля 25 %.
На каждом факультете доля принятых женщин выше: 65 против 60 и 25 против 20. Складываем. Мужчины: 300 + 20 = 320 из 600, то есть 53,3 %. Женщины: 65 + 125 = 190 из 600, то есть 31,7 %. Женщины впереди в обеих частях и на 21,7 пункта позади в сумме.
Никакой ошибки в арифметике нет, и никакого парадокса, кроме названия, тоже. Общая доля это взвешенное среднее долей по факультетам, а веса задаются тем, куда люди подавали. У мужчин: 500/600 веса на щедром факультете и 100/600 на скупом, отсюда 0,833 × 60 % + 0,167 × 20 % = 53,3 %. У женщин наоборот: 0,167 × 65 % + 0,833 × 25 % = 31,7 %. Внутренние доли у женщин выше, а вес почти целиком лежит там, где принимают плохо. Этот перевес решает всё.
Отсюда общее правило: разворот возможен всегда, когда группы неодинаково распределены по подгруппам с сильно разными исходами. Чем сильнее различаются исходы между подгруппами и чем сильнее перекос в распределении, тем легче поменять знак разницы. Для разворота не нужно ни редких совпадений, ни подтасовки: достаточно того, что люди не случайно выбирают, куда подавать.
Беркли, осень 1973
В настоящих данных сработало то же самое. Разбор Бикеля, Хаммела и О'Коннелла, опубликованный в Science в 1975 году, показал: женщины чаще подавали на направления с низким процентом приёма, а мужчины на те, где принимали охотнее. Общая разница в девять пунктов складывалась в основном из этого распределения, а не из решений комиссий.
Дальше начинается то, что обычно теряется в пересказе. Авторы не остановились на констатации «разница исчезает». При корректном объединении факультетских данных обнаружился небольшой, но статистически значимый перекос, причём в пользу женщин. И, что важнее, авторы отдельно оговорили: сам выбор направлений мог формироваться под влиянием более ранних социальных факторов, которых эти данные не измеряют вовсе. На вопрос, почему женщины систематически подавали туда, где меньше мест, заявления в приёмную комиссию ответа не содержат.
Поэтому вывод работы формулируется узко: наблюдаемая общая разница объясняется распределением заявлений по направлениям, а не различием в решениях по заявлениям. Утверждение «дискриминации не было» из этого не следует и авторами не делалось: они разобрали одну стадию процесса и прямо указали, что предшествующие стадии их данными не охвачены.
Различие между этими двумя формулировками вовсе не придирка. Оно ровно то же, что различие между смешивающим фактором и посредником, о котором дальше: если выбор направления сам является следствием того, что мы изучаем, то, разбив данные по направлениям, мы убираем не помеху, а часть искомого.
Расхожая версия приписывает работе вывод, которого в ней нет. Показано другое: общая разница в долях приёма объясняется тем, куда подавали заявления, и на уровне решений комиссий значимого перекоса против женщин не обнаружено, а небольшой значимый перекос в их пользу есть. Сами авторы отметили, что выбор направления мог складываться под действием более ранних факторов, которые эти данные не измеряют. Работа стоит в курсе как демонстрация парадокса Симпсона, а не как ответ на социальный вопрос.
Разбивать или не разбивать
Из всего сказанного естественно следует, что дробный ответ всегда точнее общего. Вывод неверен, и это самое важное место урока.
Пример учебный, числа придуманы, медицинские они только по виду. Пусть препарат снижает давление, а давление влияет на риск осложнения. Взяли две тысячи человек: тысяча получила препарат, тысяча нет. Среди получивших у 800 давление в итоге низкое, у 200 высокое. Среди не получивших низкое у 300 и высокое у 700. Риск осложнения зависит только от достигнутого давления: 8 % при низком, 25 % при высоком, одинаково в обеих группах.
Считаем. Получавшие препарат: 0,08 × 800 + 0,25 × 200 = 64 + 50 = 114, то есть 11,4 %. Не получавшие: 0,08 × 300 + 0,25 × 700 = 24 + 175 = 199, то есть 19,9 %. Разница почти вдвое. А теперь разобьём по давлению, и внутри каждой группы риск одинаков: 8 % против 8 % и 25 % против 25 %. Разбиение показывает нулевой эффект у препарата, который работает.
Причина в том, чем давление здесь является. Оно не смешивающий фактор, а посредник: лежит на пути от препарата к исходу и само есть следствие приёма препарата. Поправка на посредника убирает ровно тот механизм, через который эффект и действует. Смешивающий фактор существует до воздействия и влияет на то, кто его получит. Посредник появляется после и передаёт влияние дальше.
Отсюда рабочее правило, которое стоит запомнить дословно: какой из двух ответов верен, определяется не арифметикой, а тем, откуда взялся сам фактор. Если он существовал до воздействия и связан с обоими, данные надо разбивать. Если он сам является следствием воздействия, разбивать нельзя, иначе эффект вычитается из самого себя. Одни и те же числа при разных ответах на этот вопрос требуют разного обращения, и решить его данными нельзя: нужно знание о том, как устроен процесс.
Каждая поправка это утверждение о роли фактора в процессе, а не техническая процедура. Поправка на смешивающий фактор приближает к ответу, поправка на посредник уводит от него, а поправка на фактор, не связанный ни с чем, просто уменьшает точность. Список «мы учли пол, возраст, доход, образование и регион» сам по себе не говорит, стало ли лучше: чтобы это понять, надо знать, чем каждый из пяти является в изучаемом процессе.
Что это меняет при чтении работ
Первое. Любая разница между группами в наблюдательных данных читается вместе с вопросом: чем эти группы отличаются, кроме изучаемого признака. Спрашивать надо не «есть ли смещение», оно есть почти всегда, а какое именно и в какую сторону. Пьющие кофе отличаются от непьющих возрастом, курением, режимом сна и работой, и сравнение по здоровью суммирует все эти различия сразу.
Второе. Поправка исправляет только то, что измерено. Фактор, о котором не подумали или который невозможно измерить, остаётся в данных полностью. Это называется остаточным смешением, и его не видно ни в одной таблице. Поэтому фраза «учли двенадцать факторов» описывает старание авторов, а не надёжность вывода: тринадцатый мог быть решающим.
Третье, и оно ведёт прямо в следующий урок. Из того, что после поправки связь сохранилась, не следует, что она причинная, а из того, что исчезла, не следует, что причины нет. В обоих случаях мы получили условную связь при фиксированных значениях нескольких переменных, не более и не менее. Есть, однако, способ добиться сопоставимости групп сразу по всем признакам, включая те, о которых никто не подумал, и он не статистический. Это рандомизация, и о ней последний урок модуля.
Разворот при разбиении
Два отделения принимают заявки. На каждом из них доля одобрений у группы Б выше. Меняйте, сколько заявок каждая группа подаёт куда, и следите за общей строкой.
Ключевые работы
| Bickel, Hammel, O'Connell, «Sex Bias in Graduate Admissions: Data from Berkeley», Science 187(4175) | 1975 | Приём осенью 1973 года: 12 763 заявления, 44 % принятых мужчин против 35 % женщин. В разбивке по факультетам разница исчезает, при корректном объединении обнаруживается небольшой значимый перекос в пользу женщин. |
| Hernán, Robins, «Causal Inference: What If», часть 1 | 2020 | Понятия смешивающего фактора, обменяемости и контрфактического исхода без статистических моделей, и условия, при которых поправка на переменную приближает к причинному ответу. |
Что здесь путают
Такого вывода авторы не делали. Показано, что общая разница в 44 % против 35 % объясняется распределением заявлений по направлениям, а на уровне решений по заявлениям значимого перекоса против женщин нет, зато есть небольшой значимый перекос в их пользу. Отдельно оговорено, что сам выбор направления мог складываться под влиянием более ранних социальных факторов, которых эти данные не измеряют. Работа отвечает на вопрос об одной стадии процесса и прямо отказывается отвечать за предшествующие.
Верно, когда фактор существовал до воздействия и связан и с ним, и с исходом. Если фактор сам является следствием воздействия, это посредник, и разбиение вычитает эффект из самого себя. В учебном примере урока препарат снижает риск с 19,9 % до 11,4 %, а при разбиении по достигнутому давлению эффект обращается в ноль внутри каждой подгруппы. Какой ответ верен, решается знанием о порядке событий, а не данными.
Поправка работает только по измеренным переменным. Неизмеренный или неучтённый фактор остаётся в данных целиком, и в таблице результатов это никак не проявляется. Таково остаточное смешение. Список учтённых переменных описывает, что сделали авторы, и ничего не говорит о том, чего они не знали. Сопоставимости групп по признакам, о которых никто не подумал, добиваются единственным способом, и он не статистический, а рандомизация.
Это свойство самих чисел, а не ошибка счёта, и наблюдалось оно на настоящих данных: разбор Бикеля, Хаммела и О'Коннелла (Science, 1975) показал, что общая разница долей приёма в Беркли осенью 1973 года складывалась из того, куда подавали заявления, а не из решений комиссий. Уцелел разворот как явление. Не уцелело правило, которое из него обычно выводят: «дробный ответ точнее общего» неверно, ведь если фактор сам является следствием воздействия, разбиение вычитает эффект из самого себя. Какой из двух ответов верен, решает не арифметика, а знание о том, откуда взялся фактор.
Термины
- смешивающий факторconfounder
- Переменная, связанная и с признаком, по которому сравнивают, и с измеряемым исходом. Существует до воздействия.
- парадокс СимпсонаSimpson's paradox
- Ситуация, когда направление связи в объединённых данных противоположно направлению в каждой подгруппе.
- стратификацияstratification
- Разбиение данных на подгруппы с одинаковым значением фактора и сравнение внутри каждой.
- поправка на факторadjustment, controlling for
- Любой способ учесть переменную при сравнении: стратификация, взвешивание, включение в модель. Всегда утверждение о роли этой переменной в процессе.
- посредникmediator
- Переменная на пути от воздействия к исходу, сама являющаяся его следствием. Поправка на неё убирает часть искомого эффекта.
- взвешенное среднееweighted average
- Среднее подгрупповых величин с весами по численности подгрупп. Механизм, из-за которого возможен разворот при объединении.
- остаточное смешениеresidual confounding
- Часть смешения, оставшаяся после поправки: от неизмеренных факторов и от грубости измерения учтённых.
- наблюдательное исследованиеobservational study
- Исследование, в котором распределение по группам произошло само, без вмешательства исследователя.
Практикум · Собрать разворот и найти его
Задача из двух частей: сначала построить парадокс Симпсона своими руками, чтобы увидеть, насколько легко он получается, потом отыскать смешивающий фактор в чужих числах.
- Придумайте две группы, например два способа обучения, и две подгруппы с сильно разными исходами: лёгкие задачи и трудные. Задайте доли успеха так, чтобы способ Б был лучше в обеих подгруппах: скажем, 80 % против 75 % на лёгких и 40 % против 35 % на трудных.
- Подберите численности так, чтобы в сумме выиграл способ А: большую часть наблюдений способа А поместите на лёгкие задачи, а большую часть способа Б на трудные. Посчитайте общие доли и убедитесь, что знак разницы сменился.
- Проверьте расчёт вторым способом: представьте каждую общую долю как взвешенное среднее двух подгрупповых с весами по численности. Числа должны совпасть до десятых.
- Возьмите любое реальное сообщение вида «в группе X показатель лучше, чем в группе Y»: сравнение регионов, школ, клиник, каналов продаж. Выпишите три переменные, которые связаны и с принадлежностью к группе, и с показателем.
- Для каждой из трёх переменных ответьте, существовала ли она до того, как объект попал в свою группу, или появилась после. Первые попадают в кандидаты в смешивающие факторы, вторые в посредники. Запишите, разбиение по каким из них приблизило бы к ответу, а по каким увело бы от него.
Вопросы для самопроверки
Два факультета. На каждом доля принятых женщин выше, чем мужчин, а в сумме по обоим она заметно ниже. Что это означает?
- Приёмные комиссии применяли к женщинам более строгий критерий: иначе итоговая доля не могла бы оказаться ниже
- Женщины чаще подавали туда, где принимают реже, а общая доля считается как взвешенное среднее
- В расчётах ошибка: сумма двух долей, каждая из которых выше, не может дать долю ниже
- Правильный ответ даёт общая доля, а факультетские искажены малыми числами: чем мельче разбиение, тем менее надёжна доля
Какая переменная является смешивающим фактором при сравнении смертности среди пьющих и не пьющих кофе?
- Месяц рождения: измерен у всех участников
- Любая переменная, связанная со смертностью
- Марка кофе: различается между участниками
- Курение: связано и с потреблением кофе, и со смертностью
Что показала работа Бикеля и соавторов о приёме в Беркли в 1973 году?
- Что дискриминация была, но в пользу мужчин только на некоторых факультетах, а на остальных приём шёл поровну
- Что выборка в 12 763 заявления слишком мала для вывода: для сравнения долей по факультетам нужны сотни тысяч наблюдений
- Общая разница объясняется распределением заявлений по направлениям, а о более ранних факторах данные не говорят
- Что дискриминации при приёме в университет не было: работа закрыла вопрос о равенстве возможностей
Препарат снижает риск осложнения с 19,9 % до 11,4 %, действуя через снижение давления. При разбиении пациентов по достигнутому давлению разница исчезает. Как это читать?
- Давление здесь посредник, и поправка на него убирает сам механизм действия
- Препарат не работает: внутри подгрупп разницы нет
- Данные противоречивы и непригодны для вывода
- Давление здесь смешивающий фактор, и верен разбитый ответ
В статье указано, что при сравнении групп сделана поправка на возраст, пол, доход, образование и регион. Что отсюда следует?
- Что исследование эквивалентно эксперименту с рандомизацией
- Что перекос по этим пяти переменным учтён, а по остальным нет
- Что группы стали сопоставимыми и вывод можно читать как причинный
- Что поправка избыточна и снижает точность оценки
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Bickel, Hammel, O'Connell, «Sex Bias in Graduate Admissions: Data from Berkeley», Science, 1975: Первоисточник, который стоит прочесть именно ради оговорок: они и отличают работу от её пересказа.
- Hernán, Robins, «Causal Inference: What If», часть 1: Смешение и обменяемость без моделей. Книга выложена автором в открытый доступ.