К содержанию
Фонтум Основы статистики Урок 17 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль V. Связь и причина · урок 17 из 24

Как доказать причинно-следственную связь

Что делает жребий и чего не делает никакая поправка

Причинный эффект это разница между двумя исходами одного объекта: тем, что наступил бы при воздействии, и тем, что наступил бы без него. Наблюдается всегда только один из двух. Сравнение групп корректно при их обменяемости, и именно её создаёт рандомизация. Жребий делает попадание в группу независимым от любых свойств участника, включая неизмеренные. Статистическая поправка даёт лишь условную обменяемость по учтённым признакам.

Data 8, гл. 2 · Hernán & Robins, ч. 1 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Формулировать причинное утверждение как сравнение двух исходов у одного и того же объекта
  • Объяснять, что именно даёт рандомизация и почему статистическая поправка этого не даёт
  • Опознавать естественные эксперименты и проверять допущение, на котором они держатся
  • Оценивать наблюдательное свидетельство по четырём признакам вместо одного лозунга

Восемь пациентов. Пример учебный, числа придуманы и круглы нарочно. Четверо из них выздоровели бы и с лекарством, и без него: болезнь у них лёгкая. Четверо не выздоровели бы ни при каком варианте. Иначе говоря, лекарство не меняет исход ни у одного из восьми: его эффект в точности нулевой.

Теперь пусть врач, как обычно и бывает, назначает лекарство тем, у кого больше шансов: четверым лёгким. Считаем по итогам. Среди получивших лекарство выздоровели 4 из 4, или 100 %. Среди не получивших выздоровели 0 из 4, то есть 0 %.

Разница максимальная из возможных, выборка целиком, никаких погрешностей, никакой случайности, и при этом полностью ложный вывод о лекарстве, которое не действует. Ни одна статистическая процедура на этих данных ошибку не покажет: числа безупречны, неверен способ, которым люди попали в группы.

Урок о том, как эта задача решается, что означает слово «причина» технически и почему жребий делает то, чего не делает никакой расчёт.

Контрфактический исход

Первая часть книги Эрнана и Робинса начинается с уточнения, которое стоит проделать до всякой техники. Что означает «лекарство подействовало на этого пациента»?

Ответ: у него два исхода. Один из них тот, который наступил бы, прими он лекарство. Второй тот, который наступил бы, не прими он его. Оба относятся к одному и тому же человеку в одних и тех же обстоятельствах, и различаются только приёмом. Если они разные, лекарство подействовало, если одинаковые, нет. Второй, ненаступивший, называется контрфактическим исходом.

В нашем примере у первых четырёх пациентов оба исхода «выздоровел», у вторых четырёх оба «не выздоровел». Разность равна нулю у всех восьми, и именно это означает, что эффекта нет. Обратите внимание, насколько это отличается от того, что видно в данных: у четверых лечившихся исход «выздоровел», и никакого способа увидеть, что он наступил бы и без лечения, в таблице не существует.

Отсюда фундаментальная проблема причинного вывода: у каждого человека наблюдается ровно один из двух исходов, второй недоступен навсегда. Индивидуальный эффект остаётся величиной, которую нельзя измерить в принципе, никаким прибором и никакой выборкой.

Что измеримо, так это средний эффект в группе: насколько отличалась бы доля выздоровевших, если бы лекарство получили все, от доли, если бы его не получил никто. Обе доли относятся к одной и той же группе людей в двух разных мирах, и в данных снова доступен только один из миров. Всё дальнейшее идёт про то, при каких условиях сравнение двух разных групп людей заменяет сравнение одной группы с собой.

на заметку«После» и «из-за» технически

Обычное рассуждение «принял, потом выздоровел, значит, помогло» сравнивает состояние до и после. Причинное утверждение сравнивает не «до и после», а «с воздействием и без него» в один и тот же момент у одного и того же человека. Именно поэтому улучшение после вмешательства само по себе не свидетельство: сравнивается не то, что нужно, как и в случае с возвращением к среднему из прошлого урока.

Обменяемость

Условие, при котором сравнение двух групп даёт правильный ответ, формулируется так: группы обменяемы, если, поменяй их местами, результат исследования не изменился бы. То есть у не лечившихся, получи они лечение, доля выздоровевших была бы такой же, какой она вышла у лечившихся, и наоборот.

В нашем примере обменяемости нет, и это видно: у лечившихся все были лёгкими, у нелечившихся все тяжёлыми. Поменяй группы местами, и получилось бы 0 % против 100 %, ровно наоборот. Именно расхождение с этим условием и порождает всё, что в прошлом уроке называлось смешением: смешивающий фактор это то, что делает группы необменяемыми.

Рандомизация решает задачу единственным известным общим способом: она разрывает связь между попаданием в группу и любыми свойствами человека. Если группа определяется жребием, то распределение по тяжести болезни, возрасту, доходу, генетике, привычкам, настроению и всему прочему в двух группах одинаково, включая признаки, которые никто не измерял, не назвал и о которых не догадывался. Это и есть то единственное, чего нельзя получить расчётом: поправка работает по списку, жребий работает по всему сразу.

Проверим на восьми пациентах. Бросаем монету, четверо в каждую группу, и при типичном раскладе в каждую попадут примерно двое лёгких и двое тяжёлых. Тогда выздоровеют 2 из 4 в обеих группах: 50 % против 50 %, разница ноль, то есть настоящий эффект лекарства. Сравнение перестало быть сравнением лёгких с тяжёлыми и стало сравнением лекарства с его отсутствием.

Уточнение, без которого утверждение становится неверным. Жребий уравнивает группы в среднем по повторениям, а не в каждом отдельном испытании. На восьми пациентах монета вполне может отправить троих лёгких в одну группу, и результат окажется смещённым. Чем больше участников, тем меньше вероятность заметного перекоса. Поэтому в отчётах об испытаниях первой таблицей публикуют состав групп по известным характеристикам, не чтобы доказать сопоставимость по неизвестным, а чтобы показать, что жребий не подвёл там, где это можно проверить.

Почему поправка не заменяет жребий

Поправка на измеренные факторы даёт более слабое условие, условную обменяемость: группы сопоставимы внутри каждого сочетания учтённых признаков. Среди мужчин 50-60 лет с тяжёлой формой и одинаковым стажем болезни лечившиеся и нелечившиеся, будем надеяться, различаются только лечением.

Слова «будем надеяться» здесь не риторические. Условная обменяемость это допущение, и оно не проверяется по данным. Ни один тест не отвечает на вопрос, остался ли неучтённый фактор: чтобы его обнаружить, надо было его измерить, а если бы его измерили, на него сделали бы поправку. Дальше становится хуже: даже измеренный фактор, учтённый грубо, оставляет часть смешения внутри интервалов. Так выходит с возрастом десятилетними интервалами и с курением по принципу «да или нет».

Отсюда асимметрия, которую стоит запомнить. Наблюдательное исследование с двадцатью поправками требует истинности утверждения «других важных различий не осталось», которое никто не может ни доказать, ни опровергнуть данными. Рандомизированное испытание требует только того, что жребий был честным, а это свойство процедуры, известное по построению.

Симметричная честность требует сказать, чего рандомизация не делает. Она не спасает от выбывания участников: если из тяжёлой группы уходят самые тяжёлые, сопоставимость исчезает уже после жребия. Не спасает от разного отношения к группам, а для этого нужно, чтобы ни участник, ни врач не знали распределения, отсюда ослепление. Не отвечает на вопрос о тех, кого в испытание не включили: если брали людей 30-50 лет без сопутствующих болезней, вывод относится к ним. И не делает результат безошибочным: остаётся обычная случайная погрешность, оцениваемая интервалом. Все инструменты первых четырёх модулей нужны и здесь.

осторожноЧто означает «при прочих равных» в отчёте

Оборот «при прочих равных» в наблюдательном исследовании означает буквально: при равных значениях тех переменных, которые перечислены в методике. Всё, что не перечислено, равным не сделали. Поэтому осмысленный вопрос к любой такой работе звучит не «учли ли факторы», а «какой фактор, не вошедший в список, мог бы объяснить результат целиком, и насколько сильным он должен быть для этого».

Естественные эксперименты

Рандомизировать можно далеко не всё. Нельзя назначить человеку курение, бедность, войну или профессию. Часто нельзя по этическим причинам, часто потому, что никто не согласится. В ответ остаётся искать ситуации, где по группам людей распределила не воля исследователя, но и не их собственный выбор.

Первым идёт настоящий жребий, проведённый кем-то другим: распределение мест в программе по лотерее при избытке заявок, случайное назначение проверяющих или судей, розыгрыш жилья. Второй тип называют административным порогом: если решение принимается по баллу с отсечкой, то люди чуть выше и чуть ниже границы почти не различаются между собой, а обращаются с ними по-разному. Третий означает резкое изменение правила в определённый момент или на определённой территории, при наличии сопоставимой территории, где правило не менялось. Четвёртый строится на географической границе, по разные стороны которой действуют разные порядки, а люди похожи.

Во всех четырёх случаях работает одна идея: найти механизм распределения, который не связан с изучаемым исходом. Логика та же, что у рандомизации, только жребий бросил не исследователь.

На третьем типе стоит остановиться, потому что вокруг него построена большая часть прикладных работ. Правило изменилось в одном штате и не изменилось в соседнем. Сравнивают при этом не занятость в двух штатах, а то, как она сдвинулась в каждом: на сколько в первом и на сколько во втором. У приёма и название такое, разность разностей. Держится он на допущении, которое надо называть вслух: без вмешательства оба штата двигались бы дальше одинаково.

Само допущение о будущем непроверяемо, но у него есть проверяемое следствие в прошлом. Возьмите те же два штата за несколько лет до изменения правила и посмотрите, шли ли их кривые рядом. Если шли параллельно, допущение обосновано. Не доказано, но обосновано. Если один штат уже поднимался быстрее другого, разность разностей припишет вмешательству то, что происходило и без него. Отсюда практический вопрос к любой такой работе: показан ли график до вмешательства, а не только после. Отсутствие этого графика не мелочь оформления, а необоснованное допущение, на котором стоит весь вывод.

Слабое место у всех четырёх тоже общее. Утверждение «распределение здесь не связано с исходом» снова оказывается допущением, и его надо обосновывать, а не объявлять. У лотереи может отличаться доля тех, кто воспользовался выигрышем. У порога слабым местом становятся те, кто узнал о нём заранее и подтянул балл. У изменения правила таким местом будет совпадение с другим изменением того же времени. У границы это различия, накопленные до её появления. Естественный эксперимент лучше обычного наблюдения ровно настолько, насколько правдоподобно защищено это допущение, и разбор такой защиты составляет обязательную часть чтения подобных работ.

Когда наблюдательные данные всё-таки убеждают

Из всего сказанного напрашивается вывод, что без эксперимента говорить о причине нельзя. Это перегиб, и по-своему такой же вредный, как наивное чтение корреляций. Существуют причинные утверждения, установленные наблюдательно и не вызывающие сомнений. Разберём, за счёт чего.

Величина. Чтобы неучтённый фактор целиком объяснил наблюдаемую разницу, он должен быть связан и с воздействием, и с исходом не слабее, чем сама эта разница. Для двукратного различия нужен очень сильный скрытый фактор, который при этом никем не замечен. Чем крупнее эффект, тем менее правдоподобно такое предположение. Разница в несколько процентов, наоборот, объясняется смещением легко и потому убеждает слабо.

Доза-ответ. Если больше воздействия соответствует больше исхода, и упорядоченно, по всем ступеням, то смешение обязано быть устроено так же ступенчато, что требует уже совпадения, а не просто наличия скрытого фактора.

Механизм. Знание о том, как именно одно приводит к другому, превращает утверждение в проверяемое: механизм предсказывает, где эффект должен появиться, где исчезнуть и что произойдёт при вмешательстве в промежуточное звено. Одно только правдоподобие механизма ничего не стоит, ведь правдоподобную историю можно рассказать про любую связь. Стоит его проверяемость.

Согласованность разных дизайнов. Самый сильный из четырёх аргументов. Когорты, исследования случай-контроль, естественные эксперименты, данные разных стран и эпох имеют разные слабые места и разные источники смещения. Если все они дают один ответ, то для объяснения через смещение придётся предположить, что разные механизмы искажения сговорились дать одинаковый результат.

Итог модуля стоит сформулировать без смягчений в обе стороны. Причинность не выводится расчётом из наблюдательных данных: нет процедуры, которая по таблице чисел выдала бы ответ о причине, и появление такой процедуры не ожидается. Но она и не недостижима: устройство исследования, а не обработка чисел, позволяет получить ответ, и наблюдательные данные при перечисленных условиях дают свидетельство, с которым считаются. Поэтому вместо «корреляция не означает причинности» полезнее спрашивать: каким механизмом люди попали в эти группы и что различило бы оставшиеся объяснения. Первое кончает разговор, второе составляет его содержание.

методТри вопроса к причинному утверждению

Первый: как объекты попали в группы, жребием, чужим решением, собственным выбором? Второй: какое неучтённое различие могло бы объяснить результат целиком и насколько сильным оно должно быть? Третий: что предсказывает причинная гипотеза такого, чего не предсказывают остальные, и проверено ли это? Три ответа дают больше, чем любая таблица поправок.

Ключевые работы

Hernán, Robins, «Causal Inference: What If», часть 12020Контрфактические исходы, средний причинный эффект, обменяемость и условная обменяемость. Рандомизация как способ обеспечить обменяемость по построению, без моделей.
Adhikari, DeNero, Wagner, «Computational and Inferential Thinking»2022Глава 2: причинность и эксперименты вводятся второй главой, до всякой техники, и речь там о сравнении групп, роли случайного распределения, границах наблюдательных выводов.

Что здесь путают

отвергнутоИз наблюдательных данных о причине сказать нельзя ничего.

Перегиб, зеркальный наивному чтению корреляций. Крупная величина эффекта, упорядоченная зависимость от дозы, проверяемый механизм и согласие исследований с разными источниками смещения вместе дают свидетельство, которое приходится принимать всерьёз: объяснить его смещением можно, лишь предположив скрытый фактор, сильнее самой связи и при этом никем не замеченный. Верное утверждение слабее: причинность не выводится расчётом по таблице чисел, а обеспечивается устройством исследования.

сильно ослабленоРандомизация уравнивает группы по всем признакам.

Уравнивает в среднем по повторениям, а не в каждом конкретном испытании. На восьми пациентах монета легко отправит троих лёгких в одну группу, и результат окажется смещённым. Вероятность заметного перекоса падает с ростом числа участников. Отсюда практика публиковать таблицу состава групп: она проверяет удачу жребия там, где это можно проверить. Верная формулировка: рандомизация делает попадание в группу независимым от любых свойств участника, включая неизвестные, но каждое отдельное распределение остаётся случайным.

отвергнутоЕсли сделать поправку на все известные различия, наблюдательное исследование становится равносильно эксперименту.

Поправка даёт условную обменяемость, то есть сопоставимость внутри сочетаний учтённых признаков, и держится на допущении, что важных неучтённых различий не осталось. Допущение по данным не проверяется: чтобы обнаружить пропущенный фактор, его надо было измерить, а измеренный был бы учтён. Вдобавок грубое измерение оставляет смешение внутри интервалов. Рандомизация же требует лишь честности жребия, и это свойство процедуры, известное заранее.

выдержалоЖребий уравнивает группы и по тем признакам, которых никто не измерял.

Держится потому, что это свойство процедуры, известное по построению, а не допущение о данных: случайное назначение разрывает связь между попаданием в группу и любыми свойствами человека, включая неназванные и неизмеренные. Поправка так не умеет, она работает по списку измеренного, а условная обменяемость по данным не проверяется вовсе. Оговорок три, и все в силе. Жребий уравнивает в среднем по повторениям, а не в каждом отдельном малом испытании. Он не спасает ни от выбывания участников, ни от разного отношения к группам, а для второго нужно ослепление. И он ничего не говорит о тех, кого в испытание не включили.

Термины

контрфактический исходcounterfactual outcome
Исход, который наступил бы у того же объекта при другом воздействии. Наблюдается всегда только один из двух.
фундаментальная проблема причинного выводаfundamental problem of causal inference
Невозможность наблюдать оба исхода у одного объекта, откуда неизмеримость индивидуального эффекта.
средний причинный эффектaverage causal effect
Разница исходов в одной и той же группе при двух вариантах воздействия. Величина, которую эксперимент и оценивает.
обменяемостьexchangeability
Свойство групп, при котором их перестановка не изменила бы результата исследования. Условие корректности сравнения.
условная обменяемостьconditional exchangeability
Обменяемость внутри каждого сочетания учтённых признаков. То, что даёт поправка. Допущение, не проверяемое по данным.
рандомизацияrandomization
Распределение по группам жребием. Делает попадание в группу независимым от любых свойств участника, включая неизмеренные.
рандомизированное контролируемое испытаниеrandomized controlled trial
Исследование с распределением по группам жребием и группой сравнения. Вывод относится к тем, кого включили.
ослеплениеblinding
Сокрытие распределения от участника, а по возможности и от исследователя. Защищает от различий в обращении с группами после жребия.
естественный экспериментnatural experiment
Ситуация, где распределение по группам произошло по механизму, не связанному с исходом: лотерея, административный порог, изменение правила, граница.
зависимость доза-ответdose-response relationship
Упорядоченное усиление исхода с ростом воздействия. Один из признаков, повышающих доверие к наблюдательному выводу.

Практикум · Разобрать одно причинное утверждение до конца

Задача в том, чтобы провести с чужим утверждением всю процедуру урока: перевести его в контрфактическую форму, найти, где ломается обменяемость, и оценить свидетельство по четырём признакам. Нужен один реальный текст: новость, реклама, отчёт, пост с советом.

  1. Найдите утверждение вида «X улучшает Y» и выпишите три вещи по отдельности: воздействие, исход и группу людей, о которых идёт речь.
  2. Переформулируйте его контрфактически: «у этих людей исход при X отличался бы от исхода при отсутствии X». Проверьте, что оба варианта относятся к одним и тем же людям, а не к разным группам.
  3. Назовите механизм попадания в группы: люди выбрали сами, кто-то решил за них или сработал жребий. Выпишите три различия между группами, существовавшие до воздействия, и отметьте, какие из них вообще измеримы.
  4. Опишите испытание с рандомизацией, которое ответило бы на вопрос: кого включаем, как распределяем, что и когда измеряем. Если провести его нельзя, назовите причину и придумайте естественный эксперимент, который к нему ближе всего, вместе с допущением, на котором он держится.
  5. Оцените имеющееся свидетельство по четырём признакам, а именно величина, доза-ответ, механизм, согласованность разных дизайнов, и запишите вывод одной фразой: что здесь установлено, что правдоподобно и чего не хватает.

Вопросы для самопроверки

Вопрос 1

Что технически означает «лекарство подействовало на этого пациента»?

  • Его состояние улучшилось по сравнению с состоянием до приёма
  • Он выздоровел после того, как принял лекарство
  • Его исход при приёме отличается от исхода, который наступил бы без приёма
  • Он выздоровел быстрее, чем в среднем выздоравливают больные
Вопрос 2

Восемь пациентов: четверо выздоровели бы при любом варианте, четверо не выздоровели бы ни при каком. Врач дал лекарство первым четверым, получилось 100 % против 0 %. Каков эффект лекарства?

  • Нулевой: ни у одного из восьми исход не зависит от приёма
  • Максимальный: разница между группами предельная, больше 100 против 0 не бывает
  • Определить нельзя: выборка слишком мала, при восьми пациентах любой вывод об эффекте преждевременен
  • Положительный, но величину надо оценивать интервалом: при восьми наблюдениях точечная оценка ненадёжна
Вопрос 3

Что даёт рандомизация такого, чего не даёт поправка на измеренные факторы?

  • Гарантию, что результат перенесётся на любую другую популяцию
  • Возможность обойтись без группы сравнения
  • Полное отсутствие случайной погрешности в оценке
  • Сопоставимость групп по признакам, которые никто не измерял и не называл
Вопрос 4

Места в программе распределялись лотереей, потому что заявок было больше, чем мест. Почему это ценно для оценки эффекта программы?

  • Потому что выборка получается больше, чем в обычном исследовании: заявок подано больше, чем мест, и в анализ входят все
  • Распределение по группам не связано со свойствами заявителей, как при рандомизации
  • Потому что лотерея исключает случайную погрешность: жребий уравнивает группы точно, а не в среднем
  • Потому что заявители сами выбрали участие и потому мотивированы: мотивация делает оценку эффекта чище
Вопрос 5

Наблюдательные исследования разных типов дают один ответ, эффект крупный, есть упорядоченная зависимость от дозы и известен механизм. Как это оценить?

  • Свидетельство доказывает причинную связь так же, как эксперимент: четыре независимых признака вместе заменяют жребий
  • Свидетельство сильное: объяснить его смещением можно лишь очень неправдоподобным набором допущений
  • Свидетельство ничего не стоит: без рандомизации о причине говорить нельзя, а наблюдательные схемы отличаются друг от друга только названием
  • Свидетельство слабое, потому что механизм нельзя считать статистическим аргументом, а зависимость от дозы объясняется тем же смешением

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Hernán, Robins, «Causal Inference: What If», часть 1: Контрфактические исходы и обменяемость без единой модели. Там же данные и код к каждой главе.
  • Adhikari, DeNero, Wagner, «Computational and Inferential Thinking», глава 2: Причинность и эксперименты до всякой техники это то же решение, что принято в этом курсе.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?