Полевой эксперимент в экономике
Причинный вывод в одном месте и вопрос, относится ли он к другому
Полевой эксперимент это исследование, в котором воздействие назначается жребием в реальных условиях, в школах, деревнях или отделениях, а не в лаборатории. В западной Кении лечение от гельминтов в 75 школах подняло посещаемость на 7,5 процентного пункта при цене 3,50 доллара за дополнительный год учёбы, а результаты тестов не улучшило. Внутренняя правильность вывода не делает его переносимым в другое место.
MIT 14.73 · Miguel, Kremer, 2004 · Allcott, 2015 · Bold и др., 2018 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Описывать устройство полевого эксперимента в экономике развития и то, что именно он измеряет
- Считать, как перелив эффекта на нелеченых искажает оценку при неверно выбранной единице рандомизации
- Перечислять источники, по которым результат не переносится в другое место, и различать их между собой
- Формулировать, к какой группе относится полученная оценка и что требуется для её переноса
Почему дети в бедной стране пропускают школу? Ответов, каждый из которых звучит убедительно, минимум четыре: учиться дорого, школа далеко, родители не видят отдачи, дети болеют. Каждый ответ предлагает свою программу. Отменить плату, построить школу ближе, объяснять родителям, лечить. Бюджет один. Спор мнений здесь не сходится в принципе: сторонник любого из четырёх ответов приведёт случаи в свою пользу и будет прав в том, что такие случаи есть.
В конце 1990-х в западной Кении сделали иначе. Взяли 75 начальных школ, свыше 30 000 учеников, разделили на три группы по 25 и вводили лечение от гельминтов поэтапно: в 1998, 1999 и 2001 годах. Очередь назначили не нуждой, не активностью директора и не близостью к дороге: школы отсортировали по дивизиону и зоне, а внутри зоны по числу учеников, и раздали по кругу: первая, вторая, третья, снова первая. Это не жеребьёвка, а систематическое распределение по списку. Эпидемиологи, перепроверявшие работу в 2015 году, так и назвали её квазирандомизированной. Разница не придирка: жребий защищает от отбора по любому признаку, включая неизвестные, а порядок в списке работает только на тех признаках, которые в список попали.
Результат опубликован Мигелем и Кремером (2004). Посещаемость в школах программы за два года поднялась на 7,5 процентного пункта при стандартной ошибке 2,7. Прогулы сократились на четверть. Дополнительный год школьного посещения стоит 3,50 доллара: 0,49 доллара на ребёнка, делённые на 0,14 дополнительного учебного года (ошибка 0,05). Первое из этих чисел это цена лекарства в соседней Танзании. Своя кенийская была втрое выше, 1,46, и авторы говорят это прямо. И отдельно: свидетельств улучшения результатов тестов не обнаружено.
Три числа разного сорта, и каждое надо уметь прочесть. Первое это эффект, второе его цена, третье граница, за которой эффекта не нашли. Все три позже пересчитали.
Что полевой эксперимент даёт
Первое даёт причинный вывод там, где были только мнения. Группы школ различались одним: очередью. Назначили её порядком в списке, а не нуждой, не просьбой директора, не ожидаемой отдачей. Почему назначение извне делает сравнение законным и чего не даёт никакая статистическая поправка, разобрано в курсе статистики этой школы. Здесь это берётся готовым, с поправкой из первого раздела: список защищает слабее жребия. Экономическая часть в другом: в поле, где невозможно поставить опыт над страной, оказалось возможным поставить его над школами, деревнями, отделениями банка и торговыми точками.
Вторым идёт цена вместе с эффектом. Это специфический вклад экономики, а не медицины: измеряется не только «работает ли», но и «сколько стоит единица результата». Число 3,50 доллара за дополнительный год школьного посещения само по себе ни о чём не говорит, содержательным оно делается в сравнении. Посчитаем: при бюджете в 100 000 долларов и цене 3,50 доллара за год получается около 28 600 дополнительных лет посещения (100 000 ÷ 3,50 ≈ 28 571). Если у альтернативной программы измеренная цена года окажется вдесятеро выше, то при том же бюджете она купит около 3 400 лет. Сравнение перестаёт быть спором о том, какая идея благороднее, и становится арифметикой, если у второй программы есть своё измеренное число, а не рассуждение.
Третье это ответ узкий и потому честный. Посещаемость выросла, результатов тестов эксперимент не сдвинул. Такой ответ невозможно получить в споре мнений: там программа либо «работает», либо «не работает» целиком. Измерение разделяет: вот величина, которая изменилась, вот величина, которая не изменилась, и вторая ничуть не менее важна. Программа, поднявшая посещаемость, решает задачу присутствия в школе и не решает автоматически задачу обучения. Это два разных утверждения, и раньше они склеивались.
Эксперимент отвечает ровно на тот вопрос, под который выбрана измеряемая величина. Если бы в кенийском исследовании смотрели только на посещаемость, вывод звучал бы шире, чем заслуживает, и никакая безупречность замысла этого не исправила бы. Первое, что стоит спрашивать у сообщения об эксперименте: какие величины измеряли и какие могли измерить, но не стали.
Единица рандомизации: пример, доведённый до конца
У лечения от гельминтов есть свойство, которое ломает наивный замысел: вылеченный ребёнок перестаёт заражать остальных. Представим, что эксперимент устроен привычным образом. Внутри каждой школы половине детей дают лекарство, половине не дают, и сравниваются эти половины.
Числа из работы, первый год программы. Быть учеником школы программы стоило 6,2 процентного пункта посещаемости при ошибке 2,2. Прибавку внутри этих школ получили и те, кто таблетку не принял: у них посещаемость выше на 5,6 пункта при ошибке 2,0, значимо на 99 %. А разница между пролеченным и нелеченым в одной и той же школе вышла −1,2 пункта при ошибке 2,0, то есть неотличима от нуля.
Посчитаем, что увидел бы замысел с рандомизацией внутри школы. Он сравнивает пролеченных с нелечеными одноклассниками, то есть меряет ровно эту разницу, а она около нуля. Школьную прибавку в 6,2 пункта он не увидел бы вовсе: его группа сравнения вылечена вместе со всеми. Отсюда и формулировка в первых строках работы. Рандомизация на уровне отдельного человека занижает пользу лечения дважды: сначала теряет выигрыш нелеченых целиком, потом вычитает этот выигрыш из эффекта у пролеченных. Оговорку авторов опускать нельзя: очередь назначали школам, а не ученикам, поэтому разложение школьного эффекта на прямую часть и внутришкольный перелив получено не экспериментом, а расчётом, и сами авторы называют его более шатким.
И это не вся потеря: перелив выходил за забор школы. Каждая дополнительная тысяча учеников школ программы в радиусе трёх километров прибавляла соседям 4,4 пункта посещаемости при ошибке 2,2, а в среднем по округе программа подняла её на 2,0 пункта при ошибке 1,3. Такая оценка едва значима. Поэтому и распределение по школам не спасло от занижения. Простое сравнение школ программы со школами сравнения даёт за два года 5,1 пункта, а полный эффект в школах программы, посчитанный вместе с межшкольным переливом, составляет 7,5 пункта. Наивная оценка равна 68 % полной (5,1 ÷ 7,5 ≈ 0,68). Продолжение у этих чисел есть: в 2015 году независимые эпидемиологи пересчитали работу по тем же данным и нашли в коде ошибки в подсчёте того, сколько учеников школ программы живёт рядом. На этом подсчёте и держался межшкольный перелив. Прямой эффект в школах программы устоял, межшкольного не осталось, полный после исправления потерял значимость.
Практический вывод выходит далеко за пределы гельминтов: единицу рандомизации выбирают там, где кончается перелив. Если вмешательство действует за пределы того, кому адресовано, сравнивать надо школы со школами, деревни с деревнями, рынки с рынками. Выйти за эти пределы оно может через заражение, через разговоры соседей, через цены на общем рынке. Плата за это высокая: групп становится меньше, точность падает, исследование дорожает.
Чего он стоит
Деньги и время. Кенийское исследование это 75 школ, свыше 30 000 учеников и два года наблюдения. Нужен партнёр, готовый делать не то, что кажется правильным ему, а то, что назначено извне, и делать это годами. Значительная часть замыслов умирает здесь, а не на стадии анализа.
Этические границы. Нельзя разыграть жребием бедность, безработицу, болезнь или потерю жилья: воздействие, которое исследователь считает вредным, назначать нельзя. Возражение «почему одним дают, а другим нет» имеет стандартный ответ, поэтапное внедрение: программа приходит ко всем, различается только очередь, а очередь всё равно надо чем-то определять, и жребий здесь честнее прочих способов. К этому добавляются информированное согласие и разрешение этического комитета, без которых работа не публикуется.
Вопросы, которые не проверяются в принципе. Нельзя бросить жребий над странами. Валютный режим, устройство пенсионной системы, торговая политика, длинные горизонты в десятилетия остаются вне досягаемости метода не потому, что дорого, а потому, что не существует ни группы сравнения, ни того, кто мог бы назначить воздействие.
И цена, которую не видно в смете. Проверяется то, что кто-то согласился профинансировать и внедрить. Набор проверенных вопросов формируется не только их важностью, но и тем, у кого есть организация на месте и интерес к ответу. Это не обвинение, а свойство метода, о котором стоит помнить, читая обзор «что мы знаем о бедности».
Внешняя валидность: главное ограничение
Допустим, эксперимент безупречен: жребий честный, выбывания нет, измерено то, что надо, перелив учтён. Всё перечисленное относится к внутренней валидности, к тому, что вывод корректен для участников этого исследования. Отдельный и не вытекающий из неё вопрос: относится ли полученное число к кому-нибудь ещё. Это внешняя валидность, и в ней состоит основная содержательная критика подхода.
Источников непереноса как минимум три, и они разные.
Площадки отбираются не случайно. Аллкотт (2015) собрал 111 рандомизированных испытаний программы экономии электричества, охвативших 8,6 млн домохозяйств США. Прогноз, построенный по подробным данным первых десяти площадок, систематически завышал эффективность на следующих 101. Механизм отбора прозрачен: программу раньше берут компании в регионах с более выраженной экологической повесткой, и их клиенты сильнее реагируют. Вдобавок сначала её нацеливают на абонентов с высоким потреблением, а при расширении эффективность падает. Обратите внимание на характер расхождения: оно систематическое и в одну сторону, а не случайный разброс, и потому не лечится увеличением числа повторений само по себе.
Исполнитель это часть вмешательства. Болд с соавторами (2018) встроили рандомизированное испытание в общенациональную реформу найма учителей в государственных школах Кении. Учителя, нанятые по срочному контракту международной некоммерческой организацией, значимо подняли результаты тестов. Учителя на точно таких же контрактах, нанятые государством, дали нулевой эффект. Переносится не «программа», а связка программы и того, кто её выполняет. В отчёте о пилоте вторая половина связки обычно не описана вовсе.
Масштаб меняет задачу. Программа для сотни человек и та же программа для миллиона различаются: приспосабливаются цены, зарплаты, очереди и правила. Это рассуждение модельное, и предъявлять его надо именно так: оно указывает, где искать расхождение, но само по себе величины не даёт. Измеряется расхождение отдельно, например тем же способом, каким его измерили Болд и соавторы.
Что с этим делают. Повторяют в разных местах. Шесть рандомизированных оценок расширения доступа к микрокредиту прошли в шести странах на четырёх континентах, в городе и в селе. Общая картина, которую подводят Банерджи, Карлан и Зинман (2015), сводится к умеренно положительным, но не преобразующим эффектам. Согласие шести площадок не доказывает переносимости, но это свидетельство совсем другого веса, чем одна площадка. Выясняют механизм, а не только эффект. Дитон и Картрайт (2018) формулируют обе половины сразу. Оценка относится к той выборке, на которой проведено испытание, и распространять её надо с обоснованием. Но требовать внешней валидности от одного испытания значит ждать от него слишком многого. Вклад испытаний виден в накопительной программе, а она отвечает не на вопрос «что работает», а на вопрос «почему это работает». И называют группу, к которой относится оценка. «Программа повышает посещаемость» и «программа повысила посещаемость в 75 школах западной Кении в конце 1990-х при таком-то исполнителе» говорят о разном, и измерено второе.
Наконец, то, что стоит вынести из раздела в готовом виде. Два из трёх источников непереноса здесь измерены, и оба смещают ожидание в одну сторону, вверх. Отбор площадок: прогноз по первым десяти завышал результат на следующих ста одной. Отбор исполнителя: тот же контракт в руках государства дал ноль вместо значимого эффекта. Третий источник, масштаб, здесь не измерен, и утверждать о нём направление нельзя. Это рассуждение, а не результат. Практическое следствие: получив число из пилота, спрашивайте не «сработает ли», а «насколько меньше выйдет при расширении и из-за чего именно».
Ссылка на рандомизацию закрывает вопрос о внутренней валидности и не закрывает вопрос о том, к кому относится число. Законченная фраза выглядит так: доказано на таких-то людях, в таком-то месте, при таком-то исполнителе и таком-то масштабе. Всё, что за пределами этого перечня, требует отдельного довода, обычно про механизм.
Как читать сообщение о полевом эксперименте
Шесть вопросов, которых достаточно для большинства случаев.
Кто был контрольной группой и как её определили, жребием, очередью или отказом? Что именно измеряли и какую величину измерить не стали? Где кончается перелив и совпадает ли с этой границей единица рандомизации? Кто внедрял программу, исследовательская организация, некоммерческая или государственная? На ком проведено испытание и чем эти люди отличаются от тех, о ком вы думаете? И сколько стоила единица результата, потому что без этого сравнить две программы нечем.
Ни один из шести вопросов не требует техники. Все шесть требуют только того, чтобы не остановиться на слове «рандомизированное».
Следующий урок пойдёт про случаи, когда эксперимента нет вовсе: закон меняют без спроса у исследователя, и приходится искать сравнение в готовой реальности.
Ключевые работы
| Miguel, Kremer, «Worms: Identifying Impacts on Education and Health in the Presence of Treatment Externalities», Econometrica 72(1) | 2004 | Западная Кения, 75 школ и свыше 30 000 учеников, поэтапное введение лечения от гельминтов тремя очередями, в 1998, 1999 и 2001 годах. Очередь назначена не жребием, а порядком в списке. Полный эффект на посещаемость в школах программы с 1998 по 1999 год равен 7,5 п. п. (СО 2,7), прогулы сократились на четверть. Разность посещаемости между школами группы 1 и школами групп 2 и 3 в первый год после лечения, среди тех, кого полагалось лечить (девочки младше 13 лет и все мальчики), дала 9,3 п. п. (СО 3,1, таблица VIII). Это сравнение групп школ, а не пролеченных с непролеченными, и авторы предупреждают, что такие разности занижают полный эффект, потому что не учитывают межшкольный перелив. Сам межшкольный перелив на посещаемость составил 2,0 п. п. (СО 1,3), внутришкольный перелив на нелеченых 5,6 п. п. (СО 2,0), а разница пролеченного и нелеченого внутри школы оказалась −1,2 п. п. (СО 2,0). Разложение на прямую часть и внутришкольный перелив авторы называют неэкспериментальным. Дополнительный год посещения стоил 3,50 доллара. Улучшения результатов тестов не обнаружено. |
| Aiken, Davey, Hargreaves, Hayes, «Re-analysis of health and educational impacts of a school-based deworming programme in western Kenya: a pure replication», International Journal of Epidemiology 44(5) | 2015 | Независимый пересчёт тех же данных по методике самих авторов (75 школ, свыше 30 000 учеников). Найдены ошибки в коде, в том числе в подсчёте окрестного населения школ. Прямые эффекты в школах программы воспроизвелись. Межшкольный перелив на посещаемость сменился с +2,0 п. п. (СО 1,3) на −1,7 п. п. (СО 3,0). Полный эффект упал с 7,5 п. п. (СО 2,7) до 3,9 п. п. (СО 3,2), то есть перестал быть значимым. Наивная оценка выросла с 5,1 п. п. (СО 2,2) до 5,7 п. п. (СО 1,4). Отсутствие эффекта на результаты экзаменов подтвердилось. |
| Allcott, «Site Selection Bias in Program Evaluation», Quarterly Journal of Economics 130(3) | 2015 | 111 рандомизированных испытаний программы экономии электричества, 8,6 млн домохозяйств США: прогноз по первым десяти площадкам систематически завышает эффективность на следующих 101, потому что площадки отбираются не случайно. |
| Bold, Kimenyi, Mwabu, Ng'ang'a, Sandefur, «Experimental evidence on scaling up education reforms in Kenya», Journal of Public Economics 168 | 2018 | Испытание, встроенное в общенациональную реформу найма учителей: одинаковые срочные контракты дали значимый рост результатов тестов при найме некоммерческой организацией и нулевой эффект при найме государством. |
| Banerjee, Karlan, Zinman, «Six Randomized Evaluations of Microcredit», American Economic Journal: Applied Economics 7(1) | 2015 | Шесть рандомизированных оценок доступа к микрокредиту в шести странах на четырёх континентах: устойчивая картина умеренно положительных, но не преобразующих эффектов. |
Что подтвердилось, а что нет
Рандомизация обеспечивает корректность сравнения внутри испытания и ничего не говорит о том, к кому относится полученное число. Проверено прямо: у Аллкотта (2015) прогноз по первым десяти из 111 площадок систематически завышал эффективность на остальных 101, потому что программу раньше берут те, у кого она сильнее сработает. У Болда с соавторами (2018) одни и те же срочные контракты учителям дали рост результатов тестов при найме некоммерческой организацией и нулевой эффект при найме государством. Перенос остаётся отдельным утверждением, требующим отдельного обоснования.
Он показывает, что произошло с измеряемой величиной при назначенном жребием воздействии, и только. Механизм из результата не вычитывается: одно и то же изменение посещаемости совместимо с несколькими объяснениями, а различить их можно лишь дополнительными замерами, специально под это построенными. Дитон и Картрайт (2018) делают из этого прямое следствие: одно испытание входит в знание не само по себе, а как часть накопительной программы, отвечающей на вопрос «почему это работает». Без ответа на него перенос в другое место остаётся догадкой.
Держится в узкой форме и в ходу в широкой. В узкой: там, где воздействие можно назначить жребием, а перелив ограничить, эксперимент даёт самое надёжное доступное свидетельство. В широкой форме утверждение неверно, потому что огромный класс вопросов вне досягаемости метода в принципе: нельзя разыграть жребием валютный режим, устройство пенсионной системы или темп роста за полвека. Нет ни группы сравнения, ни того, кто назначит воздействие. Там достоверность добывается сходимостью разнородных свидетельств, а не одним замером.
Редкий для полевой экономики случай, когда результат проверен не пересчётом, а повторением в других местах. Banerjee, Karlan и Zinman (2015) свели шесть рандомизированных оценок доступа к микрокредиту в шести странах на четырёх континентах, в городе и в селе: картина совпала по знаку и по порядку величины. Оговорка ровно та, которой посвящён урок: согласие шести площадок не доказывает переносимости куда угодно, ведь оценка относится к тем выборкам, на которых испытания проведены. В какую сторону ошибается ожидание при переносе, в этом же уроке измерено: отбор площадок систематически завышал эффективность, а тот же контракт в руках другого исполнителя дал ноль вместо значимого эффекта.
Термины
- полевой экспериментfield experiment
- Исследование, в котором воздействие назначается жребием в реальных условиях, в школах, деревнях, отделениях, а не в лаборатории.
- внутренняя валидностьinternal validity
- Свойство исследования давать корректный вывод для тех, кто в нём участвовал. Обеспечивается устройством сравнения.
- внешняя валидностьexternal validity
- Свойство результата относиться к людям, местам и условиям за пределами исследования. Из внутренней валидности не следует и требует отдельного обоснования.
- переливspillover, treatment externality
- Действие вмешательства на тех, кому оно не адресовано: через заражение, разговоры, общий рынок. Делает группу сравнения частично затронутой.
- единица рандомизацииunit of randomization
- Объект, которому назначается жребий: человек, школа, деревня, рынок. Выбирается так, чтобы перелив оставался внутри единицы.
- поэтапное внедрениеphase-in design
- Замысел, при котором программа приходит ко всем участникам, а жребием определяется очередь. Стандартный ответ на возражение о лишении части людей помощи.
- смещение отбора площадокsite selection bias
- Систематическое расхождение между испытанными и неиспытанными местами, возникающее оттого, что программу берут те, у кого она сильнее сработает.
- затраты на единицу результатаcost-effectiveness
- Стоимость одной единицы измеренного эффекта: например, доллары на дополнительный год школьного посещения. Позволяет сравнивать программы с одинаковой целью.
Практикум · Разобрать один пилот до устройства
Задание на реальном материале: взять сообщение о городской, корпоративной или благотворительной пилотной программе и восстановить её устройство как эксперимента. Тридцать-сорок пять минут.
- Найдите сообщение о программе, где заявлен измеренный результат: «пилот показал», «эксперимент подтвердил», «после введения выросло». Годятся городские, школьные, банковские и корпоративные пилоты.
- Восстановите группу сравнения: с кем сравнивали участников и как эти люди туда попали. Если группы сравнения нет вовсе, так и запишите. Тогда сообщение говорит только о том, что было до и после.
- Найдите перелив: назовите один способ, которым программа могла подействовать на тех, кто в неё не попал. Ответьте, совпадает ли единица, которой назначали участие, с границей этого перелива.
- Посчитайте затраты на единицу результата. Возьмите заявленный бюджет и заявленный эффект и разделите одно на другое. Если одного из двух чисел нет, отметьте, какого именно. Обычно отсутствует бюджет.
- Запишите одной фразой, к кому относится результат: к каким людям, в каком месте, при каком исполнителе и на каком масштабе. Затем назовите одно обстоятельство, при котором он не перенесётся на ваш город или вашу организацию.
Вопросы для самопроверки
Лечение от гельминтов вылечивает ребёнка и заодно снижает заражаемость вокруг. Почему рандомизация внутри школы занижает измеренный эффект?
- Потому что внутри одной школы наблюдений меньше и точность падает
- Потому что лечение действует не сразу и эффект не успевает проявиться
- Потому что нелеченые одноклассники тоже выигрывают, и группа сравнения перестаёт показывать, что было бы без программы
- Потому что дети внутри одной школы слишком похожи друг на друга, а на похожих участниках разница между группами всегда выходит меньше
Программа сократила прогулы, но результатов тестов не изменила. Как это читать?
- Измерены две разные величины, и результат ценен именно этой ограниченностью: посещаемость выросла, свидетельств роста результатов тестов нет
- Программа бесполезна, раз главная величина не сдвинулась
- Тесты измерены неверно: если дети стали чаще бывать в школе, результаты обязаны были вырасти, а раз они не выросли, значит, ошиблись в самом измерении
- Вывод внутренне противоречив, и работу следует отбросить
Программу экономии электричества испытали на 111 площадках. Прогноз, построенный по первым десяти, систематически завышал эффект на остальных 101. Что это показывает?
- Что число испытаний надо было увеличить ещё сильнее: при большем числе площадок среднее сошлось бы к истинному эффекту
- Что первые десять испытаний проведены с методическими ошибками
- Что эффект программы со временем естественным образом ослабевает: первые десять площадок испытали её раньше остальных, и новизна успела сойти
- Что площадки отбираются не случайно, и множество повторений само по себе от этого смещения не спасает
Одинаковые срочные контракты учителям: нанятые некоммерческой организацией дали рост результатов тестов, а у нанятых государством эффект нулевой. Какой вывод следует?
- Что срочные контракты как мера не работают: у государства эффекта не было, а внедрять их будет именно оно
- Что переносится не программа сама по себе, а связка программы и того, кто её выполняет
- Что государственные школы хуже негосударственных: одна и та же мера сработала у некоммерческой организации и не сработала у государства
- Что одно из двух испытаний проведено неверно
Как соотносятся внутренняя и внешняя валидность?
- Это разные вопросы: первая о том, корректен ли вывод для участников, вторая о том, относится ли он к кому-то ещё, и вторая из первой не следует
- Это одно и то же свойство, названное двумя способами
- Внешняя валидность обеспечивается рандомизацией так же, как внутренняя
- Внутренняя валидность следует из внешней: если результат переносится на другие площадки, то для участников исходного испытания он верен тем более
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- MIT 14.73 «The Challenge of World Poverty», Банерджи и Дюфло, видеолекции на OCW: Полный курс, построенный на полевых экспериментах: видно, как из вопроса рождается замысел и во что он обходится.
- Deaton, Cartwright, «Understanding and misunderstanding randomized controlled trials», Social Science & Medicine 210, 2018: Самая аккуратная критика подхода, написанная без желания его отменить. Ключевой тезис: одно испытание входит в знание как часть накопительной программы.
- Курс статистики этой школы, урок 17 «Как устанавливают причину»: Рандомизация, обменяемость и границы наблюдательных выводов. Здесь на это опираются, а не пересказывают.