Рандомизация: что даёт жребий
Рандомизация не уравнивает группы, а даёт основание посчитать ошибку. И опорное испытание поля жребием не было: фактическую процедуру напечатали через одиннадцать лет и в чужом журнале
Рандомизация не уравнивает группы, а даёт основание посчитать ошибку: жребий обнуляет перекос лишь в среднем по повторениям, а в одном опыте перекос есть. Так пишут Дитон и Картрайт, и об этом знал ещё Фишер в 1926 году. Опорное испытание поля, кенийская дегельминтизация 1998 года, жребием и не было: 75 школ распределили по списку, а фактическую процедуру напечатали через одиннадцать лет. Жребий вдобавок не чинит отсев и разное обращение с группами после распределения.
Дитон и Картрайт, Social Science & Medicine, 2018 · Мигель и Кремер, Econometrica, 2004 · «Toolkit» Дюфло, Гленнерстер и Кремера · 24 мин · обновлено 24.09.2026
После урока вы сможете
- Объяснять, почему тест баланса в первой таблице работы проверяет гипотезу, верную по построению
- Отличать несмещённость от точности и не путать свойство процедуры со свойством одного результата
- Спрашивать, где напечатана фактическая процедура распределения и чем упорядочен список, если распределяли по списку
- Называть три вещи, которые жребий не чинит: случайный перекос, отсев и разное обращение с группами после распределения
- Читать квазирандомизацию как сведение о приборе, а не как приговор результату
Возьмём четыре деревни. Две получат программу, две останутся без неё. Пусть сначала выбирают старейшины: кто громче просил, тот и попал. Такой выбор никуда не годится, и объяснять почему не требуется.
Теперь бросим жребий. Способов разделить четыре деревни на две и две ровно шесть. Один из этих шести оказывается в точности тем, который выбрали бы старейшины. Значит, у жребия есть шанс выдать ровно ту раскладку, которую мы только что забраковали.
Получается неловкость. Одна и та же раскладка хороша, если вышла из шляпы, и плоха, если её выбрали люди. Пример придумал Ангус Дитон, и вывод он делает короткий: сам по себе жребий не гарантирует ничего. Гарантия появляется не в отдельном опыте, а в другом месте, и весь этот урок про то, в каком именно.
Дальше курс разберёт два десятка программ, и почти у каждой в описании встретится слово «рандомизированное». Прежде чем читать такие описания, стоит понять, что это слово обещает. Обещает оно меньше, чем принято думать, и не совсем то.
Что об этом напечатано в пособиях
Спор идёт не с анонимным собеседником. Есть печатное пособие по оценке воздействия, совместное издание Межамериканского банка развития и Всемирного банка. Во втором издании 2016 года, на странице 69, напечатано вот что.
Мы можем быть уверены, что оценённое нами воздействие и есть истинное воздействие программы, поскольку мы устранили все наблюдаемые и ненаблюдаемые факторы, которые иначе могли бы правдоподобно объяснить разницу в исходах.
Ангус Дитон и Нэнси Картрайт приводят эту фразу целиком и выносят приговор в одну строку: это утверждение ложно. Дело не в резкости формулировки, а в подмене. Фраза говорит о балансе в этом самом опыте, а рандомизация даёт баланс в среднем по множеству мысленных повторений. Обратите внимание и на то, чего в цитате нет: о размере выборки в ней не сказано ни слова.
Это важно для того, как курс будет обращаться со спором дальше. Разбираемое утверждение напечатано не критиками метода, а его собственными пособиями. Речь, стало быть, не о том, что кто-то в поле неправ, а о том, что ходовая формулировка описывает прибор неверно.
Статья Дитона и Картрайт вышла в журнале Social Science & Medicine в августе 2018 года и заняла двадцать страниц. Это работа о приборе, а не исследование людей: собственных измерений в ней нет, а числа взяты из чужих работ и из одного численного опыта самих авторов. В том же номере журнала напечатано восемнадцать комментариев к ней, среди них ответ Гвидо Имбенса на страницах 50-52. И сами авторы во введении отказываются от роли обвинителей: «мы не против рандомизированных испытаний, мы против магического мышления о них».
Что жребий делает на самом деле
Разность средних в опыте складывается из двух частей. Первая равна тому, что дало вмешательство, а вторая перекосу по всем прочим причинам, который в этот раз выпал случайно. Жребий делает вторую часть равной нулю в среднем, и среднее это берётся по бесконечному числу повторений опыта на той же выборке.
В отдельном опыте вторая часть нулю не равна почти никогда. Её величину мы не знаем и узнать не можем. И в самом жребии нет ничего, что ограничивало бы её размер. У эпидемиологов для этого есть имя: случайное смешение, то есть перекос, которого никто не вносил, но который выпал.
Знал об этом и тот, кто рандомизацию придумал. Рональд Фишер писал в 1926 году: «Большинство экспериментаторов, проведя случайное распределение, будут потрясены тем, как далеко от равного распределяются делянки». Фраза про делянки, потому что речь шла о полевых опытах в земледелии. Для деревень и школ она верна ровно так же.
Большая выборка спасает хуже, чем кажется. Уже при трёх причинах, у каждой из которых три значения, клеток для уравнивания получается двадцать семь. А причин у школьной посещаемости или у заработка не три. Дитон и Картрайт вспоминают тут три миллиарда пар оснований в человеческом геноме: важной может оказаться любая, и если важной окажется именно несбалансированная, один опыт уедет далеко от истины.
Тогда зачем он нужен
Ответ Фишера был не про баланс. Жребий нужен затем, что он даёт основание посчитать величину ошибки. Если распределение случайно, известно, как ведёт себя оценка при повторениях, а значит, можно назвать стандартную ошибку и получить осмысленное «значимо» или «незначимо». В этом достоинство рандомизации, а не в том, что она уравнивает группы.
Отсюда различение, которое стоит держать в голове весь курс. Несмещённость относится к процедуре, а не к отдельному результату. Она говорит: если повторить опыт бесконечно много раз, средняя оценка совпадёт с истиной. Точность касается другого: насколько далеко от истины уехала одна конкретная оценка. Точность даёт не жребий, а стратификация и контроль на исходные признаки.
Сами Дитон и Картрайт формулируют жёстко: в лучшем случае испытание даёт несмещённую оценку, и свойство это ограниченной практической ценности. Ограниченной потому, что бесконечного числа повторений нет ни у кого. У вас есть один опыт, и про него несмещённость не говорит ничего.
За несмещённость вдобавок платят. Из испытания достаётся только среднее распределения эффектов, и только для той выборки, на которой опыт шёл. Медиана эффекта из него не опознаётся вовсе, хотя знать её часто хотелось бы не меньше. Причина арифметическая: среднее разностей равно разности средних, а для медиан такого равенства нет.
Первая таблица и тест, которому нечего проверять
Откройте почти любую работу поля, и первой таблицей будет сравнение групп до начала программы. Возраст, пол, доход, исходные баллы, а рядом столбик p-значений. Читателю предлагается убедиться: группы вышли одинаковыми, значит, всё чисто.
У этой процедуры неудобное свойство. Если жребий проведён правильно, проверяемая гипотеза верна по построению: распределение и вправду было случайным. Колин Бегг сформулировал это ещё в 1990 году: раз проверяется гипотеза, заведомо верная, то значимый результат такого теста по определению ложноположителен.
Практика при этом живучая. Обновлённое заявление CONSORT 2010 года прямо пишет, что тесты исходных различий по-прежнему обычны, и приводит подсчёт: в 1997 году они стояли в половине из пятидесяти испытаний, напечатанных в ведущих общих журналах. Дитон с Картрайт пишут, что в экономике так делают тоже, и называют поимённо работу самих лауреатов премии 2019 года. Это их утверждение о содержании чужой таблицы, и сам курс той таблицы не открывал.
И здесь курс обязан сказать, что перед нами спор, а не приговор. Дитон и Картрайт в этом споре сторона, и позицию их разделяют не все. Больше того, они сами оговариваются: несбалансированность не портит вывод в том смысле, что стандартная ошибка у несмещённой оценки от неё не ломается. Ссылаются они при этом на Стивена Сенна как на самое ясное изложение противоположной позиции.
Из того, что тест баланса ничего не показал, не следует, что группы одинаковы: он проверяет не это. Из того, что он показал различие, не следует подлог. Полезен такой тест в одном узком случае: когда распределение жребием не было, а печатное описание процедуры расходится с тем, что сделали на самом деле. Тогда различие в первой таблице становится сведением о процедуре, а не о случайности. Ровно этот случай разбирается дальше.
Опорное испытание поля жребием не было
Теперь конкретный случай, и он неудобный. Речь о кенийской дегельминтизации 1998-1999 годов, работе, из которой выросла половина спора о методе. Семьдесят пять сельских начальных школ округа Бусиа в западной Кении, три группы по двадцать пять, программа приходила очередями: первая группа с 1998 года, вторая с 1999-го, третья с 2001-го. Учеников в этих школах было больше тридцати тысяч, от шести до восемнадцати лет.
В журнале напечатано так: школы разбили по зоне и по участию в других программах помощи, затем перечислили по алфавиту и каждую третью отправили в очередную группу. Читается это как раздача по списку, где список к исходу отношения не имеет. Фактическая процедура была другой, и узнали о ней только в 2015 году.
Когда данные отдали независимым переанализаторам, авторы сообщили им поправку, причём неопубликованную. По ней зоны внутри каждого дивизиона перечислялись по алфавиту, а школы внутри зоны перечислялись по возрастанию числа учеников на февраль 1997 года в третьих-восьмых классах. Три школы, сперва исключённые, дописали в конец списка. Дальше шёл круг: первая школа списка в группу 1, вторая в группу 2, третья в группу 3, четвёртая снова в группу 1.
Разница между двумя описаниями не косметическая. Алфавит с успеваемостью не связан никак. Число учеников связано напрямую: большая школа и маленькая отличаются многим, в том числе тем самым присутствием детей, которое здесь и мерили. Эпидемиологи, разбиравшие эти данные, дали дизайну своё имя: кластерное квазирандомизированное ступенчатое испытание. Формальной поправки у исходной статьи нет до сих пор.
В той же переработке нашлось ещё одно. Год рождения отсутствовал у 17 % детей первой группы, 19 % второй и 31 % третьей, и в исходной работе про эти пропуски не сказано. А у тех детей, чей возраст известен, средний возраст между группами различается значимо. Величины различия репликаторы не приводят и осторожно называют это возможным перекосом на входе. Что случилось с числами самого испытания, разбирает одиннадцатый урок. Здесь важно другое: исходная таблица заговорила ровно там, где распределение не было жребием.
Все четыре ранние кенийские работы, с которых начинался метод, распределяли школы систематически по списку. В работе про учебники в группу шла каждая четвёртая школа, в работе про настенные таблицы каждая вторая, в дегельминтизации каждая третья, а в работе про премии учителям шли школы с нечётными номерами. Слово «рандомизированное» означало тогда не жребий, а распределение по правилу, не связанному с исходом. Алфавитный список такое правило даёт. Список по числу учеников такого правила уже не даёт.
Три вещи, которые жребий не чинит
Допустим, жребий был настоящим. Дальше начинается жизнь, и с группами в ней происходят разные вещи. Дитон и Картрайт формулируют это так: сама по себе рандомизация не гарантирует несмещённости, если после распределения группам позволено различаться ещё чем-нибудь. Источников таких различий три, и их стоит держать в голове.
Первый: отсев. Случайный отсев бьёт только по мощности, а вот отсев, связанный с самим вмешательством, смещает оценку. Одинаковые доли выбывших в группах при этом ничего не доказывают: выбывать могли разные люди по разным причинам. Числа тут крупнее, чем принято думать. В той же кенийской работе экзамен, который проводила сама организация, пропустили 34 % учеников лечебных школ и 32 % контрольных. А экзамены были одним из объявленных исходов испытания.
Поэтому в главном методическом пособии поля правило записано жёстко: первым шагом анализа всегда должен быть отчёт об уровне отсева в обеих группах и сравнение выбывших с оставшимися по исходным данным. Когда лишних предположений делать не хочется, считают границы Мански-Ли: интервал, внутри которого истинный эффект лежит при самых осторожных допущениях.
Второй источник: разное обращение с группами после распределения. Экономические испытания почти никогда не бывают двойными слепыми, и участники обычно знают, в какой они группе. Мартин Равальон пишет об этом прямо: смещения, связанные с наблюдением, здесь вероятнее, чем в клинике. Его текст 2020 года ходит рабочим документом NBER и главой в книге Оксфордского университета, и курс берёт формулировку из рабочей версии. И тут же Равальон приводит довод против себя: одно испытание случайно раздавало людям знание о замысле экспериментатора и значимого эффекта не нашло.
Третий: назначение и получение расходятся. В той же дегельминтизации таблетки достались и 5 % учеников контрольных школ. А главной причиной, по которой ребёнок из лечебной школы оставался без таблетки, было отсутствие в школе в день раздачи. Это не выбор и не отказ, а ограничение. Правило курса тут общее: когда чужое решение выглядит странно, обычно неверно понято ограничение, а не человек. Развилку «кому предложили и кто взял» подробно разбирает седьмой урок.
Чего отсюда не следует
Из сказанного не следует, что полевые испытания не работают. Не следует и того, что кенийская программа ничего не дала: её числа разбирает четвёртый модуль, и разбирает подробно. Квазирандомизация говорит о том, чем получена оценка, а не о её знаке.
Не следует и того, что кто-то кого-то обманывал. Ни одна работа этого курса не отозвана и не уличена в подлоге. Фактическую процедуру распределения сообщил сам автор исходной работы. Ошибки в файлах анализа искали и находили исследователи того же поля. Возражения печатаются в тех же журналах, что и работы. Спор ведут не посторонние.
Что действительно следует: три вопроса к любому описанию распределения. Где напечатана процедура и совпадает ли напечатанное с тем, что сделали. Чем упорядочен список, если распределяли по списку. И что случилось с группами после распределения: сколько выбыло, кто получил назначенное, чем группы различались, кроме самой программы.
В Бусии распределили по трём очередям 75 школ и мерили присутствие ребёнка в школе при внезапном визите сотрудника организации, в 1998 и 1999 годах. Из того, что распределение не было жребием, не следует ни одно решение о программах в других местах. Такое решение требует того, чего в этой процедуре нет: цен и заражённости в другой стране, чужого бюджета и того, от чего ради этой траты откажутся. Принимают его те, кто этим бюджетом распоряжается и за него отвечает. Курс на этом останавливается. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.
Что дальше
Модуль о полевом испытании только начался. Этот урок разобрал одно распределение и то, что оно обещает. Следующий берётся за единицу счёта: почему тысяча детей в двадцати пяти школах стоит куда меньше тысячи независимых человек и что с этим делает арифметика.
А потом курс возьмётся за нули. Их, оказывается, два сорта, и в пересказах оба называются одним словом. Различить их можно только по интервалу, и шестой урок показывает, как это делается, на шести испытаниях микрокредита, где авторы сами разъясняют разницу.
Ключевые работы
| Deaton A, Cartwright N, Social Science & Medicine | 2018 | Обзорно-методологическая работа о том, что рандомизация делает и чего не делает. Собственных измерений на людях в ней нет, числа взяты из чужих работ и из одного численного опыта авторов. Двадцать страниц, открытая копия PMC6019115. Судьба: в том же номере журнала напечатано восемнадцать комментариев к ней, среди них ответ Гвидо Имбенса на страницах 50-52. Во введении авторы отказываются от роли обвинителей. |
| Aiken AM, Davey C, Hargreaves JR, Hayes RJ, чистая репликация кенийской дегельминтизации, International Journal of Epidemiology | 2015 | Чистая репликация: те же методы на тех же данных кенийской дегельминтизации, без новых понятий и новых расчётов, план анализа опубликован заранее. Здесь напечатана фактическая процедура распределения 75 школ, сообщённая авторами исходной работы неопубликованной поправкой, и отмечены пропуски года рождения у 17, 19 и 31 % детей трёх групп. Открытая копия PMC4681107. |
| Miguel E, Kremer M, Econometrica | 2004 | Кластерное испытание со ступенчатым введением программы: 75 сельских начальных школ округа Бусиа в западной Кении, три группы по двадцать пять, больше тридцати тысяч учеников от шести до восемнадцати лет, 1998 и 1999 годы. Исход посещаемости: присутствие ребёнка в школе при внезапном визите сотрудника организации. Судьба: дважды переанализирована по заказу стороннего фонда, формальной поправки нет до сих пор. |
| Duflo E, Glennerster R, Kremer M, «Using Randomization in Development Economics Research: A Toolkit», рабочий документ NBER | 2006 | Методическое пособие поля, а не отдельная работа: измерений в нём нет. Читан полный текст рабочего документа. Опубликованная версия вышла главой в Handbook of Development Economics 2007 года. Отсюда взято правило об отсеве: первым шагом анализа всегда должен быть отчёт об уровне отсева в обеих группах и сравнение выбывших с оставшимися по исходным данным. |
| Gertler PJ, Martinez S, Premand P, Rawlings L, Vermeersch CMJ, «Impact Evaluation in Practice», 2-е издание, Межамериканский банк развития и Всемирный банк | 2016 | Пособие по оценке воздействия, а не отдельная работа. Разбирается одна его фраза со страницы 69, та, где сказано, что устранены все наблюдаемые и ненаблюдаемые факторы. Цитата приведена по разбору Дитона и Картрайт 2018 года. Саму страницу пособия при сборке курса не сверяли, и это сказано прямо. |
Что подтвердилось, а что нет
Так написано не у критиков метода, а в его собственных пособиях: во втором издании руководства по оценке воздействия Межамериканского банка развития и Всемирного банка, на странице 69, сказано, что устранены все наблюдаемые и ненаблюдаемые факторы. Жребий делает ожидаемый перекос нулевым по множеству мысленных повторений. В отдельном опыте перекос есть, величина его неизвестна, и ограничить её жребий не может. Размера выборки в этой формуле нет вовсе. Цитата приведена по разбору Дитона и Картрайт 2018 года, сама страница пособия при сборке курса не сверялась.
Во введении той же статьи стоит дословная оговорка: ничто из сказанного не следует считать общим доводом против рандомизированных испытаний, авторы против не испытаний, а магического мышления о них. Работа вышла в Social Science & Medicine в августе 2018 года, и в том же номере напечатано восемнадцать комментариев к ней, включая ответ Гвидо Имбенса на страницах 50-52. Спор идёт печатно и с ответами. Жанр разоблачения к нему не подходит.
Фактическая процедура распределения 75 школ округа Бусиа стала известна в 2015 году: авторы сообщили её переанализаторам неопубликованной поправкой. Зоны перечислялись по алфавиту, а школы внутри зоны перечислялись по возрастанию числа учеников на февраль 1997 года в третьих-восьмых классах, дальше шёл круг 1-2-3. Печатное описание в журнале говорит другое: алфавитный список и каждая третья школа. Число учеников связано с исходом напрямую, в отличие от алфавита. Эпидемиологи, переанализировавшие эти данные, называют дизайн кластерным квазирандомизированным ступенчатым испытанием. Формальной поправки у исходной статьи нет до сих пор.
Термины
- рандомизацияrandomization
- Распределение участников или групп между вмешательством и контролем по случайному правилу. Групп в отдельном опыте она не уравнивает: она делает ожидаемый перекос нулевым по множеству мысленных повторений и тем даёт основание посчитать величину ошибки.
- случайный перекосrandom confounding
- Разница между группами по причинам, кроме вмешательства, выпавшая по жребию в конкретном опыте. Величина её неизвестна, и в самой рандомизации нет ничего, что ограничивало бы её размер.
- несмещённостьunbiasedness
- Свойство процедуры, а не отдельного результата: при бесконечном повторении опыта средняя оценка совпала бы с истинной величиной. О том, насколько далеко от истины ушла одна конкретная оценка, несмещённость не говорит ничего.
- стратификацияstratification
- Разбиение выборки на слои по заранее известным признакам, с отдельным жребием внутри каждого слоя. Точность оценки повышает именно она вместе с контролем на исходные признаки, а не сам факт случайного распределения.
- проверка балансаbalance test
- Сравнение групп по исходным признакам с p-значениями, обычно первой таблицей работы. Если жребий проведён верно, проверяемая гипотеза верна по построению, и значимый результат такого теста по определению ложноположителен.
- квазирандомизацияquasi-randomization
- Распределение по систематическому правилу (каждый второй или каждый третий по упорядоченному списку) вместо жребия. Эпидемиология выделяет такие испытания в отдельную категорию, потому что читать оценку приходится с оглядкой на то, чем упорядочен список.
- ступенчатое введениеstepped-wedge design
- Порядок, при котором программа приходит к группам не сразу, а очередями, и ещё не получившая её группа служит контролем. В кенийской дегельминтизации очередей было три, а сам график диктовали деньги и возможности организации.
- отсевattrition
- Потеря части участников к моменту измерения исхода. Случайный отсев бьёт только по мощности. Отсев, связанный с самим вмешательством, смещает оценку, и потому его уровень в обеих группах называют до всякого результата.
Практикум · Проверить одно описание распределения
Полчаса и одна работа, у которой в описании стоит слово «рандомизированное». Годится любая: испытание программы, медицинская статья, отчёт об оценке. Считать ничего не нужно: задача в том, чтобы найти четыре места, где обычно и прячется ответ.
- Найдите в тексте сам абзац о распределении и выпишите его дословно. Отметьте, сказано ли, чем именно тянули жребий: генератором чисел, монетой, лотереей на сходе или порядковым номером в списке.
- Если распределяли по списку, найдите, чем этот список упорядочен. Алфавит и порядок поступления заявок с исходом обычно не связаны. Размер, доход, исходный балл и расстояние до дороги связаны почти всегда.
- Откройте первую таблицу, сравнение групп до начала программы. Смотрите не на p-значения, а на то, по скольким признакам вообще сравнивали и каких признаков в таблице не оказалось.
- Найдите долю выбывших к моменту измерения исхода, отдельно по каждой группе. Если её в тексте нет, запишите это как отдельную находку: правило поля требует называть эту долю первым шагом анализа.
- Напишите две фразы: чем распределяли на самом деле и что случилось с группами после распределения. Если на первый вопрос текст работы ответа не даёт, это тоже результат, и говорит он о работе больше, чем любое её число.
Вопросы для самопроверки
В работе написано: «школы были случайно распределены по трём группам», а в первой таблице все различия между группами незначимы. Что из этого следует?
- Группы уравнены по всем признакам, известным и неизвестным, и различие в исходах объяснять больше нечем
- Незначимость в первой таблице не даёт ничего: такой тест бессмыслен и в верно проведённом испытании, и в любом другом
- Перекос по прочим причинам в опыте есть, а величина его неизвестна: жребий обнуляет ожидание перекоса по повторениям, а не в каждом опыте
- Всё решает размер выборки: при достаточно большой выборке баланс по всем причинам достигается сам собой
Чем несмещённость отличается от точности?
- Несмещённость относится к процедуре при повторениях, точность даётся стратификацией и контролем, а не самим жребием
- Это одно и то же свойство, названное словами разных дисциплин: статистики говорят «несмещённость», а экономисты в поле развития говорят «точность»
- Несмещённость касается среднего эффекта, а точность касается медианного, и одно испытание оценивает обе эти величины одинаково надёжно
- Несмещённая оценка тем точнее, чем крупнее выборка, поэтому в большом испытании эти два свойства попросту совпадают
Чистая репликация 2015 года выяснила, как на самом деле распределяли 75 школ кенийской дегельминтизации. Что именно оказалось важным?
- Что распределение было систематическим, а не жребием: любое распределение по списку делает оценку смещённой
- Что процедуру придумали задним числом: до 2015 года описания распределения не печатали вовсе
- Что школы упорядочили по алфавиту, а алфавит связан с успеваемостью сильнее, чем принято думать
- Что школы внутри зоны упорядочили по числу учеников (по признаку, связанному с исходом), а печатное описание говорило другое
Жребий проведён безупречно. Что после этого всё равно способно сместить оценку?
- Ничего: после верно проведённого жребия смещение уже невозможно, остаётся один вопрос точности
- Отсев, связанный с вмешательством, разное обращение с группами и расхождение назначения с фактическим получением
- Только неверный выбор единицы распределения: если распределять школы, а не детей, оценка непременно окажется смещённой
- Только отсев, и то лишь в том случае, когда доли выбывших в группах заметно различаются между собой
Из того, что распределение школ в кенийской дегельминтизации не было жребием, читатель делает четыре вывода. Какой из них лишний?
- Значит, прибавка посещаемости в этой программе выдумана, и числа этой работы читать не стоит
- Печатное описание процедуры бывает неверным, и стоит спросить, где напечатано фактическое
- Эпидемиологи и экономисты называют такой дизайн по-разному, и само название дизайна тоже сведение
- Упорядочение списка по признаку, связанному с исходом, совсем не то же самое, что упорядочение по алфавиту
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Deaton A., Cartwright N. «Understanding and misunderstanding randomized controlled trials». Social Science & Medicine, 2018, 210:2-21 (открытая копия PMC6019115): Открыта полностью. Главная оговорка авторов стоит не в аннотации, а во введении: они против магического мышления о рандомизированных испытаниях, а не против самих испытаний. Разделы о том, что даёт жребий и что происходит с группами после распределения, открывают статью. В том же номере журнала следом идут восемнадцать комментариев к ней.
- Aiken A.M., Davey C., Hargreaves J.R., Hayes R.J. «Re-analysis of health and educational impacts of a school-based deworming programme in western Kenya: a pure replication». International Journal of Epidemiology, 2015, 44(5):1572-1580 (открытая копия PMC4681107): Открыта полностью. Фактическая процедура распределения школ напечатана здесь, а не в исходной работе, и приведена как неопубликованная поправка одного из её авторов. Там же напечатан абзац о пропусках года рождения и о значимых различиях среднего возраста между группами.
- Davey C., Aiken A.M., Hayes R.J., Hargreaves J.R. «Re-analysis of health and educational impacts of a school-based deworming programme in western Kenya: a statistical replication of a cluster quasi-randomized stepped-wedge trial». International Journal of Epidemiology, 2015, 44(5):1581-1592 (открытая копия PMC4681108): Открыта полностью. Классификация дизайна вынесена прямо в заглавие. Это самый короткий способ увидеть, чем считают опорное испытание поля эпидемиологи. Числа самой работы разбираются в одиннадцатом уроке.
- Miguel E., Kremer M. «Worms: Identifying Impacts on Education and Health in the Presence of Treatment Externalities». Econometrica, 2004, 72(1):159-217: Авторская копия открыта на личной странице Эдварда Мигеля в Беркли, журнальная версия закрыта. Читать стоит абзац о том, как школы разбивали на группы, и соседнее с ним признание авторов, что назначение в лечебную школу нельзя брать инструментом для фактического лечения. Печатное описание процедуры полезно сравнить с поправкой из чистой репликации.
- Duflo E., Glennerster R., Kremer M. «Using Randomization in Development Economics Research: A Toolkit». NBER Technical Working Paper 333, 2006: Рабочий документ открыт. Опубликованная версия вышла главой в Handbook of Development Economics 2007 года. Раздел об отсеве короткий и полезнее прочих: там записано правило отчитываться об уровне отсева в обеих группах прежде любого результата, и там же названы границы Мански-Ли.