К содержанию
Фонтум Борьба с бедностью Урок 5 / 24 Все уроки

Главная · Курсы · Борьба с бедностью · Программа курса · Модуль II. Как устроено полевое испытание · урок 5 из 24

Кластерная рандомизация и размер выборки

Кластер, внутриклассовая корреляция и цена группового распределения: тысяча детей в двадцати пяти школах стоит примерно восьмидесяти независимых человек

Кластерная рандомизация, когда программу разыгрывают между школами или деревнями, а не между людьми, режет точность испытания, и режет сильно. Тысяча детей в двадцати пяти школах при внутриклассовой корреляции 0,3 даёт точность примерно восьмидесяти независимых человек: стандартная ошибка вырастает в 3,6 раза, и эту величину зовут эффектом дизайна. Поэтому в поле считают число школ, а не детей. Если про кластер забыть, оценка остаётся несмещённой, а ложной становится значимость.

«Toolkit» Дюфло, Гленнерстер и Кремера · Bertrand, Duflo, Mullainathan, Quarterly Journal of Economics, 2004 · Bold и др. 2018 · 25 мин · обновлено 24.09.2026

После урока вы сможете

  • Считать эффект дизайна по формуле и переводить его в эквивалентное число независимых наблюдений
  • Объяснять, почему добавить кластер полезнее, чем добавить людей в уже охваченный кластер
  • Различать, что ломается при забытом кластере: оценка остаётся несмещённой, ложной становится значимость
  • Называть, чем плоха кластерно-робастная стандартная ошибка при малом числе кластеров и что делают вместо неё
  • Спрашивать у любого испытания, что было единицей распределения и сколько таких единиц было

Методическое пособие поля перечисляет три довода за то, чтобы разыгрывать программу между деревнями и школами, а не между людьми. Первый: соседи влияют друг на друга, и лечение одного меняет положение другого. Второй: если сотрудник уже приехал в деревню, охватить в ней побольше людей дешевле. Третий не про статистику вовсе.

Раздать программу половине деревни и отказать другой половине значит поссорить с деревней ту организацию, которая раздаёт. Авторы пишут об этом прямо. Организация может просто отказаться участвовать в такой оценке. И проследить, что деревни получили назначенное, исследовательской группе куда проще, чем следить за каждым человеком. Вывод пособия занимает одну строку: выбор уровня, на котором разыгрывают, крайне зависит от обстоятельств.

Считать после этого приходится иначе, и разница крупная. Тысяча детей, разложенных по двадцати пяти школам, даёт примерно ту же точность, что восемьдесят независимых человек. Дети никуда не делись: их по-прежнему тысяча, и опрошен каждый. Изменилось то, сколько новых сведений приносит каждый следующий опрошенный.

Этот урок о том, куда девается разница между тысячей и восемьюдесятью. Она считается формулой в две строки, и формула старше полевых испытаний в экономике. Из неё выходит правило, по которому в этом поле считают школы, а не детей.

Почему двое из одной деревни это меньше, чем двое

Возьмём школу и посмотрим на баллы её учеников. Часть разброса берётся оттого, что дети разные. Обозначим её σ². Другая часть берётся оттого, что разные сами школы: учитель, здание, дорога, то, чем живёт посёлок вокруг. Её обозначим τ².

Доля второй части во всём разбросе и есть та величина, ради которой урок написан. Считается она просто: ρ = τ² / (τ² + σ²). Это внутриклассовая корреляция, мера того, насколько два ребёнка из одной школы похожи сильнее, чем два ребёнка из разных школ. При ρ, равном нулю, школа не значит ничего. При ρ, равном единице, дети внутри школы неразличимы, и вся школа стоит одного наблюдения.

Отсюда получается цена группового распределения. Пусть в исследовании J групп по n человек в каждой. Сравним такое распределение с распределением между людьми поодиночке при том же их числе. Стандартная ошибка вырастает в D раз: D = √(1 + (n − 1)·ρ). Величину D называют эффектом дизайна, и в пособии она выведена уравнениями (11) и (12) со ссылкой на работу Блума 2005 года.

Пример авторы приводят подчёркнуто скромный. При группе в пятьдесят человек и ρ = 0,06 стандартная ошибка вырастает более чем вдвое. Проверим арифметику: 1 + 49 × 0,06 = 3,94, а корень из 3,94 равен 1,98. Шесть сотых выглядят мелочью, и платить за них приходится удвоением ошибки.

Теперь понятна и тысяча детей. Двадцать пять школ по сорок человек при ρ = 0,3 дают D = √(1 + 39 × 0,3) = √12,7 ≈ 3,6. Точность падает в 3,6 раза, а эквивалентное число независимых наблюдений падает в 3,6 в квадрате, то есть в 12,7 раза. Тысяча, делённая на 12,7, и даёт примерно восемьдесят.

Во сколько раз растёт стандартная ошибка1234511121314150n: человек в одной группе1,98 при n = 50ρ = 0,5ρ = 0,23ρ = 0,06D
Эффект дизайна D = √(1 + (n − 1)·ρ): во сколько раз стандартная ошибка при распределении группами больше, чем при распределении людьми поодиночке при том же их числе. Три кривые, три значения внутриклассовой корреляции: 0,06 (пример авторов пособия), 0,23 (Удайпур, баллы по математике и языку) и 0,5 (Мадагаскар, там же). Кривые считаны по формуле, а не измерены

Откуда берут ро

Значение ρ не выдумывают: его берут из прошлых обследований того же рода. В методическом пособии напечатана таблица восьми таких значений, все по баллам школьных тестов, из пяти источников. Мадагаскар, математика и язык вместе: 0,5. Округ Бусиа в западной Кении: 0,22 по математике и языку, 0,62 по одной математике, 0,43 по языку, 0,35 по естествознанию. Удайпур в Индии даёт 0,23, Мумбаи 0,29, Вадодара 0,28.

Комментарий авторов к таблице короткий. Для баллов тестов внутриклассовая корреляция высока и лежит между 0,2 и 0,6. В других приложениях она часто меньше. Из таблицы видно и то, о чём в комментарии не сказано: у одного и того же округа по разным предметам ρ различается почти втрое.

Значит, это свойство не места и не исхода по отдельности, а пары «место и исход». Отсюда единственный практический вывод. Расчёт до испытания требует величины, которую негде взять, кроме чужой прошлой работы. Работа эта должна быть про похожих людей и про похожий исход. Ошибка в ρ переходит прямо в расчёт нужного числа групп, поэтому значение, заимствованное из другой страны, идёт с оговоркой, а не как данность.

на заметку0,22 и 0,62 в одном округе

Обе величины сняты в округе Бусиа и обе стоят в одной таблице. Первая взята по баллам математики и языка вместе, вторая по одной математике. Различие почти втрое означает, что от выбора исхода зависит цена группового распределения: при ρ = 0,22 и сорока учениках в школе эффект дизайна равен 3,1, при ρ = 0,62 равен 5,0. Одно и то же испытание в одних и тех же школах различит эффект по одному предмету заметно хуже, чем по другому, и учесть это надо до начала, а не после.

Считают школы, а не детей

Из той же формулы выходит правило, которым в поле пользуются каждый день. Минимально обнаружимый эффект (та величина, которую испытание способно отличить от нуля) задаётся числом групп J. Зависимость эта не прямая: порог идёт как единица, делённая на корень из J. Чтобы уменьшить его вдвое, групп нужно вчетверо больше. А от числа людей внутри группы порог зависит гораздо слабее, и тем слабее, чем больше ρ. Само пособие говорит об этом небрежнее, «меняется примерно пропорционально числу групп», но J стоит в его формуле под корнем.

Объяснение авторов держится на одной фразе. Когда исходы внутри группы связаны, данные ещё одного человека в уже охваченной группе несут меньше сведений, чем данные первого человека в новой группе. Второй ребёнок из той же школы отчасти повторяет первого. Ребёнок из новой школы не повторяет никого.

Отсюда практика, которая со стороны выглядит странно. Испытание охотнее возьмёт сто деревень по двадцать человек, чем двадцать деревень по сто, хотя людей и там и там две тысячи. И потому в описании работы поля первым делом ищут не число опрошенных, а число единиц распределения.

На живой работе это выглядит так. Испытание найма учителей в Кении: 192 государственные начальные школы, по 24 из каждой из восьми провинций, четырнадцать округов. 64 школы составили контроль, ещё 128 разложили по двум другим ветвям. Шло всё с июня 2010 по октябрь 2011 года, а исходом были баллы тестов учеников. Авторы сами называют свои числа: внутриклассовая корреляция в итоговых тестах 0,33, связь входного балла с итоговым 0,43.

При таких величинах минимально обнаружимый эффект на одну ветвь составил около 0,26 стандартного отклонения. Полученные оценки оказались меньше этого порога, и авторы пишут прямо: для эффектов такой величины схема недостаточно мощна. Что именно там сравнивали и что из этого следует об исполнителе программы, разбирает пятнадцатый урок. Здесь важно одно: порог обнаружения задан числом школ и величиной ρ, а не числом опрошенных детей.

об исследованииДокумент, из которого взяты формулы

«Toolkit» Эстер Дюфло, Рэйчел Гленнерстер и Майкла Кремера по жанру методическое пособие поля, а не исследование людей: собственных измерений в нём нет. Читан полный текст рабочего документа NBER 2006 года. Опубликованная версия вышла главой в Handbook of Development Economics в 2007 году. Формулы внутриклассовой корреляции и эффекта дизайна стоят в разделе 4.2 уравнениями (11) и (12), и авторы прямо указывают, что следуют здесь работе Блума 2005 года. Таблица реальных значений ρ стоит там же, а разбор малого числа кластеров вынесен в раздел 7.1.

Что ломается, если про кластер забыть

Забыть про кластер легко: данные лежат по людям, и программа посчитает ошибку по людям, если её не попросить об обратном. Что при этом происходит, померили на данных, где правильный ответ известен заранее. Приём такой. Берут настоящие сведения о заработках из большого американского обследования. И придумывают закон, которого не было: будто в случайно выбранных штатах в случайно выбранный год что-то изменилось.

Истинный эффект такого закона равен нулю по построению. Дальше считают ровно так, как считают обычно, и смотрят, сколько раз нуль отвергается. На микроданных обследования без всякой поправки на групповую структуру нуль отвергался в 67,5 % случаев при объявленных пяти процентах. Авторы называют это превышением в тринадцать раз. Есть у них и другая постановка, на двадцати годах данных. Там придуманный закон получал значимый «эффект» вплоть до 45 % случаев.

И тут же вторая половина результата, которую пересказы теряют. Средняя оценка коэффициента в тех же прогонах была нулевой. Авторы пишут это дословно и добавляют, что оценки остаются несмещёнными. То есть само число не сдвинулось никуда. Сдвинулась оценка его надёжности: забытый кластер отнимает право сказать «значимо», а величину оставляет на месте.

Что это не умозрительная опасность, видно по систематическим обзорам. Кокрейновский обзор массовой дегельминтизации 2007 года разбирал качество включённых испытаний. Записано там вот что. У четырёх сокрытие распределения было достаточным, а три кластерных испытания не учли эффект дизайна в своём анализе. Три работы это доля, а не единичный недосмотр.

ловушка«Значимо» и «правильно измерено» означают разные вещи

Соблазн читать эти 67,5 % как «данные подделаны» или «оценки завышены» велик, и обе догадки неверны. Средняя оценка в тех же прогонах была нулевой: величина эффекта не поехала никуда. Поехало число, которым эту величину сопровождают, то есть стандартная ошибка, а вместе с ней и значимость. Лечится это счётом: поправкой на групповую структуру. Проверить чужую работу можно одним вопросом: по каким единицам считалась ошибка и совпадают ли они с единицами распределения.

Когда кластеров мало

Поправка на кластер существует и применяется, и называется она кластерно-робастной стандартной ошибкой. У неё есть своё условие годности, и оно про число групп, а не про число людей. В методическом пособии записано так. При числе кластеров меньше пятидесяти кластерно-корректированная оценка Хубера-Уайта работает плохо: она слишком часто отвергает нуль об отсутствии эффекта. Ссылается пособие на ту же симуляцию 2004 года.

Направление ошибки стоит заметить отдельно. Она делает результат более убедительным, а не более осторожным. То есть при малом числе групп сама поправка, поставленная ради честности, начинает работать в ту же сторону, что и её отсутствие.

Что делают вместо неё, написано там же. Рандомизационный вывод: группы многократно перераспределяют между лечением и контролем понарошку, каждый раз считают оценку и смотрят, попадает ли настоящая в хвост полученного распределения. Достоинство названо прямо: процедура годна при любом размере выборки. Недостаток назван там же. При большом истинном эффекте мощность у неё ниже, чем у более параметрических подходов: она не накладывает на ошибку даже минимальной структуры.

Пример из того же пособия: испытание передачи управления медицинскими центрами в Камбодже, где распределяли районы и районов было двенадцать. Двенадцать единиц остаются двенадцатью наблюдениями, сколько бы человек в них ни жило.

А вот правила «нужно не меньше сорока двух кластеров» в проверенных первоисточниках нет. Единственной числовой опорой служит та самая фраза про «меньше пятидесяти работает плохо», и это утверждение о поведении оценки, а не порог достаточности. Практическое руководство по кластерно-робастному выводу существует и признано. Но полного текста его при сборке курса добыть не удалось, и ни одного порога отсюда в урок не взято.

Тренажёр: эффект дизайна своими руками

К уроку приложен тренажёр klaster. Ручек в нём три: число групп J, размер группы n и значение ρ. Последнее ставится ползунком либо выбирается строкой из таблицы методического пособия. Во втором случае рядом с числом встаёт его паспорт: место, предмет и работа, из которой значение взято.

Экран считает эффект дизайна D = √(1 + (n − 1)·ρ), его квадрат и эквивалентное число независимых наблюдений. Там же посчитан потолок глубины: сколько бы людей ни добавляли в те же J групп, эквивалентное число не перейдёт за J / ρ. И держит экран две проверки, посчитанные при тех же настройках. Первая сверяется с авторской фразой про пятьдесят человек в группе при ρ = 0,06, где ошибка растёт более чем вдвое, вторая с тысячей детей в двадцати пяти школах, которая сходится к восьмидесяти независимым человекам.

Числа в тренажёре двух родов, и на экране они разведены. Значение ρ, выбранное строкой таблицы, идёт со своим паспортом. Поставленное ползунком помечено учебным тут же, рядом с ползунком. Числа J и n читатель ставит сам, и над ползунками стоит пометка: значения учебные, и это не расчёт размера выборки для настоящего исследования.

Крутить стоит вот что. Нажмите кнопку «Закрепить общее число людей и переливать его» и переливайте их между числом групп и глубиной группы. Видно будет, что перекладывание людей из новых групп в уже охваченные точность съедает, а обратное движение её возвращает. Тренажёр никого не оценивает, ничего не советует и вердиктов не выдаёт: он считает формулу и показывает, что из неё следует.

Чего отсюда не следует

Из сказанного не следует, что кластерные испытания хуже обычных. Единицу распределения выбирают не из любви к арифметике: соседи влияют друг на друга, приезд стоит денег, а отказ половине деревни ссорит организацию с деревней. Эффект дизайна не дефект, а объявленная заранее цена этого выбора.

Не следует и того, что оценкам из кластерных работ верить нельзя. Ломается там значимость, а не сама оценка, и лечится это счётом, а не недоверием: поправкой на кластер, а при малом числе групп рандомизационным выводом. Больше того, про избыточное отвержение нуля написали не критики метода со стороны. Написали трое экономистов, двое из которых сами ставят полевые испытания. И напечатали это в ведущем журнале своей же дисциплины.

Что действительно следует: два вопроса к любому описанию испытания. Что было единицей распределения и сколько таких единиц было. Без этих двух ответов число опрошенных не говорит о точности почти ничего, а выносят в заголовок именно его.

здесь кончается измерениеЗдесь кончается измерение

В Кении мерили баллы тестов у учеников 192 государственных начальных школ восьми провинций с июня 2010 по октябрь 2011 года, и этих школ хватило на то, чтобы различать эффект примерно от четверти стандартного отклонения. Из расчёта мощности не следует, сколько школ или деревень взять в испытание: расчёт говорит, что прибор различит, и молчит о том, чего стоит каждая добавленная школа, откуда взять на неё деньги и кто останется без программы, пока её проверяют. Взвешивают это те, кто платит за испытание и отвечает за школы, в которых оно идёт. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.

Что дальше

Урок оставил в руках арифметику потери. Тысяча человек в двадцати пяти группах не тысяча наблюдений. Во сколько раз не тысяча, считается по двум числам: размеру группы и внутриклассовой корреляции. Отсюда и привычка поля называть число единиц распределения раньше числа опрошенных.

Дальше та же арифметика превращается в вопрос к готовому результату. Если прибор слаб, то новости «эффекта не нашли» и «эффекта нет» разные, а различает их не интонация, а ширина интервала. Следующий урок берёт два нуля из одного испытания: один измерен точно, другой не измерен вовсе.

тренажёр урока 5

Сколько человек в одной деревне

Эффект дизайна D = √(1 + (n − 1)·ρ) и эквивалентное число независимых наблюдений. Значение ρ выбирается строкой из таблицы методического пособия (тогда рядом встаёт паспорт) или ставится ползунком, и тогда оно учебное. Число групп и размер группы ставите вы. Это учебная арифметика формулы, а не расчёт размера выборки.

Открыть тренажёр

Ключевые работы

Duflo E, Glennerster R, Kremer M, «Using Randomization in Development Economics Research: A Toolkit», рабочий документ NBER2006Методическое пособие поля, а не отдельная работа: измерений на людях в нём нет. Читан полный текст рабочего документа. Опубликованная версия вышла главой в Handbook of Development Economics 2007 года. Отсюда взяты три довода за групповое распределение, формула внутриклассовой корреляции и эффект дизайна D = √(1 + (n − 1)·ρ) из уравнений (11) и (12) со ссылкой на Блума, авторский пример про группу в пятьдесят человек при ρ = 0,06, таблица восьми реальных значений ρ по баллам тестов и разбор малого числа кластеров с рандомизационным выводом и камбоджийским испытанием на двенадцати районах.
Bertrand M, Duflo E, Mullainathan S, симуляции на придуманных законах, Quarterly Journal of Economics2004Численный опыт, а не измерение на людях: на настоящих сведениях о заработках из большого американского обследования разыгрывался закон, которого не было, то есть эффект, заведомо равный нулю. Без поправки на групповую структуру нуль отвергался в 67,5 % случаев при объявленных пяти, что авторы называют превышением в тринадцать раз. На двадцати годах данных придуманный закон получал значимый «эффект» вплоть до 45 % случаев. При этом средняя оценка коэффициента была нулевой, и авторы отдельно подчёркивают, что оценки остаются несмещёнными. Числа выписаны из полного текста рабочего документа NBER 8841 марта 2002 года.
Bold T, Kimenyi M, Mwabu G, Ng'ang'a A, Sandefur J, Journal of Public Economics2018Кластерное рандомизированное испытание, встроенное в общенациональную реформу найма учителей в Кении: 192 государственные начальные школы, по 24 из каждой из восьми провинций, четырнадцать округов, 64 школы контроля и по 64 в двух других ветвях, с июня 2010 по октябрь 2011 года. Исходом были баллы тестов учеников. Отсюда взяты собственные оценки авторов: внутриклассовая корреляция в итоговых тестах 0,33, связь входного балла с итоговым 0,43 и минимально обнаружимый эффект на одну ветвь около 0,26 стандартного отклонения, при котором схема, по их же словам, недостаточно мощна. Числа из авторской рабочей версии ноября 2016 года. Журнальная версия закрыта и при сборке курса не сверялась.
Taylor-Robinson DC и др., кокрейновский обзор массовой дегельминтизации 2007 года, Cochrane Database of Systematic Reviews2007Систематический обзор, а не отдельная работа. Взята одна строка из его разбора качества включённых испытаний: у четырёх из них сокрытие распределения было достаточным, а три кластерных испытания не учли эффект дизайна в своём анализе. Это документальное подтверждение того, что про кластер действительно забывают, и оно напечатано внутри медицинской литературы о том же вмешательстве. Числа самого обзора и спор вокруг его более поздней редакции разбирает одиннадцатый урок.
Cameron AC, Miller DL, практическое руководство по кластерно-робастному выводу, Journal of Human Resources2015Не измерение, а методическое руководство: разбор того, как считать стандартную ошибку при групповой структуре данных и что делать при малом числе кластеров. Существование и место публикации подтверждены, работа признана в поле и цитируется как раз там, где спрашивают про необходимое число кластеров. Полного текста при сборке курса добыть не удалось, поэтому ни одного порога отсюда в урок не взято, и это сказано в уроке прямо, вместо того чтобы приводить ходовое правило «сорока двух кластеров» без источника.

Что подтвердилось, а что нет

выдержалоКластерная рандомизация режет мощность испытания, и режет сильно.

Величина потери названа формулой и подтверждена на живых работах. Эффект дизайна D = √(1 + (n − 1)·ρ) показывает, во сколько раз растёт стандартная ошибка при распределении группами: при пятидесяти человек в группе и ρ = 0,06 она вырастает более чем вдвое (1,98), при сорока и ρ = 0,3 вырастает в 3,6 раза, а эквивалентное число независимых наблюдений падает в 12,7 раза. Для баллов школьных тестов ρ в таблице методического пособия лежит между 0,22 и 0,62 по пяти источникам, то есть высокие значения тут не редкость. На живой работе: в кенийском испытании найма учителей при 192 школах, ρ = 0,33 в итоговых тестах и связи входного балла с итоговым 0,43 минимально обнаружимый эффект на одну ветвь составил около 0,26 стандартного отклонения за шестнадцать месяцев наблюдения, и авторы называют схему недостаточно мощной для найденных величин.

мифОценка эффекта смещается, если забыть про кластер.

Смещается не оценка, а представление о её надёжности. В симуляции 2004 года на микроданных большого американского обследования разыгрывали закон, которого не было, то есть заведомо нулевой эффект. Без поправки на групповую структуру нуль отвергался в 67,5 % случаев при объявленных пяти процентах, то есть в тринадцать раз чаще положенного. При этом средняя оценка коэффициента в тех же прогонах была нулевой: авторы пишут это дословно и отдельно подчёркивают, что оценки остаются несмещёнными. Забытый кластер отнимает право сказать «значимо», а само число оставляет на месте.

выдержалоКластерно-робастная стандартная ошибка при малом числе кластеров отвергает нуль слишком часто.

Так записано в методическом пособии поля со ссылкой на ту же симуляцию: кластерно-робастная стандартная ошибка (она же кластерно-корректированная оценка Хубера-Уайта) при числе кластеров меньше пятидесяти работает плохо и приводит к избыточному отвержению нуля об отсутствии эффекта. Направление ошибки важно: она делает результат более убедительным, а не более осторожным. Замена названа там же: рандомизационный вывод, который годится при любом размере выборки, но проигрывает в мощности при большом истинном эффекте, потому что не накладывает на ошибку даже минимальной структуры. Пример из того же пособия: испытание передачи управления медицинскими центрами в Камбодже, где единицами распределения были районы, а районов было двенадцать.

источника нетКластерному испытанию нужно не меньше сорока двух кластеров.

Правило ходит в двух видах («не меньше сорока двух» и «не меньше пятидесяти»), и как правило не сформулировано в проверенных первоисточниках ни то ни другое. Единственная числовая опора, которая нашлась: в методическом пособии сказано, что при числе кластеров меньше пятидесяти кластерно-робастная оценка работает плохо. Это утверждение о поведении оценки, а не порог достаточности, и числа «сорок два» в нём нет вовсе. Практическое руководство по кластерно-робастному выводу, на которое обычно ссылаются, существует и признано, но полного текста при сборке курса добыть не удалось, и ни одного порога отсюда не взято. Это не «проверили и не подтвердилось»: проверять было нечего.

Термины

кластерcluster
Группа людей, которую распределяют между вмешательством и контролем целиком: школа, деревня, квартал, клиника, класс. Единица распределения при этом перестаёт совпадать с единицей наблюдения, и число единиц распределения оказывается для точности важнее числа опрошенных.
внутриклассовая корреляцияintraclass correlation, ρ
Доля разброса исхода, приходящаяся на различия между группами, а не внутри них: ρ = τ² / (τ² + σ²). Это мера того, насколько двое из одной группы похожи сильнее, чем двое из разных. Величина принадлежит не месту и не исходу по отдельности, а их паре: в одном округе по разным школьным предметам она различается почти втрое.
эффект дизайнаdesign effect
Множитель, во сколько раз стандартная ошибка при групповом распределении больше, чем была бы при распределении людей поодиночке при том же их числе: D = √(1 + (n − 1)·ρ), где n означает размер группы. Растёт с размером группы и с внутриклассовой корреляцией. При ρ = 0 равен единице.
эквивалентное число независимых наблюденийeffective sample size
Сколько независимых наблюдений дало бы ту же точность, что имеющаяся выборка с групповой структурой. Считается делением числа наблюдений на квадрат эффекта дизайна. Тысяча детей в двадцати пяти школах при ρ = 0,3 даёт примерно восемьдесят.
минимально обнаружимый эффектminimum detectable effect
Наименьшая величина эффекта, которую испытание способно отличить от нуля при заданных вероятностях ошибиться в обе стороны. Считается до начала работы. Про эффекты мельче этой величины испытание молчит, и молчание его говорит о приборе, а не об их отсутствии.
кластерно-робастная стандартная ошибкаcluster-robust standard error
Способ посчитать ошибку оценки так, чтобы связь наблюдений внутри группы была учтена. При малом числе групп (меньше пятидесяти) работает плохо и отвергает нуль чаще положенного, то есть ошибается в сторону излишней убедительности результата.
избыточное отвержение нуляover-rejection
Положение, при котором гипотеза об отсутствии эффекта отвергается чаще, чем обещает объявленный уровень значимости. Меряется прямо: разыгрывают заведомо нулевой эффект и считают долю отвержений. В проверке 2004 года она составила 67,5 % при объявленных пяти.
рандомизационный выводrandomization inference
Способ получить значимость без опоры на предположения о распределении ошибки: группы многократно перераспределяют между лечением и контролем понарошку и смотрят, попадает ли настоящая оценка в хвост полученного распределения. Годится при любом размере выборки, но при большом истинном эффекте уступает в мощности параметрическим подходам.

Практикум · Посчитать эффект дизайна для одной чужой работы

Полчаса и одна работа с кластерной рандомизацией: испытание в школах, деревнях, клиниках или классах. Считать придётся один корень, всё остальное сводится к поиску четырёх чисел, которые в тексте обычно разнесены по разным разделам.

  1. Найдите в описании единицу распределения и запишите её словом: школа, деревня, квартал, клиника. Если в тексте сказано просто «случайно распределили участников», проверьте это по разделу о процедуре: распределяли людей или группы.
  2. Выпишите число единиц распределения и среднее число наблюдений в одной единице. Второе часто приходится считать самому: делением общего числа опрошенных на число единиц.
  3. Найдите, названо ли в работе значение внутриклассовой корреляции. Если названо, выпишите вместе с ним, из какого прошлого обследования оно взято. Если не названо, посчитайте дальше дважды: при 0,2 и при 0,5.
  4. Посчитайте эффект дизайна по формуле и эквивалентное число независимых наблюдений (общее число опрошенных, делённое на квадрат эффекта дизайна). Сравните получившееся с тем числом, которое вынесено в аннотацию работы.
  5. Проверьте, сказано ли, как считалась стандартная ошибка. Если единиц распределения меньше пятидесяти, а про способ счёта ошибки не сказано ничего, запишите это отдельной находкой: именно там поправка ошибается в сторону излишней убедительности.

Вопросы для самопроверки

Вопрос 1

В испытании 25 школ по 40 учеников, внутриклассовая корреляция по баллам тестов составляет 0,3. Что об этом исследовании говорит эффект дизайна?

  • Стандартная ошибка примерно в 3,6 раза больше, чем была бы у тысячи независимых человек, и тысяча детей стоит примерно восьмидесяти
  • Оценка эффекта завышена примерно в 3,6 раза, и перед сравнением с другими работами её надо разделить на эту же величину, а ошибку оставить как есть
  • Тридцать процентов разброса баллов приходится на различия между детьми, поэтому точность падает примерно на треть
  • Испытание способно обнаружить только эффект от 3,6 стандартного отклонения и крупнее, а всё, что меньше этой величины, для него неразличимо
Вопрос 2

В работе распределяли деревни, а стандартную ошибку посчитали по отдельным людям. Что от этого испортилось?

  • Точечная оценка эффекта: она выросла примерно во столько же раз, во сколько занижена ошибка
  • Только значимость: сама оценка остаётся несмещённой, а нуль отвергается чаще положенного
  • И оценка, и значимость, потому что групповая структура смещает обе половины результата сразу
  • Ничего существенного, если людей в выборке много: при большой выборке групповая структура на ошибку почти не влияет
Вопрос 3

Бюджет позволяет опросить две тысячи человек. Почему в поле предпочтут сто деревень по двадцать человек, а не двадцать деревень по сто?

  • Потому что в маленькой выборке из одной деревни бывает меньше отсева и меньше пропусков в ответах, а данные выходят полнее и чище
  • Потому что при ста деревнях внутриклассовая корреляция становится меньше, чем при двадцати
  • Потому что минимально обнаружимый эффект падает с числом групп, а от глубины группы зависит слабо
  • Потому что при ста деревнях кластерную поправку можно не делать: она нужна только при малом числе групп
Вопрос 4

В испытании распределяли районы, и районов было двенадцать. Что об этом положении сказано в методическом пособии поля?

  • Что двенадцати районов достаточно, если в каждом опрошено больше тысячи человек
  • Что кластерно-робастная ошибка при числе групп меньше пятидесяти работает плохо и отвергает нуль слишком часто
  • Что при числе групп меньше пятидесяти кластерная поправка становится излишне осторожной
  • Что порог достаточности назван прямо: сорок два кластера, и ниже него испытание планировать не берутся
Вопрос 5

Читатель узнал, что кластерная рандомизация режет мощность. Какой вывод отсюда сделать нельзя?

  • Число единиц распределения такое же обязательное сведение о работе, как число опрошенных
  • Значение внутриклассовой корреляции берут из чужой прошлой работы, и оговорка о ней обязательна
  • Кластерным испытаниям верить не стоит: их результаты систематически завышены по сравнению с обычными
  • Групповое распределение выбирают не из удобства, и эффект дизайна означает объявленную заранее цену этого выбора

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Duflo E., Glennerster R., Kremer M. «Using Randomization in Development Economics Research: A Toolkit». NBER Technical Working Paper 333, 2006: Рабочий документ открыт. Опубликованная версия вышла главой в Handbook of Development Economics 2007 года. Для этого урока нужны три места: раздел 5.1 с доводами за групповое распределение, раздел 4.2 с уравнениями (11) и (12) и таблицей реальных значений ρ, и раздел 7.1 про малое число кластеров. Главная фраза раздела 4.2 лежит не в формулах, а в комментарии к ним: данные ещё одного человека в уже охваченной группе несут меньше сведений, чем данные первого человека в новой.
  • Bertrand M., Duflo E., Mullainathan S. «How Much Should We Trust Differences-In-Differences Estimates?». Quarterly Journal of Economics, 2004, 119(1):249-275, рабочий документ NBER 8841, 2002: Журнальная версия закрыта, рабочий документ открыт, числа курса взяты из него. Читать стоит не аннотацию, а раздел с микроданными обследования: там стоят 67,5 % отвержений при объявленных пяти процентах и фраза о превышении в тринадцать раз. И отдельно стоит читать строку о том, что средняя оценка коэффициента была нулевой: без неё результат читают наоборот.
  • Bold T., Kimenyi M., Mwabu G., Ng'ang'a A., Sandefur J. «Experimental evidence on scaling up education reforms in Kenya». Journal of Public Economics, 2018, 168:1-20: Журнальная версия закрыта, открыта авторская рабочая версия ноября 2016 года, и числа курса взяты из неё. Для этого урока полезен один абзац, где авторы называют собственную внутриклассовую корреляцию 0,33, связь входного балла с итоговым 0,43 и минимально обнаружимый эффект около 0,26 стандартного отклонения на ветвь. Работ, где такой расчёт напечатан прямо, немного.
  • Taylor-Robinson D.C. и соавт. «Deworming drugs for treating soil-transmitted intestinal worms in children». Cochrane Database of Systematic Reviews, 2007, CD000371 (PMID 17943740): Аннотация открыта. Для этого урока нужен не вывод обзора, а его раздел о качестве включённых испытаний: там записано, что три кластерных испытания не учли эффект дизайна в своём анализе. Это редкий случай, когда методическая ошибка целого класса работ посчитана и напечатана поимённо.
  • Cameron A.C., Miller D.L. «A Practitioner's Guide to Cluster-Robust Inference». Journal of Human Resources, 2015, 50(2):317-372: Полный текст закрыт, и при сборке курса добыть его не удалось, поэтому ни одного порога числа кластеров в уроке отсюда нет. Названо это здесь именно как сведение о точности: руководство существует, признано и цитируется как раз там, где спрашивают, сколько кластеров нужно. Ходовое правило «сорока двух» ссылается обычно не на него, а ни на что.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Борьба с бедностью»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?