Масштабирование программ: почему пилот врёт
Десять повторений на полумиллионе домохозяйств не предсказали даже направления отбора, а программа при масштабе выглядела здоровой по своей же отчётности
Масштабирование социальных программ ставит другой вопрос, чем перенос в другое место, и пилот на оба отвечает плохо. По первым десяти площадкам американской программы энергосбережения предсказание завысило эффект следующих 101 площадки на 0,5 процентного пункта при среднем 1,31 %: первыми соглашаются те, у кого эффект больше. В Бангладеш пилот миграционных займов давал 25-40 пунктов, а при развёртывании на 140 тысяч домохозяйств вышло 4 и 12 пунктов. Масштаб при этом дважды дал прибавку, в Кении и в Индии.
Allcott 2015, Quarterly Journal of Economics · DellaVigna, Linos 2022, Econometrica · Bryan, Chowdhury, Mobarak 2014 · Vivalt 2020 · 29 мин · обновлено 01.10.2026
После урока вы сможете
- Отличать перенос результата в другое место от развёртывания программы в том же месте
- Называть, что именно измерил разбор 111 испытаний: не разброс между площадками, а отбор первых
- Читать разрыв между журналом и практикой как измеренную величину с названной причиной
- Называть два случая, где масштаб дал прибавку, и один, где он съел величину пилота
- Проверять программу при масштабе контрольной группой, а не собственной отчётностью исполнителя
Американские электрические компании рассылали клиентам письма. В письме расход электричества домохозяйства сравнивался с расходом соседей. Приём проверяли рандомизированными испытаниями снова и снова. К февралю 2013 года их набралось 111: 8,6 миллиона домохозяйств у 58 компаний по всей стране.
Микроданные были доступны по первым десяти площадкам: 508 тысяч домохозяйств. Почва для переноса тут исключительно благоприятная, и разбиравший её экономист пишет это сам. Десять повторений по стране, большие выборки, набор признаков по каждому домохозяйству. По этим микроданным он предсказал общенациональный эффект: экономия около 1,7 % и 2,3 миллиарда долларов розничной цены электричества в первый год.
Потом он проверил своё предсказание на следующей сотне площадок. Микроданные первых десяти завысили эффективность следующих 101 примерно на 0,5 процентного пункта. В деньгах это 690 миллионов долларов розничной цены. Средний эффект по всем испытаниям составил 1,31 %, а каждая из первых одиннадцати площадок дала 1,34 % или больше.
Восьмой модуль начинается здесь. Урок разбирает два вопроса, которые в пересказах слипаются. Перенос: то же самое в другом месте. Масштаб: то же место, но программа развёрнута целиком. Ответы на эти вопросы разные, и знаки у ответов тоже разные.
Отбор мест, измеренный
Отбор мест обычно постулируют, а здесь его измерили. Тем этот случай и ценен. Что мерили: снижение потребления электроэнергии, выраженное и в киловатт-часах в сутки, и в процентах от потребления контрольной группы. На ком: домохозяйства-клиенты 58 компаний, все испытания, запущенные до февраля 2013 года. Сколько длилось: у каждой площадки считался эффект первого года.
Механизмы отбора автор называет поимённо, и их три. Первый работает внутри компании: письма сначала шлют домохозяйствам с высоким потреблением, которые отзывчивее. Потом программу расширяют, и эффективность падает. Второй работает между компаниями: программу раньше принимают компании в более богатых и более «экологичных» зонах, чьи клиенты тоже отзывчивее. Третий связан с формой собственности: частные инвесторские компании подключались позже и дают меньший эффект.
Что мешает перенести это число, надо назвать сразу. Соединённые Штаты, розничная электроэнергия, бумажные письма, 2008-2013 годы. Это не испытание борьбы с бедностью и не программа помощи. Переносится отсюда механизм («те, кто соглашается первым, отобраны по величине эффекта»), а не величина в 0,5 процентного пункта.
Опубликованная версия вышла в Quarterly Journal of Economics в 2015 году, и её полного текста в базе курса нет. Числа урока взяты из рабочего документа NBER 18373, прочитанного целиком. Расхождения между версиями возможны, и на этом курсе они встречались уже не раз. Из аннотации опубликованной версии дословно подтверждаются 111 испытаний, 8,6 миллиона домохозяйств и сама формулировка: предсказания по богатым микроданным первых десяти повторений существенно завышают эффективность следующих 101 площадки. Стандартной ошибки или интервала к величине завышения в добытой части базы нет, и вторую половину результата здесь взять неоткуда.
Повторение не лечит отбор
Расхожее лекарство от того, что результат не переносится: повторить испытание побольше раз. Здесь его проверили в самых благоприятных условиях, какие бывают. Десять повторений, полмиллиона домохозяйств, признаки по каждому, и предсказание всё равно вышло смещённым. Автор пишет прямо: оценки программ дают систематически смещённые предсказания вне выборки даже после многих повторений.
Причина в том, что повторения не были случайной выборкой из мест. Область, покрытая признаками первых десяти площадок, называется носителем признаков. Внутри неё предсказание опирается на наблюдения, а за её краем на продолжение модели. Шестьдесят одна поздняя площадка из 101 лежит вне этого носителя. И самая едкая строка разбора: данные первых десяти «не предсказывают даже направления отбора площадок».
К уроку приложен тренажёр perenos. Читатель сам выбирает, сколько первых площадок брать в обучение: от одной до десяти. И выбирает, как строить прогноз: простым средним или с поправкой на признаки площадки. Третья ручка переключает единицы: проценты потребления контроля или доллары розничной цены. В деньгах половина слотов гаснет прочерком, и тренажёр говорит почему. Экран показывает его прогноз на следующие 101 площадку, величину завышения и то, что там вышло на самом деле, а точнее, то, что об этом печатает работа. Уровня по поздней сотне в ней нет: напечатана только разность. Поэтому в третьем слоте стоит подписанный прочерк, а не выведенное число, и тренажёр говорит, чего именно не хватает. Прогноз простым средним по той же причине даётся границей «не ниже», а не точкой: значений по отдельным площадкам работа тоже не печатает.
Числа в тренажёре только из работы, а её паспорт стоит на том же экране, отдельным блоком. Это те же 111 испытаний и 508 тысяч домохозяйств в первых десяти, средний эффект 1,31 %, стандартное отклонение между площадками 0,45 процентного пункта, 61 поздняя площадка из 101 вне носителя. Учебных чисел в тренажёре нет вовсе. Читателя он не считает и вердиктов не выдаёт. На экране стоят авторская строка про направление отбора и надпись о том, что это программа энергосбережения в США, где переносится механизм, а не число.
Почему в журнале больше, чем в жизни
Второй измеренный случай касается другого отбора, публикационного. Сравнили две совокупности испытаний одного и того же приёма: письма и сообщения, подталкивающие людей к действию. Первая совокупность объединяет все испытания двух крупнейших американских ведомственных групп, то есть без возможности выборочной публикации. Вторая состоит из опубликованных в академических журналах испытаний того же рода из двух недавних мета-анализов.
Объём: 126 рандомизированных испытаний с охватом больше 23 миллионов человек. Исход: доля откликнувшихся, в процентных пунктах. В журнальных статьях средний эффект 8,7 п. п., то есть 33,5 % сверх среднего по контролю. В испытаниях ведомственных групп он тоже заметный и статистически надёжный, но меньше: 1,4 п. п., или 8,1 %. По сводке опубликованной аннотации те же две величины даны как 33,4 % и 8,0 %, а числа урока взяты из рабочей версии.
Разрыв авторы не оставили констатацией, а объяснили. Контроль на статистическую мощность объясняет всю разницу целиком. Хорошо обеспеченные мощностью журнальные испытания дают около одного процентного пункта, как и у ведомств. Мета-анализ с поправкой на выборочную публикацию даёт для журнальной выборки 3,2 п. п. при стандартной ошибке 1,9 против 8,6 без поправки.
Шестой урок дал общую оценку по эмпирической экономике: медианная мощность там 18 % или ниже. Здесь тот же механизм измерен на одном предмете и с названной величиной. И одна находка, без которой раздел был бы нечестным. Выборочную публикацию авторы нашли и внутри самих ведомственных групп: до академических статей там довели 16 испытаний, и значимые среди них представлены непропорционально. Смещение там мало: мощность выше, а разброс истинных эффектов меньше.
Из пары «8,7 против 1,4» напрашивается вывод, что академические исследователи работают тщательнее, а ведомства хуже. Он проверен и не подтвердился: участие академических исследователей разницы не объясняет. Объясняет её другое, и это посчитано. Контроль на мощность вмешательства снимает разницу целиком, а поправка на выборочную публикацию опускает журнальную оценку с 8,6 до 3,2 п. п. при стандартной ошибке 1,9. Проверяется одним движением: спросить, какова была мощность у испытания, а не кто его ставил.
Перенос и масштаб: разные вопросы
До сих пор речь шла о переносе: то же вмешательство, другое место. Масштаб задаёт другой вопрос: то же место, но программа развёрнута целиком. Здесь ломается не выборка, а предположение об отсутствии взаимного влияния. Ломается оно по логике, а не по недосмотру.
Всякое испытание, меняющее то, что люди покупают или предлагают, обязано затронуть и других. Новый спрос надо чем-то удовлетворить, а новое предложение куда-то деть. Критики метода приводят такой пример. Пусть испытание показало, что новый способ внесения удобрений поднимает урожай какао и доходы участников. Разверните его на всю страну, и цена упадёт: при неэластичном спросе доходы производителей какао снизятся.
Знак эффекта при масштабе окажется противоположным знаку эффекта в испытании. Само испытание при этом считало правильно. Тезис не новый, и критики сами это пишут. По их же ссылкам он отмечен в экономической литературе с начала девяностых и признан в обзоре практиков метода 2009 года. Там же названа работа, где проблему решили прямо в устройстве испытания.
Третий урок посчитал, каков в этом поле типичный масштаб. Медианная оценка программы была представительна для популяции около 10 900 единиц, а кластер рандомизации медианно составлял 26 единиц. При таких размерах равновесные эффекты в испытание попросту не попадают. Это утверждение о приборе, а не о программах.
Два раза, когда масштаб добавил
Из «масштаб может сменить знак» часто выводят «при масштабе эффект отрицателен». Довод такого не говорит, а измерения дают обратное. Первое из них кенийское: разовые переводы примерно по тысяче долларов более чем 10 500 домохозяйствам в 653 деревнях. Вложенная сумма составила больше 15 % продукта лечебных деревень. Эксперимент строился именно ради равновесных эффектов.
Цены на такой шок почти не отозвались. Средняя инфляция 0,1 %, а средний эффект на цены с 95-процентной уверенностью ниже 0,22 %. Локальный мультипликатор перевода оценён в 2,5 в журнальной публикации, а в рабочей версии и при доходном подходе он записан иначе, и семнадцатый урок это разбирает. Знак перетоков на соседей там же назван спорным, и этот урок его не переоткрывает.
Второе измерение индийское, и оно про исполнение государственной программы гарантированной занятости. Реформу, улучшавшую её исполнение, разворачивали жребием на уровне субокруга, крупной административной единицы. Заработки домохозяйств-получателей выросли на 14 %, бедность снизилась на 26 %. И главное: 86 % прироста дохода пришло не от самой программы, а от выросших частных зарплат и занятости.
Ни числа субокругов, ни числа домохозяйств, ни интервалов в добытой аннотации нет. Точечные оценки идут в урок с этой пометкой, и по правилу курса это половина результата. Испытание, рандомизированное на уровне деревни, эти 86 % не увидело бы вовсе. Авторы объясняют прибавку устройством рынка труда, а не ростом производительности: резервная зарплата работников выросла, а доходность земли упала.
Пилот, который умели повторять
Третий случай начинается с пилота, который работал. В двух округах северо-запада Бангладеш есть регулярный предуборочный голодный сезон. Домохозяйству предлагали 600 така на дорогу в город при условии выезда и ещё 200 по прибытии. Разыгрывали это по деревням: 1 900 домохозяйств в 100 деревнях. Отбирали по малоземелью и пропущенным приёмам пищи в прошлый сезон.
Долю семей, отправивших мигранта, это подняло с 36 % в контроле до 59 % при наличных и 56,8 % при займе. Одна только информация о работе в четырёх городах не дала ничего: разница 0,0 %, и оценена она узко. Уезжает при этом почти всегда мужчина: 97 % мигрантов, и в 84 % случаев это глава семьи. В сводной таблице более поздней работы раунд 2008 года записан как прибавка 18 процентных пунктов при стандартной ошибке 3 на 1 826 домохозяйствах. Это не разность 59 и 36: там регрессионная оценка сразу по обеим стимульным ветвям. Сами авторы пилота пишут, что стимулы побудили отправить мигранта около 22 % домохозяйств выборки.
Пилот 2014 года ставился уже иначе. Жребием разыгрывали насыщение: долю жителей деревни, которым предложение сделано. Предложение получили 5 792 возможных мигранта в 133 деревнях, и вместе с выездом мерили деревенский рынок труда. Доля уезжающих из деревни выросла с 35 до 65 %. Прибавка к доле отправивших мигранта составила 25 пунктов (СО 4) при низком насыщении и 40 пунктов (СО 3) при высоком, на 3 600 домохозяйствах.
Что стало с теми, кто остался, здесь измерено прямо. Мужская сельская оплата труда выросла на 4,5-6,6 %, а доступные часы работы на 11-14 %. Фонд оплаты у нанимателей вырос, их прибыль снизилась, а урожайность значимо не изменилась. Цены на еду выросли на 2,7 %. Эти числа взяты из рабочей статьи, рецензирования она не проходила.
Программа, которая выглядела здоровой
Потом программу развернули. Заём предлагали более чем 140 тысячам домохозяйств в год: около 5 % населения региона. Независимую оценку при этом сохранили: учёные вмешивались только в выбор регионов, чтобы рандомизация была возможна. В 2017 году эффект составил 4 процентных пункта при стандартной ошибке 5 на 1 537 домохозяйствах, в 2018-м 12 пунктов (СО 4) на 1 901.
Равенство эффекта пилота и эффекта при масштабе отвергается на пятипроцентном уровне для каждой пары, кроме 2008 и 2018 годов. А по административной отчётности провала видно не было. Доля тех, кто получил предложение и уехал с займом, составила 41,0 % в 2018 году против 42,3 % в пилоте 2008-го. Авторы пишут прямо: по одним административным данным исполнители заключили бы, что программа выправилась.
География добавляет вторую половину. В 2018 году в двух пилотных округах эффект 12 пунктов (СО 4), а в шести округах расширения −3 пункта (СО 3). Объединённая по всем округам оценка была бы неотличима от нуля в оба года. Именно её называет часть пересказов, поэтому у работы ходят два числа: 6 и 12 пунктов. Говорить надо, о какой выборке речь. Предсказать разрыв по признакам округов было нельзя: проверка на совместную значимость их различий равенства не отвергает.
Объяснение авторы называют риском делегирования и проверяют его. При масштабе набрали много новых кредитных офицеров, надзора на офицера стало меньше, а метрикой их работы стало число выданных займов. Естественно, они шли к тем, кого проще уговорить, то есть к тем, кто уехал бы и так. Из домохозяйств опытной группы лишь чуть больше половины помнят, что им предлагали заём. Контрфактический расчёт: дойди пилот 2008 года до людей с той же неровностью, что и в 2018-м, он дал бы 6,3 процентного пункта.
Три конкурирующих объяснения авторы проверили и отвергли. Общее равновесие и вытеснение мест в городе: соседство с обработанными деревнями действует на выезд положительно, значит, места не кончились. Изменение состава населения расхождения тоже не объясняет. А условие займа при масштабе исполнялось, если и иначе, то строже.
Работа о масштабе этой программы: рабочая версия декабря 2025 года, объявленная на пересмотре и повторной подаче в журнал. DOI у неё нет, в указателях она не индексирована. Числа урока взяты из её полного текста, и статус её назван здесь, а не в примечании. Отдельно надо сказать о судьбе самой программы. Её закрыли в июне 2019 года, и причин было три сразу: разочаровывающий результат 2017 года, гибель тринадцати человек в дорожной аварии в январе 2019-го, из них пятеро связаны с домохозяйствами программы, и разрыв с местным исполнителем после обвинений в подкупе. Пересказ «испытание показало ноль, программу закрыли» упрощает и решение, и роль измерения в нём.
Что здесь измерено
Соберём измеренное. Отбор мест: предсказание по первым десяти площадкам завышает эффективность следующих 101 примерно на 0,5 п. п. при среднем эффекте 1,31 %. Разрыв между журналом и практикой: 8,7 против 1,4 п. п. на 126 испытаниях, и объясняется он мощностью и публикационным отбором, а не контекстом. Масштаб: дважды он дал крупную прибавку, а в Бангладеш эффект при масштабе оказался далеко ниже пилотных 25-40 пунктов.
Есть и вопрос, на который поле ответа не дало. Насколько велик разброс эффектов между местами вообще? Свод оценок воздействия 2020 года находит разброс большим и связывает его с признаками самих работ. Полного текста в базе курса нет, поэтому величин отсюда брать нельзя. Байесовская модель на микроданных семи испытаний микрокредита, разобранная в шестнадцатом уроке, находит разброс умеренным и относит около 60 % наблюдаемой разнородности к выборочной изменчивости. Базы, модели и вопросы у них разные, и выбрать между этими ответами сегодня нечем.
Не измерено и другое. Никто не проверял, что дала бы программа энергосбережения за пределами Соединённых Штатов. Ни у мультипликатора, ни у четырнадцати процентов прироста заработков интервалов в базе курса нет. И одно общее у трёх случаев: ошибку находили не пересказчики, а само поле. Её нашли тот, кто собрал 111 испытаний, те, кто выложил все 126 испытаний ведомств, и те, кто сохранил контрольную группу при масштабировании.
Мерили расход электричества у домохозяйств 111 американских площадок, долю откликнувшихся в 126 испытаниях двух ведомственных групп и долю семей, отправивших сезонного мигранта, в двух округах северо-запада Бангладеш. Отсюда не следует, разворачивать ли программу в масштабе, потому что решение требует того, чего в этих измерениях нет. Цен и институтов того места, куда разворачивают: письмо о соседском потреблении и заём на дорогу до города живут в разных экономиках. Того, кто будет исполнять программу и по какой метрике оценят его работу (в бангладешском случае это оказалось решающим, и измерено оно было задним числом). И того, от чего в чужом бюджете придётся ради этого отказаться. Принимают такое решение те, кто отвечает за эту программу и за этот бюджет, и на этом курс останавливается. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.
Что дальше
Из урока стоит унести три различения. Перенос и масштаб: разные вопросы, первый про другое место, второй про то же место целиком. Отбор мест и разброс эффектов тоже разные вещи: разброс говорит, что площадки непохожи, а отбор говорит, что непохожесть связана с самим эффектом. И третье: административная отчётность программы не заменяет контрольной группы, даже когда выглядит здоровой.
Дальше модуль берёт последнее большое число этого разговора. Сколько в мире бедных: величина, которой чаще всего обосновывают решения. У неё есть настройки, и их шесть. Черта, база паритетов и версия выгрузки меняют ответ так, что он перестаёт быть сравнимым сам с собой. Следующий урок разбирает эти настройки по очереди.
Первые десять площадок
Сто одиннадцать испытаний одной программы, микроданные по первым десяти площадкам и прогноз на следующую сотню. Ручек три: сколько первых площадок брать в обучение, каким способом строить прогноз и в чём мерить. Экран показывает две части ошибки (ту, которую повторения лечат, и ту, которую не лечат) и отказывается вычитать величины, приведённые по-разному. Числа только из работы, учебных нет вовсе.
Ключевые работы
| Allcott H, Quarterly Journal of Economics | 2015 | Не эксперимент, а разбор совокупности чужих экспериментов одной программы: письма домохозяйствам со сравнением их расхода электричества с расходом соседей. Объём: 111 рандомизированных испытаний, 8,6 миллиона домохозяйств, 58 электрических компаний по США, все запущенные до февраля 2013 года. Микроданные доступны по первым десяти площадкам: 508 тысяч домохозяйств. Исход: снижение потребления электроэнергии, в киловатт-часах в сутки и в процентах от контроля, за первый год каждой площадки. Предсказание по микроданным первых десяти завышает эффективность следующих 101 примерно на 0,5 процентного пункта, или 690 миллионов долларов розничной цены. Средний эффект 1,31 %, стандартное отклонение между площадками 0,45 процентного пункта, каждая из первых одиннадцати площадок дала 1,34 % или больше, а 61 поздняя площадка из 101 лежит вне области признаков первых десяти. Дословно: данные первых десяти не предсказывают даже направления отбора площадок. Механизмы названы автором: отзывчивых потребителей берут первыми, а программу раньше принимают компании в более богатых и более «экологичных» зонах. Числа читаны по рабочей версии NBER 18373. |
| DellaVigna S, Linos E, Econometrica | 2022 | Сравнение двух совокупностей испытаний одного приёма: писем и сообщений, подталкивающих людей к действию. Первая совокупность: все испытания двух крупнейших американских ведомственных групп, то есть без возможности выборочной публикации. Вторая: опубликованные в академических журналах испытания того же рода из двух мета-анализов. Объём: 126 рандомизированных испытаний, охват больше 23 миллионов человек. Исход: доля откликнувшихся, в процентных пунктах. В журнальных статьях средний эффект 8,7 п. п., то есть 33,5 % сверх контроля, у ведомственных групп 1,4 п. п., или 8,1 %, а опубликованная аннотация даёт те же доли как 33,4 % и 8,0 %. Контроль на статистическую мощность объясняет разницу целиком: хорошо обеспеченные мощностью журнальные испытания дают около одного процентного пункта. Поправка на выборочную публикацию опускает журнальную оценку с 8,6 до 3,2 п. п. при стандартной ошибке 1,9. Участие академических исследователей разрыва не объясняет. Внутри самих ведомственных групп выборочная публикация тоже найдена: до академических статей довели 16 испытаний из 126. Числа читаны по рабочей версии NBER 27594. |
| Deaton A, Cartwright N, Social Science & Medicine | 2018 | Обзорно-методологическая работа, собственных измерений на людях в ней нет, и это не отдельная работа с выборкой, а разбор того, что рандомизация делает и чего не делает. Для этого урока нужен её раздел о масштабировании. Логическая формулировка дана дословно: всякое испытание, меняющее спрашиваемые или предлагаемые количества, обязано затронуть и других, потому что новый спрос надо удовлетворить, а новое предложение куда-то деть. Отсюда нарушение допущения об отсутствии взаимного влияния при развёртывании. Пример с какао: если способ внесения удобрений поднял урожай и доходы участников, то при развёртывании на всю страну цена упадёт, и при неэластичном спросе доходы производителей снизятся, то есть знак эффекта при масштабе сменится на противоположный. Авторы сами указывают, что тезис не новый: он отмечен в экономической литературе с начала девяностых и признан в обзоре практиков метода 2009 года, и они же называют работу, где проблему решили в устройстве самого испытания. |
| Egger D, Haushofer J, Miguel E, Niehaus P, Walker MW, Econometrica | 2022 | Рандомизированное испытание безусловных денежных переводов, поставленное так, чтобы поймать эффекты за пределами получившего домохозяйства. Объём: более 10 500 домохозяйств в 653 деревнях запада Кении, переводы примерно по тысяче долларов, основные исходы через 18 месяцев. Влитая сумма составила больше 15 % продукта лечебных деревень. Для этого урока нужны две строки. Первая: цены на такой шок почти не отозвались (средняя инфляция 0,1 %, средний эффект на цены с 95-процентной уверенностью ниже 0,22 %). Вторая: локальный мультипликатор перевода оценён в 2,5 в журнальной публикации, а в рабочей версии и при доходном подходе записан иначе. Знак перетоков на неполучателей в этой литературе спорен: другая работа той же организации в том же регионе даёт противоположный знак, и разбирается это в семнадцатом уроке, а не здесь. |
| Muralidharan K, Niehaus P, Sukhtankar S, Econometrica | 2023 | Рандомизированная оценка реформы, улучшившей исполнение индийской государственной программы гарантированной сельской занятости. Развёртывание разыгрывали жребием на уровне субокруга, крупной административной единицы. На ком: сельские домохозяйства Андхра-Прадеш. Что мерили: заработки домохозяйств, бедность, частные зарплаты и занятость, доходность земли. Заработки получателей выросли на 14 %, бедность снизилась на 26 %, и 86 % прироста дохода пришло не от самой программы, а от выросших частных зарплат и занятости. Объяснение авторов указывает на устройство рынка труда, а не на рост производительности: резервная зарплата работников выросла, доходность земли упала, а прибавка занятости была больше там, где земля собрана в меньшем числе рук. Ни числа субокругов, ни числа домохозяйств, ни доверительных интервалов в добытой аннотации нет, а полного текста в базе курса нет, и точечные оценки идут в урок с этой пометкой. |
| Bryan G, Chowdhury S, Mobarak AM, Econometrica | 2014 | Кластерное рандомизированное испытание субсидии на сезонный выезд на заработки в предуборочный голодный сезон. Где: округа Лалмонирхат и Куриграм на северо-западе Бангладеш. Объём: 1 900 домохозяйств в 100 деревнях, по 19 хозяйств на деревню. Отбор шёл по двум условиям: мало земли и вынужденно пропущенные приёмы пищи в прошлый сезон. Ветви: контроль, только информация о работе в четырёх городах, наличные 600 така при условии выезда плюс 200 по прибытии, тот же стимул беспроцентным займом. Сроки: базовый опрос июль 2008, вмешательство конец августа 2008, волны наблюдения до июля 2011. Исход: доля хозяйств, отправивших сезонного мигранта, и потребление оставшихся дома. Доля отправивших: 36,0 % в контроле, 59,0 % при наличных, 56,8 % при займе. Одна информация не дала ничего: разница 0,0 %, и оценена она узко. Мигрант почти всегда мужчина: 97 %, и в 84 % случаев глава семьи. |
| Akram AA, Chowdhury S, Mobarak AM, эффекты сезонной эмиграции на сельский рынок труда, рабочий документ NBER | 2017 | Рандомизированное испытание той же субсидии на выезд, но с жеребьёвкой насыщения: доля жителей деревни, получивших предложение, разыгрывалась отдельно от самого предложения. Объём: предложение субсидировать дорогу получили 5 792 возможных мигранта в 133 деревнях. Что мерили, кроме выезда: деревенскую оплату труда, доступные часы работы, прибыль нанимателей, урожайность и цены, то есть исходы у тех, кто никакого предложения не получал. Доля уезжающих из деревни выросла с 35 до 65 %. Мужская сельская оплата труда выросла на 4,5-6,6 %, а доступные часы работы на 11-14 %. Фонд оплаты у нанимателей вырос, прибыль снизилась, а урожайность значимо не изменилась. Цены на еду выросли на 2,7 % за счёт рыбного белка. Более плотная сетка предложений повышает и долю берущих. Рабочая статья, рецензирования не проходила: журнальной версии на 2026 год нет. |
| Mitchell H, Mobarak AM, Naguib K, Reimão ME, Shenoy A, риск делегирования при масштабировании программы миграционных займов, рабочая версия | 2025 | Независимая экспериментальная оценка уже развёрнутой программы: исследователи вмешивались только в выбор регионов, чтобы рандомизация была возможна. Масштаб программы: заём предлагали более чем 140 тысячам домохозяйств в каждый из двух лет, около 5 % населения региона. Исход: доля хозяйств, отправивших сезонного мигранта. Пилоты: +18 п. п. (СО 3) в 2008 году при контроле 36 % на 1 826 домохозяйствах, +25 (СО 4) и +40 (СО 3) в 2014-м на 3 600. При масштабе: +4 (СО 5) в 2017 году на 1 537 домохозяйствах и +12 (СО 4) в 2018-м на 1 901. Равенство пилота и масштаба отвергается на пятипроцентном уровне для каждой пары, кроме 2008 и 2018 годов. В 2018 году в пилотных округах +12 (СО 4), в шести округах расширения −3 (СО 3), а объединённая оценка была бы неотличима от нуля в оба года. Предсказать разрыв по наблюдаемым признакам округов было нельзя. Административная отчётность провала не показывала: доля получивших предложение и уехавших с займом 41,0 % в 2018-м против 42,3 % в 2008-м. Объяснение авторов указывает на риск делегирования: новых кредитных офицеров много, надзора на офицера мало, а метрикой их работы служит число выданных займов. Лишь чуть больше половины опытной группы помнят, что им предлагали заём. Рабочая версия декабря 2025 года, рецензирования не проходила, DOI нет. |
| Vivalt E, Journal of the European Economic Association | 2020 | Свод результатов оценок воздействия: не одно исследование, а сопоставление многих работ между собой. Единица наблюдения: оценка эффекта из чужой работы. Найден большой разброс величин эффекта, и он связан с признаками самих работ. Названо прямо, что программы, исполненные государством, дают меньшие эффекты, чем исполненные исследователями или некоммерческими организациями, даже при контроле на размер выборки. Полного текста в базе курса нет, поэтому в урок идёт направление, а не величина. Для этого урока важно другое: вывод о большом разбросе стоит рядом с выводом байесовской модели на семи испытаниях микрокредита, где разброс назван умеренным, а около 60 % наблюдаемой разнородности отнесено к выборочной изменчивости. Базы, модели и вопросы у двух работ разные, и ни одна формулировка не может стоять как ответ поля. |
Что подтвердилось, а что нет
Измерено, а не постулировано, и на одной программе. 111 рандомизированных испытаний программы энергосбережения, 8,6 миллиона домохозяйств, 58 компаний по США, все запущенные до февраля 2013 года. Исход: снижение потребления электроэнергии за первый год площадки. Предсказание по микроданным первых десяти площадок, то есть по 508 тысячам домохозяйств, завышает эффективность следующих 101 примерно на 0,5 процентного пункта при среднем эффекте 1,31 %. Каждая из первых одиннадцати площадок дала 1,34 % или больше. Стандартной ошибки к величине завышения в добытой части базы нет, и вторую половину результата здесь взять неоткуда. Напечатан при этом разброс между площадками: стандартное отклонение процентных эффектов 0,45 процентного пункта. Это разброс площадок, а не ошибка оценки завышения, и подменять одно другим нельзя. Механизмы названы автором: отзывчивых потребителей берут первыми, а программу раньше принимают компании в более богатых и более «экологичных» зонах.
Проверено в самых благоприятных условиях, какие в этом поле встречаются: десять повторений по всей стране, 508 тысяч домохозяйств, набор признаков по каждому. Предсказание всё равно вышло смещённым, и автор пишет дословно, что богатые микроданные первых десяти площадок не предсказывают даже направления отбора площадок. Шестьдесят одна из 101 поздней площадки лежит вне области, покрытой признаками первых десяти, то есть отличается по наблюдаемым признакам уровня площадки. Повторения не были случайной выборкой из мест, и число повторений этого не чинит.
Сам разрыв измерен: 8,7 п. п. в академических журналах против 1,4 п. п. в испытаниях двух ведомственных групп, на 126 рандомизированных испытаниях с охватом больше 23 миллионов человек. Исход: доля откликнувшихся. Но объяснение оказалось другим. Контроль на статистическую мощность объясняет разницу целиком: хорошо обеспеченные мощностью журнальные испытания дают около одного процентного пункта, как у ведомств. Мета-анализ с поправкой на выборочную публикацию опускает журнальную оценку с 8,6 до 3,2 п. п. при стандартной ошибке 1,9, а участие академических исследователей разрыва не объясняет. Осторожная версия уцелела: контекст и исполнитель на величину влияют, и это измерено в других работах, но конкретно этот разрыв ими не объясняется.
Так читают довод о том, что при масштабе знак эффекта может смениться, а сам довод говорит только «может». Измерения дают и обратное. В Кении разовые переводы более чем 10 500 домохозяйствам в 653 деревнях вложили в местную экономику больше 15 % продукта лечебных деревень, а цены почти не отозвались: средняя инфляция 0,1 %, средний эффект на цены с 95-процентной уверенностью ниже 0,22 %. В Индии реформа исполнения программы гарантированной занятости, развёрнутая жребием на уровне субокруга, подняла заработки получателей на 14 % и снизила бедность на 26 %, причём 86 % прироста дохода пришло не от самой программы. В Бангладеш при плотной сетке предложений о сезонном выезде мужская сельская оплата труда выросла на 4,5-6,6 %, а доступные часы работы на 11-14 %. Интервалов у индийских величин в добытой части базы нет, и по правилу курса это половина результата.
Термины
- отбор местsite selection bias
- Смещение оценки, возникающее оттого, что вероятность запустить или оценить программу в данном месте связана с величиной её эффекта именно здесь. От обычной непохожести площадок отличается тем, что эта непохожесть связана с самим исходом. Измеряется сравнением предсказания по ранним площадкам с тем, что вышло на поздних.
- носитель признаковcommon support
- Область значений признаков, внутри которой у предсказания есть опора на наблюдения. За её краем модель уже не усредняет похожие случаи, а продолжает линию наружу. Доля объектов вне носителя: прямая мера того, насколько предсказание держится на допущении, а не на данных.
- предсказание вне выборкиout-of-sample prediction
- Оценка того, что случится там, где не мерили, построенная по тому, что измерено здесь. Проверяется единственным способом: сделать предсказание, а потом измерить и сравнить. Если такой проверки не было, точность предсказания не результат, а допущение.
- публикационный отборpublication selection
- Систематическое различие между тем, что измерено, и тем, что напечатано: значимые и крупные результаты попадают в журналы чаще прочих. Смещение тем больше, чем меньше мощность у отдельного испытания. Меряется сравнением с совокупностью, где публикация ни от чего не зависела, или поправкой на связь величины эффекта с её ошибкой.
- эффект общего равновесияgeneral equilibrium effect
- Изменение цен, зарплат и количеств, которое возникает оттого, что вмешательство получили не единицы, а многие сразу. В обычном испытании его не видно: каждая единица слишком мала, чтобы сдвинуть рынок. При развёртывании он может и добавить к эффекту, и вычесть из него, и сменить его знак.
- резервная зарплатаreservation wage
- Наименьшая оплата, при которой человек соглашается выйти на работу. Растёт, когда у него появляется другой источник дохода, и тянет за собой рыночную ставку. Через неё объясняют, почему прибавка к доходу от программы занятости пришла в основном не от самой программы.
- риск делегированияdelegation risk
- Расхождение между тем, что задумал заказчик программы, и тем, что делает исполнитель на месте, когда работу исполнителя оценивают по своей метрике. Это свойство устройства, а не порок исполнителя: метрика «число выданных займов» ведёт к тем, кого проще уговорить. Меряется сравнением с контрольной группой, потому что в отчётности исполнителя такое расхождение не видно.
- пилотная площадкаpilot site
- Место, где программу проверяют до развёртывания. Выбирается обычно не жребием, а по готовности партнёра, доступности или заметности, и потому её результат не случайная выборка из будущих мест. В бангладешском случае пилотные округа разошлись с округами расширения сильнее, чем предсказывали их наблюдаемые признаки.
Практикум · Проверить одно обещание масштаба
Упражнение на час и на один документ: отчёт о программе, которую собираются или уже начали разворачивать шире, чем шло испытание. Считать почти ничего не нужно, решать что-либо не нужно вовсе. Цель: увидеть, чем именно подкреплён переход от площадок испытания к масштабу.
- Выпишите, где и когда шло испытание: страна, число площадок, число единиц рандомизации, срок. Отдельной строкой выпишите, где и в каком объёме программу разворачивают.
- Найдите, как выбирались площадки испытания. Если сказано «согласились участвовать», «пилот в передовом районе» или «по расположению офисов партнёра», отметьте это как отбор мест, а не как случайную выборку.
- Проверьте, что в документе стоит вместо контрольной группы при масштабе. Административный охват, доля получивших и отчётность исполнителя её не заменяют: в бангладешском случае они показывали здоровую программу при эффекте, неотличимом от нуля.
- Назовите одну величину, которая при развёртывании изменится не у участников, а у остальных: цена, зарплата, очередь, доступность места. Найдите, измерена ли она хоть где-нибудь, и запишите отсутствие как отсутствие.
- Выпишите, кто будет исполнять программу в масштабе и по какой метрике оценят его работу. Если метрикой служит число выданных единиц, а не исход, отметьте, к кому она поведёт исполнителя.
Вопросы для самопроверки
Что именно измерил разбор 111 испытаний программы энергосбережения?
- Что предсказание по первым десяти площадкам завышает эффективность следующих 101 примерно на 0,5 процентного пункта
- Что средний эффект программы по всем 111 испытаниям неотличим от нуля
- Что письма о соседском потреблении действуют сильнее в бедных районах, чем в богатых, при равном исходном потреблении
- Что разброс эффектов между площадками целиком объясняется обычной выборочной изменчивостью
Почему разрыв между журнальными и ведомственными испытаниями не объясняется тем, что академические исследователи работают тщательнее?
- Потому что разрыв исчезает, если исключить те шестнадцать ведомственных испытаний, которые довели до журнальных статей
- Потому что в ведомственных группах работали ровно те же академические исследователи, что и в журнальных статьях
- Потому что журнальная и ведомственная выборки испытаний почти не пересекаются по темам вмешательств
- Потому что контроль на мощность снимает разницу целиком
Чем вопрос о масштабе отличается от вопроса о переносе?
- Масштаб означает повторение испытания в другой стране, а перенос увеличение выборки внутри одного
- Масштаб меняет только число участников, а перенос меняет ещё и само вмешательство
- Перенос спрашивает, что будет в другом месте, а масштаб спрашивает, что будет здесь же, если программу получат все
- Разницы между ними нет: оба вопроса решаются повторением испытания на новых площадках
Что показывала административная отчётность бангладешской программы в 2018 году?
- Что программа не дотягивает до пилота: доля уехавших с займом упала более чем вдвое
- Что программа повторила результат пилота: 41,0 % уехавших против 42,3 %
- Что доля получивших предложение выросла, а доля уехавших не сдвинулась
- Что провал заметен, но объясняется изменением состава населения округов
Что из перечисленного НЕ следует из этих работ?
- Что отбор мест способен завысить ожидаемый эффект, и величина завышения измерена
- Что при развёртывании эффект иногда оказывается больше, чем в отдельном испытании
- Что отчётность исполнителя способна показывать здоровую программу при нулевом эффекте
- Что равновесные эффекты при развёртывании программы в масштабе всегда отрицательны
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Allcott H. «Site Selection Bias in Program Evaluation». The Quarterly Journal of Economics, 2015, 130(3):1117-1165: У издателя закрыта, а числа урока взяты из рабочего документа NBER 18373, открытого целиком. Читать стоит раздел о предсказании на 101 позднюю площадку: там и 61 площадка вне области признаков первых десяти, и строка о том, что направление отбора не предсказано вовсе.
- DellaVigna S., Linos E. «RCTs to Scale: Comprehensive Evidence from Two Nudge Units». Econometrica, 2022, 90(1):81-116: Рабочая версия NBER 27594 открыта, и числа урока из неё, а в опубликованной аннотации те же доли даны как 33,4 % и 8,0 %. Главное не в паре «8,7 против 1,4», а в разделе о мощности: контроль на минимально обнаружимый эффект снимает разницу целиком.
- Deaton A., Cartwright N. «Understanding and misunderstanding randomized controlled trials». Social Science & Medicine, 2018, 210:2-21: Открыта в PMC (PMC6019115). Для этого урока нужен раздел о масштабировании: пример с ценой какао, логическая формулировка про нарушение допущения об отсутствии взаимного влияния и ссылки на работы начала девяностых, где тезис уже стоял.
- Muralidharan K., Niehaus P., Sukhtankar S. «General Equilibrium Effects of (Improving) Public Employment Programs: Experimental Evidence from India». Econometrica, 2023, 91(4):1261-1295: Полного текста в базе курса нет, и числа берутся из дословной аннотации: 14 %, 26 % и 86 % идут без интервалов. Читать её стоит целиком: там же названо, чем авторы объясняют прибавку, а именно устройством рынка труда, а не ростом производительности.
- Mitchell H., Mobarak A.M., Naguib K., Reimão M.E., Shenoy A. «Delegation Risk and Implementation at Scale: Evidence from a Migration Loan Program in Bangladesh». Рабочая версия, декабрь 2025: Рабочая статья, рецензирования не проходила, DOI нет, а полный текст лежит на странице первого автора. Читать стоит вторую и восьмую таблицы подряд: в первой пилоты против масштаба, во второй пилотные округа против округов расширения. Только вместе они объясняют, почему у работы ходят два разных числа.