Контрольная группа и ошибка «до и после»
«До и после» оценки не даёт: на площадках проекта показатель вырос вчетверо, и вокруг он вырос примерно так же
Контрольная группа нужна, чтобы показать, куда показатель двигался бы и без программы: сравнение «до и после» этого не даёт. Клеменс и Демомбин разобрали так отчёт крупного проекта развития: на кенийской площадке Саури доля домохозяйств с мобильным телефоном за 2005-2008 годы выросла вчетверо, и примерно так же она выросла в окружающих районах. Оценки разности разностей по трём площадкам часто оказывались примерно вдвое меньше простых «до и после», а вдвое меньше это не ноль.
Clemens & Demombynes 2011, Journal of Development Effectiveness · Pronyk и др. 2012, The Lancet · Mitchell и др. 2018 · 25 мин · обновлено 24.09.2026
После урока вы сможете
- Строить разность разностей на готовых числах и называть, что после вычитания остаётся программе
- Называть допущение, на котором держится сравнение «до и после»: без программы не изменилось бы ничего
- Отличать «оценка стала вдвое меньше» от «эффекта нет»
- Проверять внешний ряд по трём признакам: тот же исход, те же годы, та же единица
- Называть судьбу работы вместе с работой: поправка, комментарий и отзыв это разные события
Промежуточный отчёт большого проекта перечислял его главные достижения. Одна строка выглядела так: доля домохозяйств с мобильным телефоном на кенийской площадке выросла вчетверо. Площадка называлась Саури: кластер деревень в западной Кении. Площадки проекта насчитывали в среднем по тридцать пять тысяч человек. Отсчёт шёл от 2005 года, когда начались вложения, к 2008-му, когда отчёт составляли.
Двое экономистов, Майкл Клеменс и Гэбриел Демомбин, задали к этой строке один вопрос. Не «правда ли это», а «с чем сравнивали». Ответ нашёлся в демографических и медицинских обследованиях, которые в Кении и Гане проводят регулярно и не для проекта. По ним владение мобильными телефонами росло на площадках примерно так же, как в окружающих районах.
Учетверение было настоящим. Отчёт не соврал ни в числе, ни в единице, и никто этого числа не оспаривал. Не было другого, то есть эффекта: телефоны за те же годы появлялись у соседей теми же темпами. Строка отчёта описывала календарь, а не работу проекта.
Этот урок о второй строке. Он показывает, откуда её берут, как из двух разностей получается третья и что делать, когда второй строки не существует вовсе. Правило, которое отсюда выходит, курс применяет дальше в каждом уроке.
Допущение, которое обычно не произносят
Сравнение «до и после» выглядит безобидно. Было столько, стало столько, разница и есть результат. На самом деле в этой арифметике спрятано утверждение о том, чего никто не наблюдал. Звучит оно так: без программы не изменилось бы ничего.
Авторы разбора пишут это допущение прямо и называют его очень сильным. Подход «до и после», по их словам, приписывает вмешательству любое наблюдаемое изменение, тогда как часть этих изменений или все они могли произойти и без него. За три-четыре года меняются цены, погода, дороги, техника и чужие программы.
Проверить допущение внутри самой площадки нельзя. Что случилось бы с деревней без проекта, никто не видел: история идёт в одном экземпляре. Состояние, которое не наступило, называют контрфактическим, и подставлять вместо него приходится что-то наблюдаемое.
Отсюда и берётся контрольная группа, а там, где жребия не было, группа сравнения. Роль у неё одна: показать, куда показатель двигался бы сам по себе. Без такой группы разность «после минус до» остаётся верным описанием площадки и молчит о том, чем эта площадка обязана программе.
Вторая строка: откуда её берут
Работа Клеменса и Демомбина охватила три площадки и девять показателей. Площадками были Саури в Кении, Бонсаасо в Гане и Пампаида в Нигерии, а периоды взяты с 2005 по 2008 год для Кении и с 2006 по 2009 для Ганы и Нигерии. Своих сравнительных данных у проекта на первом этапе не было, и авторы взяли чужие.
Годится не всякий чужой ряд. Пара складывается, когда совпадают три вещи: тот же исход, те же годы, та же единица. Разойдётся хоть одна, и вычитание превратится в фокус.
С телефонами пара сошлась. Обследования спрашивают ровно то, что считал проект: есть ли в домохозяйстве мобильный телефон. Ответ вокруг площадок оказался почти таким же, и записан он словами («выросло примерно столько же»), а не величиной.
Это важная деталь, и её обычно проглатывают. Внешний ряд не обязан быть точкой: иногда он утверждение источника, а не число. Тогда и результат вычитания окажется утверждением, а не числом, и выдавать его за число нельзя.
Демографические и медицинские обследования проводят в десятках стран по единой программе: национальная выборка домохозяйств, вопросы об имуществе, здоровье и смертности детей, разрезы по регионам и по городу с селом. Для оценки чужой программы они ценны именно тем, что собирались не под неё и вопросов под неё не подгоняли. Отсюда же и ограничение: годы, окна и формулировки вопросов у них свои, поэтому пара находится не для каждого показателя, а только для того, который они спрашивают ровно так же.
Как вычитают одну разность из другой
Теперь арифметика. Берут изменение на площадке, берут изменение вокруг неё за тот же срок и вычитают второе из первого. Остаток называют разностью разностей. Допущение за ним стоит помягче прежнего: без программы площадка двинулась бы туда же, куда двинулось окружение.
Посчитаем на кукурузе. Проект отчитался, что урожайность в Саури выросла с 1,9 до 5,0 тонны с гектара, то есть в 2,6 раза. Панельное обследование института Tegemeo говорит, что в Западных низменностях Кении вне площадки урожайность кукурузы за 2004-2007 годы выросла более чем вдвое. Причины там названы свои: примерно вдвое выросли применение удобрений, доля высокоурожайных сортов и число высеваемых сортов.
Вычитаем. Из «в 2,6 раза» вычесть «более чем вдвое» можно только как неравенство: проекту остаётся меньше чем в 1,3 раза. Точки не вышло сразу по двум причинам: внешняя динамика задана словами, а годы сдвинуты. Ряд проекта охватывает 2005-2008 годы, а ряд панели 2004-2007. Рядом с «урожай вырос в два с половиной раза» такой ответ выглядит бедно, и он честнее.
И ещё одна деталь, из-за которой позиция реестра по кукурузе осталась спорной. Исходный уровень Саури для региона был необычно высок: та же панель даёт по Западным низменностям около 1,25 тонны даже в 2007 году. Площадки выбирали, а не разыгрывали, и выбор мог пасть туда, где и так было лучше. Что весит больше, из этих чисел не видно.
Где второй строки нет вовсе
Из четырёх громких достижений проекта пара нашлась не для всех. Первый отказ касается малярии. Проект показал падение распространённости среди всех возрастов с 50 до 8 процентов в Саури, с 28 до 13 в Пампаиде и с 15 до 6 в Бонсаасо. Тестов на малярию в обследованиях, которыми пользовались авторы разбора, нет вовсе.
Ближайшее, что там есть: доля детей до пяти лет с лихорадкой за две недели перед опросом. По Кении она упала с 40,6 до 23,7 процента, а в сельских районах Ньянзы, где стоит Саури, с 48,5 до 24,8. Это другой исход. Лихорадка у ребёнка и распространённость малярии у всех возрастов не одно и то же, и вычитать одну из другой нельзя.
Второй отказ связан с тем же показателем, но с другим внешним рядом. По округу Килифи есть кенийские данные о госпитализациях по поводу малярии: 18,43 на тысячу детей в 2003 году и 3,42 в 2007-м. Исход другой, место другое, годы другие. Три несовпадения из трёх: пара не складывается.
Третий отказ соблазнителен тем, что числа выглядят однородными. Отдельная работа проекта отчиталась о снижении детской смертности на 22 процента к исходному уровню (25 смертей на тысячу живорождений при p = 0,015). Мерили на девяти площадках в девяти странах, деревни в среднем по тридцать пять тысяч человек, за три года после начала вложений. Исходом была смертность детей младше пяти лет.
Обследования дают по Кении 114,6 и 73,6 смерти на тысячу живорождений, за 2003 и 2008/09 годы. Обе величины «на тысячу», и на этом сходство кончается. Каждое число обследования относится к пятилетнему окну перед ним, у проекта же это три года от 2006-го и своя выборка. Знаменатели и окна разные, и разность разностей вышла бы здесь не оценкой, а видимостью.
Две величины «на тысячу» соблазняют вычесть одну из другой. Проверять надо не единицу, а четыре вещи: кого считали, за какой срок, по какой выборке и что именно назвали исходом. У проекта это три года от 2006-го и его собственное обследование, а у демографических обследований пятилетние окна перед опросами 2003 и 2008/09 годов и национальная выборка. Соблазн тем сильнее, чем аккуратнее выглядят числа: разные знаменатели снаружи не видны.
«Вдвое меньше» это не ноль
Главный вывод разбора записан осторожно, и осторожность тут по существу. Дословно: оценки разности разностей, учитывающие динамику вне площадок, часто оказываются примерно вдвое меньше простых разностей «до и после», в Кении и Гане. Не «равны нулю». Вдвое меньше.
Разница между этими двумя чтениями большая. «Вдвое меньше» значит, что часть изменения площадке всё-таки принадлежит, а часть объясняется общим движением вокруг. «Эффекта нет» это совсем другое утверждение, и оснований для него у авторов не было. Что именно значит ноль и сколько у нуля сортов, курс разберёт отдельно.
Своей работой авторы вопрос не закрывают и оценкой воздействия её не называют. В аннотации сказано прямо: ни один из двух подходов строгой оценкой воздействия не является. И причина названа не общими словами, а списком из пяти пунктов.
Пункты такие: площадки вмешательства выбраны субъективно, сравнительные площадки выбраны субъективно, исходных данных по сравнительным площадкам нет, выборка мала, горизонт короток. Ни один из пяти не лечится добавлением ещё одного показателя в таблицу. Это свойство замысла первого этапа, а не пробел в данных.
Что стало с самой работой
У курса есть правило: судьба работы называется вместе с работой. У статьи проекта о детской смертности судьба богатая. Она вышла в «Ланцете» в июне 2012 года, и к ней привязаны две опубликованные поправки и два комментария.
Поправку написали сами авторы. Из статьи изъяли утверждение, что смертность на площадках падала втрое быстрее национального сельского тренда, 7,8 процента в год против 2,6. Причина изъятия ровно та, о которой этот урок: периоды несопоставимы. Тренд считали за десять лет, а площадки за три.
Та же поправка добавила вещь потяжелее. До вмешательства смертность детей на площадках проекта была выше, чем в сравнительных деревнях, и различие значимо при p = 0,020. Величины этого различия поправка не приводит: только p, а значимость без величины по мерке курса не результат. То есть деревни, названные подобранными, по главному исходу совпадали не вполне. Полный текст поправки закрыт, и её содержание сверено по вторичному разбору. Это надо помнить, читая абзац выше.
И ещё одно, что стоит сказать вслух. Ошибку нашли не разоблачители со стороны, а экономисты того же поля, и руководитель проекта назвал их замечания точными и полезными. Один из авторов статьи проект покинул, а исследовательскую часть перестроили, создав независимую экспертную группу. Это история про хрупкость приборов, а не про подлог.
Не отозвали. В медицинской библиографической базе она числится клиническим испытанием без всякой пометки об отзыве. К ней привязаны две поправки и два комментария. Поправка и отзыв не одно и то же: при отзыве статья изымается целиком, при поправке правится её часть, а остальное остаётся в силе. Разница существенна и здесь: числа по детской смертности из аннотации никуда не делись, а изъято было сравнение с национальным трендом, у которого не совпадали периоды.
Тренажёр: найдите вторую строку
К уроку приложен тренажёр bezkontrolya. В нём четыре показателя проекта, как их напечатал промежуточный отчёт, и пять внешних рядов, у каждого свой источник, свои годы и своя единица. Пару читатель составляет сам: показатель проекта плюс внешний ряд, или «внешнего ряда нет».
Экран отвечает по трём подписанным признакам: тот же ли исход, те же ли годы, та же ли единица. Приговоров три: «пара годится», «годится с названной оговоркой» и «сравнить не с чем». Вторая величина рядом с «до и после» показывается только в первых двух случаях, причём во втором вместе с тем, что именно не сошлось.
На паре с телефонами разность разностей почти обнуляет учетверение, но точки на экране не будет: внешний ряд там задан словами. Три пары из пяти получают отказ, и это не поломка, а содержание урока. Числа в тренажёре только из работ, смоделированных нет ни одного, и паспорт ряда стоит рядом с числом.
Отдельной строкой идёт цитата из письма критиков в тот же журнал. Собственные расчёты проекта, пишут они, не могут быть независимо проверены другими исследователями: данные строго внутренние. Тренажёр никого не оценивает и ничего не советует, а показывает, из чего собирается вторая строка и когда её собрать не из чего.
Чем кончился проект
Проект отработал десять лет и получил две итоговые оценки. Первую сделала команда самого проекта: сравнительные деревни подобрали ретроспективно, уже после окончания, а обследование провели в 2015 году на десяти площадках по сорока показателям. Из сорока оценок тридцать оказались значимыми и в пользу проектных деревень.
В той же аннотации стоит и другое. Значимого влияния на потребительские меры бедности оценка не нашла, а на индексе владения имуществом нашла. По питанию и образованию выводы часто оказывались неопределёнными: интервалы включали ноль. Треть заявленных целей на площадках была достигнута.
Вторую оценку сделала внешняя группа на одной ганской площадке, и её замысел опубликовали заранее, за несколько лет до результата. Обследовали больше двух тысяч домохозяйств в 35 деревнях проекта и 68 сравнительных, с 2012 по 2017 год, по 28 показателям Целей тысячелетия. Значимыми оказались семь показателей из 28. Денежная бедность, недоедание и детская смертность не сдвинулись.
Одно число из этих семи стоит прочесть внимательно. Посещаемость начальной школы выросла на 7,7 процента, а доля доучившихся не изменилась. Присутствие в школе и умение это разные исходы, и второе здесь не измеряли вовсе.
Расхождение двух оценок объясняли длительностью и числом площадок, и объяснение опубликовали участники проекта. Проверить его нечем: проспективной оценки десяти площадок за десять лет не существует. Есть и вторая разница, которой это объяснение не называет. В первой оценке сравнительные деревни подбирали задним числом, когда результаты были уже известны, а во второй заранее и до вмешательства.
Измерено вот что: на трёх площадках за три года девять показателей поставили рядом с рядами обследований вокруг них, а через десять лет две итоговые оценки сравнили проектные деревни с непроектными, одна ретроспективно, другая по заранее опубликованному замыслу. Отсюда не следует решение ни о деньгах, ни о повторении такой программы где-то ещё. Решение требует того, чего в этих измерениях нет: цен и условий другого места, чужого бюджета и того, от чего ради него откажутся, и того, что для самих жителей важнее прочего. Принимают такие решения те, кто распоряжается этими деньгами и живёт в этих деревнях. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.
Что дальше
Из урока выходит первый из шести вопросов, которые курс задаёт любому заявлению об эффекте программы: с чем сравнивали, с собой прежним или с группой сравнения? Он самый дешёвый и отсеивает больше всего. Если второй строки в сообщении нет, дальше можно не искать: там календарь, а не эффект.
Следующий урок берёт спор, который шёл до полевых испытаний и продолжается рядом с ними. Участников там трое, и у каждого одно утверждение держится, а другое рухнуло. Оттуда выйдет второе правило курса: статус ставится утверждению, а не человеку.
Найдите вторую строку
Четыре показателя проекта, как их напечатал промежуточный отчёт, и пять внешних рядов, у каждого из которых свой источник, свои годы и своя единица. Пару составляете вы, а экран отвечает по трём подписанным признакам и на трёх парах из пяти отказывается сравнивать, называя причину. Числа только из работ, и паспорт ряда стоит рядом с числом.
Ключевые работы
| Clemens MA, Demombynes G, Journal of Development Effectiveness | 2011 | Сравнение оценок «до и после» из промежуточного отчёта проекта с оценками разности разностей, построенными по демографическим и медицинским обследованиям окружающих районов. Объём: три площадки (Саури в Кении, Бонсаасо в Гане, Пампаида в Нигерии) и девять показателей, периоды с 2005 по 2008 год для Кении и с 2006 по 2009 для Ганы и Нигерии. Дословный результат: оценки разности разностей, учитывающие динамику вне площадок, часто оказываются примерно вдвое меньше простых разностей «до и после» в Кении и Гане. Свою работу авторы строгой оценкой воздействия не называют и перечисляют пять причин: субъективный выбор площадок вмешательства, субъективный выбор сравнительных площадок, отсутствие исходных данных по сравнительным площадкам, малая выборка и короткий горизонт. Полный текст читан по рабочей версии Всемирного банка WPS5477 от ноября 2010 года. Журнальная версия закрыта. |
| Pronyk PM и др., The Lancet | 2012 | Нерандомизированная контролируемая оценка, как дизайн назвали сами авторы: сравнение с подобранными сравнительными площадками, анализ по протоколу. Объём: девять площадок в девяти странах, деревни в среднем по тридцать пять тысяч человек, три года после начала вложений 2006 года. Первичным исходом была смертность детей младше пяти лет: снижение на 22 процента к исходному уровню (25 смертей на тысячу живорождений, p = 0,015) и на 32 процента к сравнимым площадкам (30 на тысячу, p = 0,033). Судьба: две опубликованные поправки и два комментария, отзыва нет. Поправкой изъято сравнение с национальным сельским трендом (7,8 против 2,6 процента в год) как несопоставимое по периодам и добавлено, что до вмешательства смертность на площадках проекта была выше, чем в сравнительных деревнях (p = 0,020). Полный текст статьи и поправок закрыт, содержание поправки сверено по вторичному разбору. |
| Mitchell S и др., The Lancet Global Health | 2018 | Наблюдательная итоговая оценка, сделанная командой самого проекта: сравнительные деревни подобраны ретроспективно, уже после окончания проекта, обследование поперечное, 2015 год. Объём: десять площадок в десяти странах Африки к югу от Сахары, проект шёл десять лет с 2005 года, сорок показателей. Из сорока оценок тридцать значимы (95-процентные интервалы неопределённости не включают ноль) и в пользу проектных деревень. Значимого влияния на потребительские меры бедности нет, на индексе владения имуществом есть. По питанию и образованию выводы часто неопределённы. Треть заявленных целей достигнута. Полный текст по подписке, все числа из дословной аннотации. |
| Masset E, García-Hombrados J, Acharya A, Journal of Development Economics | 2020 | Независимая проспективная оценка одной ганской площадки. Замысел оценки опубликован заранее, отдельной работой 2013 года. Дизайн: сравнение разностью разностей на подобранных деревнях и домохозяйствах с подклассификацией по склонности к участию. Вывод авторов дословно: проект улучшил часть показателей Целей тысячелетия, но, за немногими исключениями, эффекты малы, а ключевые показатели благосостояния (денежная бедность, недоедание и детская смертность) не изменились. Перетоков на соседние районы и вытеснения расходов местных властей не обнаружено. Полного текста нет, аннотация взята из открытой копии. |
| Itad, Institute of Development Studies, Participatory Development Associates, брифинг об оценке проекта | 2018 | Проспективная смешанная оценка воздействия по заказу британского ведомства развития: статистически репрезентативное обследование плюс три продольных качественных исследования. Объём: более двух тысяч домохозяйств в 35 деревнях проекта и 68 сравнительных деревнях. Оценка шла с 2012 по 2017 год, а проект на площадке с 2012 по 2016-й. Исходами были 28 показателей Целей тысячелетия. Значимыми оказались семь показателей из 28, влияния на официальные показатели бедности и голода не обнаружено. Посещаемость начальной школы выросла на 7,7 процента, доля доучившихся не изменилась. Читан полный текст брифинга. |
Что подтвердилось, а что нет
Само учетверение верно: доля домохозяйств с мобильным телефоном на кенийской площадке выросла вчетверо за 2005-2008 годы, и число из промежуточного отчёта проекта никто не оспаривал. Отвергнуто приписывание: по демографическим и медицинским обследованиям владение телефонами в Кении и Гане росло на площадках проекта примерно так же, как в окружающих районах. Внешний ряд здесь качественный (авторы разбора записали его словами, а не величиной), поэтому точечной оценки остатка не существует и в этом уроке она не приводится.
Формулировка дословная и относится к трём площадкам (Саури в Кении, Бонсаасо в Гане, Пампаида в Нигерии) и девяти показателям за 2005-2008 и 2006-2009 годы. Интервала или стандартной ошибки у этой величины нет: «примерно вдвое» обобщает девять показателей, а не оценивает один параметр, и точечного значения авторы не приводят вовсе. Это половина результата по мерке курса, и вторую половину здесь взять неоткуда. «Вдвое меньше» при этом не значит «ноль». Свою работу авторы строгой оценкой воздействия не называют и перечисляют пять причин: субъективный выбор площадок вмешательства, субъективный выбор сравнительных площадок, отсутствие исходных данных по сравнительным площадкам, малую выборку и короткий горизонт.
Проект отчитался о росте с 1,9 до 5,0 тонны с гектара в Саури за 2005-2008 годы. По панельному обследованию института Tegemeo урожайность кукурузы в Западных низменностях Кении вне площадки за 2004-2007 годы выросла более чем вдвое, причём вне площадки примерно вдвое выросло и применение удобрений, и доля высокоурожайных сортов. Остаток проекту получается не точкой, а границей (меньше чем в 1,3 раза), потому что внешняя динамика задана словами и годы сдвинуты. С другой стороны, исходный уровень Саури для региона был необычно высок: та же панель даёт по Западным низменностям около 1,25 тонны с гектара даже в 2007 году. Какое из двух объяснений весит больше, из этих чисел не видно.
Термины
- сравнение до и послеbefore-and-after comparison
- Сравнение показателя на одной и той же площадке в двух точках времени, без второй группы. Даёт верное описание того, что там произошло, и молчит о причине: за срок наблюдения меняются цены, погода, техника и чужие программы. Чтобы прочесть такую разность как эффект, нужно допущение, что без программы не изменилось бы ничего.
- разность разностейdifference-in-differences
- Изменение показателя на площадке минус изменение того же показателя за тот же срок там, где программы не было. Остаток относят к программе. Держится это на допущении, что без программы площадка двинулась бы туда же, куда двинулось окружение. Когда внешняя динамика задана словами, а не числом, результат вычитания тоже не число, а неравенство.
- контрфактическое состояниеcounterfactual
- То, что случилось бы с теми же людьми и в том же месте без программы. Наблюдать его нельзя ни при каком бюджете: история идёт в одном экземпляре. Оценка воздействия целиком состоит из попыток подставить вместо него что-то наблюдаемое: контрольную группу, соседний район, ряд регулярного обследования.
- группа сравненияcomparison group
- Те, кого программа не коснулась, взятые для того, чтобы увидеть, куда показатель двигался сам по себе. Если состав такой группы не разыгран жребием, совпадение с участниками ничем не гарантировано, и проверять его приходится по исходному уровню самого исхода.
- исходoutcome
- Величина, изменение которой объявлено предметом измерения. Подмена случается чаще всего именно здесь: распространённость малярии у всех возрастов и доля детей с лихорадкой за две недели это разные исходы, и одно вместо другого подставлять нельзя.
- демографическое и медицинское обследованиеDemographic and Health Survey
- Регулярный опрос национальной выборки домохозяйств о составе семьи, имуществе, здоровье и смертности детей, проводимый независимо от отдельных программ. Ценен как внешний ряд именно этой независимостью. Ограничен тем, что его вопросы, годы и окна наблюдения свои, а не подогнанные под чужой отчёт.
- опубликованная поправкаpublished erratum
- Отдельный документ журнала, которым авторы или редакция меняют содержание уже вышедшей статьи. От отзыва отличается тем, что статья остаётся в силе: правится её часть (число, формулировка, вывод), а остальное продолжает действовать. В базах данных поправка и отзыв помечаются по-разному, и путать их нельзя.
- ретроспективный подбор сравненияretrospective selection of comparison sites
- Выбор сравнительных площадок после того, как программа закончилась и результаты стали известны. От подбора заранее отличается тем, что знание об исходе успевает попасть в решение, с чем сравнивать. Насколько это сдвигает оценку в конкретном случае, само по себе требует отдельного измерения.
Практикум · Найти вторую строку в одном сообщении
Полчаса и одно сообщение о результате какой-нибудь программы: школьной, городской, корпоративной, любой. Считать ничего не придётся, и решать судьбу программы тоже не придётся: цель в том, чтобы увидеть, есть ли в сообщении вторая строка и из чего её можно было бы собрать.
- Выпишите заявленный результат дословно, вместе с единицей и со сроком. Если срок не назван, отметьте это отдельно: без срока сообщение не сравнимо ни с чем.
- Найдите в тексте вторую величину: изменение того же показателя там, где программы не было. Если её нет, запишите прямо: сравнение сделано с собой прежним.
- Проверьте, что именно названо исходом. Часто в заголовке стоит одно, а измерено другое: присутствие вместо умения, обращение вместо заболевания, охват вместо результата.
- Попробуйте подобрать внешний ряд сами: любой независимый источник по тому же показателю. Сверьте три вещи: тот же ли исход, те же ли годы, та же ли единица. Несовпадение хотя бы по одной записывайте как отказ.
- Напишите две фразы: чему равна разность у автора сообщения и что осталось бы от неё после вычитания внешнего ряда. Если вторую фразу написать не из чего, это и есть результат упражнения.
Вопросы для самопроверки
Проект отчитался, что владение мобильными телефонами на кенийской площадке выросло вчетверо. Что показала проверка по обследованиям вокруг площадки?
- Рост на площадках в Кении и Гане был примерно таким же, как в окружающих районах
- Число в отчёте оказалось завышено: на самом деле рост был меньше, чем вчетверо
- Проверить было нечем: обследования о владении телефоном не спрашивают
- Вокруг площадок телефонов стало меньше, так что эффект оказался даже больше заявленного
На каком допущении держится чтение разности «после минус до» как эффекта программы?
- Что участники и не-участники изначально не различались ни по одному признаку
- Что программа охватила не меньше половины тех, кому предназначалась
- Что без программы показатель остался бы прежним
- Что измерение до и после делали одним и тем же прибором и в одной и той же единице
Проект показал падение распространённости малярии среди всех возрастов с 50 до 8 процентов. Обследования вокруг дают долю детей до пяти лет с лихорадкой за две недели. Почему эту пару отклоняют?
- Потому что у обследований другая единица измерения: доли там считаются от совсем другого основания
- Потому что это другой исход: лихорадка у ребёнка и распространённость малярии не одно и то же
- Потому что обследование охватывает всю страну, а площадка одну местность
- Потому что данные обследований собраны заметно позже, чем закончился первый этап проекта
Авторы разбора пишут, что оценки разности разностей часто оказываются примерно вдвое меньше простых разностей «до и после». Как это читать?
- Эффекта у проекта не нашли: после учёта внешней динамики от него не осталось ничего
- Метод разности разностей систематически занижает эффект вдвое, и это его известное свойство
- Обе оценки одинаково пригодны, а разница между ними случайна
- Часть изменения остаётся за площадкой, а часть объясняется общим движением вокруг
Что произошло со статьёй проекта о детской смертности после публикации?
- Журнал отозвал её после того, как независимая проверка не подтвердила первичные данные
- Формальных событий не было: критика осталась в блогах и до страниц журнала не дошла
- Вышли две поправки и два комментария, отзыва не было, а сравнение с национальным трендом из статьи изъяли
- Авторы выпустили расширенную версию, добавив к разбору сравнительные площадки других стран
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Clemens MA, Demombynes G. «When does rigorous impact evaluation make a difference? The case of the Millennium Villages». World Bank Policy Research Working Paper 5477, ноябрь 2010. Журнальная версия вышла в Journal of Development Effectiveness, 2011, 3(3):305-339: Рабочая версия открыта целиком, журнальная закрыта. Главную фразу ищите не в выводах, а в аннотации: там сказано, что ни один из двух подходов строгой оценкой воздействия не является, и тут же перечислены пять причин. Таблицы по девяти показателям идут с внешними рядами в соседних столбцах. Это готовый образец того, как выглядит вторая строка.
- Pronyk PM и др. «The effect of an integrated multisector model for achieving the Millennium Development Goals and improving child survival in rural sub-Saharan Africa: a non-randomised controlled assessment». The Lancet, 2012, 379(9832):2179-2188: Полный текст закрыт, издатель отдаёт отказ. В открытом доступе есть дословная аннотация с обоими числами по детской смертности. Читать стоит подпись к дизайну: слова «non-randomised» и «per-protocol» стоят в самом заголовке и в описании анализа. Обе поправки к статье тоже закрыты, и это стоит знать заранее.
- Mitchell S и др. «The Millennium Villages Project: a retrospective, observational, endline evaluation». The Lancet Global Health, 2018, 6(5):e500-e513: Полный текст по подписке, аннотация открыта и несёт главное. Строка про отсутствие значимого влияния на потребительские меры бедности стоит в середине аннотации, после перечисления тридцати значимых оценок из сорока: в пересказах она теряется первой.
- Itad, Institute of Development Studies, Participatory Development Associates. «The Millennium Villages Project and the MDGs: what did it achieve?» MVP Briefing paper № 1, июль 2018: Открытый PDF, читается за полчаса. Смотреть надо разбор по целям: там видно, какие именно семь показателей из 28 сдвинулись и какие нет. В конце оценщики сами ограничивают свой прибор: показатели Целей тысячелетия названы лишь одним из способов смотреть на проект.
- Gelman A, Mitchell S, Sachs J, Sachs S. «Reconciling Evaluations of the Millennium Villages Project». Statistics and Public Policy, 2022, 9(1):1-7: Открытый доступ. Ценна как образец жанра «почему две оценки разошлись»: объяснение через длительность и число площадок предложено участниками проекта и проверке не подвергалось. Разницу в способе подбора сравнительных деревень аннотация не называет вовсе, и это заметно при чтении рядом с двумя предыдущими записями.