Доказательная политика: итоги курса
Реестр целиком, шесть вопросов к любому заявлению об эффекте программы и почему длинный список опровергнутого не приговор области
Доказательная политика начинается с шести вопросов к любому заявлению об эффекте программы, и последний урок их собирает. С чем сравнивали, на ком и что мерили, кому предложили и кто взял, что показывает интервал, сколько исходов проверили, кто исполнял и в каком масштабе. Реестр курса из 94 проверяемых утверждений: 26 выдержали, 29 отвергнуты, 18 мифы пересказов, у девяти нет источника, восемь спорны, четыре сильно ослаблены. Складывать пометки в общее «не работает» нельзя: каждая отвечает на свой вопрос.
Banerjee & Duflo 2009, Annual Review of Economics · Deaton & Cartwright 2018 · научная справка Комитета по премии памяти Нобеля, 2019 · 28 мин · обновлено 01.10.2026
После урока вы сможете
- Проходить по шести вопросам к любому заявлению об эффекте программы и называть родительский урок каждого
- Различать четыре пометки реестра, которые в пересказах слипаются в общее «не работает», и не складывать их между собой
- Называть три места курса, где спор открыт по-настоящему, и говорить, в чём именно расходятся процедуры
- Отличать внутреннюю валидность от внешней и объяснять, почему вторая описывает применение, а не исполнение
- Читать «источника нет» как отдельную новость: проверять было нечего, а не проверили и не подтвердилось
В заключении обзора, вышедшего в 2009 году, стоит фраза о согласии с критиком. Дословно: авторы полностью согласны с главным пунктом Хекмана. Чтобы быть интересными, эксперименты должны быть амбициозными и опираться на теорию. Написали это Абхиджит Банерджи и Эстер Дюфло за десять лет до премии. Тезис, с которым они согласились, напечатан в 1992 году и принадлежит не им.
За двадцать четыре урока курс собрал реестр из 94 проверяемых утверждений. Двадцать шесть из них проверку выдержали: 27,7 %, больше четверти. Сказать это лучше прямо, чем оставить читателю складывать самому: курс получился не разоблачительным.
Отвергнутых при этом 29, то есть больше, чем выдержавших. Ещё 18 позиций помечены мифом, девять «источника нет», восемь «спор открыт», четыре «сильно ослаблено». Все шесть чисел посчитаны по файлам уроков, а не взяты из плана. Складывать эти пометки между собой нельзя, и ниже сказано почему.
Этот урок: карта, а не пересказ. Он показывает, что курс установил, что опроверг и что оставил спорным. И называет, где что искать: держать двадцать три урока в голове целиком незачем.
Шесть вопросов к заявлению об эффекте программы
Список собирался по ходу курса, а не по одному вопросу на модуль. Пять вопросов из шести родились в первых трёх модулях, шестой родился в пятом и восьмом. Все шесть дешёвые: ни один не требует счёта, и на каждый отвечают чтением. Порядок не случаен: первый отсеивает больше всего.
1. С чем сравнивали, с собой прежним или с группой сравнения? (урок 1)
2. На ком мерили, сколько их было, сколько длилось и что считали исходом? (урок 3)
3. Кому предложили и кто взял, и от какого знаменателя доля? (урок 7)
4. Что показывает интервал: точный ноль или отсутствие прибора? (урок 6)
5. Сколько исходов проверили и что было записано заранее? (урок 9)
6. Кто исполнял, в каком масштабе и что мешает перенести? (уроки 15 и 22)
Первый вопрос отсеивает больше прочих, потому что второй строки в сообщении чаще всего нет вовсе. Тогда перед читателем календарь, а не эффект, и дальше можно не искать. Второй ловит подмену исхода, и подменяют его постоянно: присутствие тела вместо умения, факт внесения удобрения вместо урожая, покупку полиса вместо пережитого плохого года.
У соседнего курса экономики есть свои шесть вопросов, и они о другом. Там читают сообщение об эксперименте, то есть эксперимент уже предполагается. Здесь читают заявление об эффекте программы, в том числе такое, за которым эксперимента нет вовсе. И последний вопрос соседей: во что обошлась единица результата, чтобы можно было сравнить две программы. У нас такого вопроса нет, и не по забывчивости: сравнение программ не измерение, а решение.
Что курс установил
Двадцать шесть позиций реестра помечены «выдержало», и это не мелочи на полях. Проверяли их всерьёз: повторением на тех же данных, репликацией по другим правилам или независимой командой. Три величины стоит выписать целиком.
Противоглистные таблетки убивают глистов. У аскариды доля умеренной инвазии составила 23,6 % в очереди, до которой программа ещё не дошла, против 7,8 % в пролеченной, у анкилостомы 7,8 против 1,8. Считано на 1 233 и 746 учениках 75 школ округа Бусиа через год после начала раздачи. Урок 10.
Внешний эффект той же программы на заражённость в радиусе до трёх километров устоял после исправления кода: было −0,26 (СО 0,09), стало −0,21 (СО 0,10). Мерили умеренно-тяжёлую заражённость гельминтами у детей тех же 75 школ за 2 года. Признают это обе стороны спора, и такое согласие в курсе редкость. Урок 11.
Микрокредит поднял прибыль у семей, которые вели дело до прихода кредитора. В Хайдарабаде это +2 105 рупий 2007 года в месяц со стандартной ошибкой 1 100 при контрольном среднем 2 038, на 1 624 наблюдениях через пятнадцать-восемнадцать месяцев после открытия отделения. У домохозяйств без прежнего дела эффект на прибыль почти в точности нулевой на каждой площадке. Урок 16.
Дальше короче, потому что величины стоят в своих уроках. Кластерное распределение режет мощность испытания, и режет сильно. Момент уплаты страховой премии двигает спрос сильнее её размера. Заём в голодный сезон поднимает деревенскую оплату труда. Большой толчок из шести частей дал устойчивый рост потребления, и через год после конца программы прибавка держалась. А мытьё рук с мылом и улучшенная санитария в сельском Бангладеш снизили диарею у детей: это разобрано прозой одиннадцатого урока, а не строкой реестра.
Отдельно стоит вещь, которую тридцать лет никто не искал. У заёмщиков микрокредита расходы на алкоголь и табак не выросли, и это самое устойчивое, что нашлось в разделе о деньгах: пять испытаний, десять показателей, а в объединении семи работ у этого исхода обе величины p равны нулю до первого знака. У получателей денежных переводов знак тот же, а сила утверждения меньше. Свод сорока четырёх оценок даёт 82 % отрицательных, но прибор там не поймал бы роста меньше чем на 44 % контрольного среднего по алкоголю. Мерили доход и прибыль, а установили это.
Четыре разных способа не подтвердиться
Опровержений в курсе больше, чем подтверждений, и разбирать это надо, а не сглаживать. Отвергнутых позиций 29. Но «отвергнуто» лишь одна из четырёх пометок, которые в пересказах слипаются в общее «не работает».
Первый род: число не воспроизвелось. Совокупная прибавка школьной посещаемости была 7,5 п. п. (СО 2,7), а после повторения теми же методами на тех же данных стала 3,9 п. п. (СО 3,2). Считано на тех же 75 школах округа Бусиа за 2 года, и исход тот же: присутствие ребёнка в школе при внезапном визите. Урок 11.
Второй род: отвергнуто приписывание, а не число. Владение мобильными телефонами на кенийской площадке действительно выросло вчетверо за 2005-2008 годы, и этого никто не оспаривал. Не подтвердилось другое: что рост дал проект. Вокруг телефоны появлялись теми же темпами. Урок 1.
Третий род: миф, и таких позиций 18. Миф означает, что поле этого не утверждало, а так говорят пересказы и пособия. Запись в реестре Американской экономической ассоциации не значит, что план анализа зафиксирован до сбора данных. Дегельминтизация не улучшает успеваемость, и на этом сходятся все стороны спора.
Четвёртый род: «источника нет», девять позиций. Здесь ничего не проверяли, потому что проверять было нечего: работы, из которой взято число, не находится. Это другая новость, и путать её с опровержением нельзя.
Соблазн сложить 29 «отвергнуто», 18 «мифов» и 4 «сильно ослаблено» и объявить 51 опровержение велик, а число выйдет неверным. Проверили как следует и не подтвердилось: только у 29 позиций. Миф стоит там, где утверждения не делали вовсе: его сочинили пересказы, и опровергать в нём нечего. А «сильно ослаблено» значит, что в сильной форме утверждение неверно, но осторожная версия с названными оговорками жива, то есть ядро уцелело. Складывать можно однородное, и однородны здесь только эти 29.
Кто нашёл ошибки
Расхожая картина спора такая: практики защищают метод, а критики нападают снаружи. Проверяется она документами, и документы говорят другое. Главный пункт критика 1992 года принят в печати в 2009 году, той самой фразой, с которой начался урок.
Провалы в Бихаре и Уттаракханде напечатаны самими авторами программы. Таблица там устроена так, что провал виден с первого взгляда: обучение прошли 84,4 % учителей, материалами пользовались в 62,5 % классов, а группировать детей по уровню стали в 3,8 %. Третий столбец и есть программа, а первые два то, что к ней прилагается. Урок 14.
Комитет по премии называет результаты двух этих испытаний «largely disappointing», в собственном документе, вышедшем в день объявления премии. Там же, сноской на двадцатой странице, зафиксирована ошибка в коде флагманской работы одного из лауреатов. Ошибку нашли не разоблачители со стороны: данные и файлы анализа отдали сами авторы, а перепроверку напечатал рецензируемый журнал.
И симметричная строка, которая обычно теряется. Репликаторы между электронной и печатной публикацией нашли собственные числовые ошибки в четырёх своих таблицах и в приложении, перечислили их поимённо и извинились. Ни одна работа этого курса не отозвана и ни в какой подделке не уличена.
Система «отозвано / исправлено» ловит не всякое событие, и в двух дисциплинах она работает по-разному. У ланцетовской статьи проекта тысячелетия две опубликованные поправки и два комментария, у аудита литературы о дефиците в PNAS вышла опубликованная поправка. Читатель видит их прямо в метаданных. У кенийской дегельминтизации формального исправления нет до сих пор, хотя ошибку в коде признал официальный документ комитета. У работы о помощи и росте результат сняли печатным комментарием в том же журнале, и в метаданных самой статьи об этом тоже ничего нет. В экономике исправление такого рода живёт отдельной статьёй, а не полем журнала, и потому по метаданным судьбу работы здесь не прочтёшь.
Внешняя валидность: не улика против жребия
Второй расхожий тезис: перенос результата считают слабостью, свойственной именно рандомизированным испытаниям. Отвергают его словами самих критиков метода.
Дитон пишет дословно: отсутствие внешней валидности не упрёк, который следует предъявлять исследованию. И добавляет, что вместе с Картрайт старается вовсе не пользоваться этим термином. Причина у него предметная: внешняя валидность это свойство применения, а не исполнения. Безупречно сделанная работа может не переноситься, и плохой её это не делает.
Официальная сторона печатает то же самое. Сноска 19 научной справки комитета говорит, что помимо возможного смещения рандомизации эти опасения о внешней валидности не специфичны для экспериментальной работы. В аннотации обзора 2009 года формулировка близкая: опасения реальны, но часто не специфичны для экспериментов.
Специфично для эксперимента ровно одно, смещение рандомизации: согласившиеся участвовать отличаются от тех, кто не согласился. Его признают обе стороны. Всё остальное: общая беда любой эмпирики, включая те наблюдательные работы, которые испытаниям иногда предлагают предпочесть.
И часть того, что выглядит как всевластие контекста, при измерении оказалась шумом. Это не одно исследование, а свод: 126 испытаний двух ведомственных групп и опубликованных работ того же рода, с охватом больше 23 миллионов человек. В журналах средний эффект 8,7 п. п., у ведомств 1,4 п. п., и разрыв объясняется мощностью и публикационным отбором целиком. В объединении семи испытаний микрокредита около 60 % разброса между странами: обычная выборочная изменчивость. Свод оценок воздействия 2020 года отвечает на близкий вопрос иначе и находит разброс большим, а выбрать между двумя ответами базе курса нечем. Уроки 22 и 16.
Две валидности привычно ставят рядом как две галочки одного списка, и обе стороны спора против этого возражают. Внутренняя валидность описывает само испытание: относится ли найденная разница к вмешательству в этой выборке. Внешняя описывает применение: годится ли этот результат для того места, о котором думает читатель. Одно и то же испытание бывает пригодно в одном месте и непригодно в другом, не меняясь ни на строчку. Поэтому спрашивать надо не «есть ли внешняя валидность», а чем новое место отличается от старого: ценой, заражённостью, исполнителем, масштабом.
Три места, где спор открыт по-настоящему
Восемь позиций реестра помечены «спор открыт». Три из них стоит назвать поимённо: там расходится не арифметика, а объявленные процедуры, и разрешить расхождение сегодня нечем.
Первое: прибавка веса у детей от массовой раздачи противоглистных таблеток. Кокрейновский обзор после пост-хок-исключения испытаний старше 2000 года даёт 0,02 кг при интервале от 0,04 кг потери до 0,08 кг прироста. Ответ 2024 года делит работы по бремени инвазии, и там, где заражено больше 20 %, выходит 0,15 кг (от 0,07 до 0,24). Обе процедуры объявлены, и спор идёт о правиле включения. Урок 11.
Второе: знак перетоков у безусловных денежных переводов. В 60 лечебных деревнях, где жребий бросали внутри деревни, у соседа получателя потребление через три года ниже на 30 долларов ППС в год. В 653 деревнях, где разыгрывали деревню и подлокацию, у неполучателя расходы через 18 месяцев выше на 333,73 доллара ППС в год при стандартной ошибке 123,24. Сроком расхождение не объясняется: в первой работе знак один и тот же на девятом месяце и на третьем году. Урок 17.
Третье касается того, что лучше для решения: смещённая оценка из своего места или несмещённая из чужого. Печатная вилка ставит вопрос по среднеквадратичной ошибке и показывает, что своды доказательств молча предполагают постоянство эффекта и изменчивость отбора. Обратное допущение так же не доказано и ведёт к противоположному выводу. Ответа по существу база курса не нашла, а отсутствие ответа не равно согласию. Урок 13.
Ответ напечатан, но не на всё
Есть у критики часть, которая не про перенос вовсе, а про статистический вывод. Пунктов там три, и третий читатель уже видел в деле.
Первый: при разных дисперсиях в группах статистика не имеет распределения Стьюдента, и отвержений выходит больше положенного. Второй: при несимметричном распределении эффектов обычная проверка ломается, и авторы разбора показали это собственной симуляцией, где при истинном нуле в популяции нуль отвергался от 14 % случаев при выборке в 25 человек до 6 % при 500. Третий: обрезка крайних значений чинит симметрию и рушит то, ради чего считали, потому что в оценке программы дело решают именно крайние значения.
Третий пункт курс уже показывал числом. У работы, на которой стояла заявка микрокредита, результат по сокращению бедности исчезает при удалении шестнадцати наблюдений с наибольшим потреблением: это 14 домохозяйств и 0,4 % выборки из 1 798. Урок 16.
Ответ на разбираемую статью существует и напечатан. Он вышел в том же номере журнала, на страницах 50-52, и был одним из восемнадцати комментариев к ней. Полного текста этой заметки база курса не добыла, аннотации у неё нет вовсе, и потому урок говорит только, что ответ есть и где он лежит.
А в Нобелевских лекциях и в научной справке комитета ответа на эти три пункта нет. Лекция отвечает на другое: на изображение метода соломенным чучелом и на тезис, будто вывод делают по одному испытанию. Оба ответа по существу, и оба не про статистику. Поэтому позиция реестра помечена «спор открыт».
Оборот, у которого нет автора
Самая известная фраза этого спора в него не входит. «Рандомисты знают цену всему и ценность ничему»: оборот, который приписывают критикам метода. Печатного применения его к рандомистам нет: поиск шёл по полным текстам четырёх работ, и вхождений ноль.
Принадлежит оборот Оскару Уайльду: так в «Веере леди Уиндермир» определён циник. Рядом лежит близкий по смыслу тезис, у которого автор есть: выяснить, что работает, не то же самое, что выяснить, что желательно. На нём стоит первое правило курса, и проверить его можно по печатному тексту, в отличие от красивой фразы.
Таких чисел и оборотов в курсе девять. Триллионы, которые Запад потратил на помощь за полвека. Сотни миллионов людей, охваченных испытаниями одной организации. Мощность типичного испытания около половины. Пять процентов заёмщиков, ежегодно поднимающихся выше черты бедности. У всех девяти общее одно: работы, из которой их можно взять, не находится.
И одно наблюдение о самой сборке курса. Ни одно из противоречий, найденных при сверке источников, не касалось направления вывода. Все расхождения были в величинах, единицах, версиях работ и знаменателях долей. Это тоже результат, и он про поле, а не про отдельную статью.
Измерены в этом курсе исходы у людей в конкретных местах: присутствие в школе у детей 75 школ округа Бусиа за 2 года, потребление и прибыль у 6 862 домохозяйств Хайдарабада через пятнадцать-восемнадцать месяцев, потребление у 10 495 домохозяйств шести стран за три года, и так по каждому уроку. Реестр из 94 строк только сводит, что с этими утверждениями стало при проверке. Отсюда не следует ни одна раскладка чужого бюджета, потому что решение требует того, чего в реестре нет по устройству. Цен и институтов того места, куда переносят. Того, от чего ради этой траты откажутся. И порядка предпочтений: реестр говорит, что установлено, и молчит о том, что важно, а решающий отвечает как раз на второй вопрос. Принимают такие решения те, кто распоряжается этими деньгами, кто отвечает за исполнение, и те, для кого программа делается. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.
Чем кончается курс
Три правила поставлены в первых трёх уроках и дальше не менялись. Спрашивать, с чем сравнивали. Смотреть, какому утверждению ставится оценка, не человеку, не организации, не программе. И требовать рядом с величиной четыре строки паспорта: на ком, сколько их, сколько длилось, что было исходом.
Реестр из 94 строк: карта, а не приговор области. Двадцать шесть утверждений проверку выдержали, 29 не подтвердились, 18 оказались мифами пересказов, у девяти не нашлось источника, восемь остались спорными, четыре сильно ослаблены. Каждая строка отвечает на свой вопрос, и в этом вся польза сводной страницы: она показывает, где что искать, а общего итога не выносит.
Кончается курс там же, где начинался: на второй строке. Сообщение о результате программы почти всегда несёт первую: было столько, стало столько. Вторая: что происходило там, где программы не было. Пока её нет, читать нечего, сколько бы цифр ни стояло рядом.
Ключевые работы
| Banerjee AV, Duflo E, обзор экспериментального подхода в экономике развития, Annual Review of Economics | 2009 | Обзор литературы и ответ на критику 2008-2009 годов. Собственных измерений на людях в нём нет. Читана рабочая версия NBER WP 14467 от ноября 2008 года целиком. В заключении напечатано согласие с главным пунктом Хекмана 1992 года: чтобы быть интересными, эксперименты должны быть амбициозными и опираться на теорию. В аннотации авторы пишут, что высказанные опасения реальны, но часто не специфичны для экспериментов, а главным достоинством метода называют возможность оценить параметры, которые иначе оценить нельзя. |
| Deaton A, «Randomization in the Tropics Revisited», рабочий документ NBER 27600 | 2020 | Методологическое эссе о рандомизированных испытаниях, июль 2020 года. Измерений на людях в нём нет, а числа: цитаты чужих работ. Полный текст прочитан. Отсюда взята дословная формулировка о том, что отсутствие внешней валидности не упрёк, который следует предъявлять исследованию, и что автор вместе с Картрайт старается не пользоваться этим термином. В сноске 1 заблуждения о жребии приписаны обеим сторонам спора. Эта же работа входит в число четырёх, по полным текстам которых искали оборот про цену и ценность. |
| Комитет по премии по экономическим наукам памяти Альфреда Нобеля, научная справка «Understanding Development and Poverty Alleviation» | 2019 | Официальный документ на 34 страницы, вышедший 14 октября 2019 года в день объявления премии. Собственных измерений в нём нет, числа: цитаты чужих работ. Отсюда взяты три строки: сноска на двадцатой странице, фиксирующая ошибку в коде флагманской работы одного из лауреатов. Сноска 19 о том, что опасения по внешней валидности не специфичны для экспериментальной работы, помимо возможного смещения рандомизации. И слова «largely disappointing» о двух испытаниях в государственной школьной системе. |
| Imbens G, комментарий к работе Дитона и Картрайт, Social Science & Medicine | 2018 | Печатный ответ на разбираемую статью, напечатанный в том же номере журнала на страницах 50-52 и входящий в число восемнадцати комментариев к ней. Полного текста база курса не добыла, аннотации у заметки нет вовсе, и потому в урок идёт только факт существования ответа и место его публикации. Содержание ответа урок не пересказывает. Именно поэтому позиция реестра о статистических пунктах критики помечена «спор открыт». |
| Deaton A, Cartwright N, Social Science & Medicine | 2018 | Обзорно-методологическая работа о том, что рандомизация делает и чего не делает. Собственных измерений на людях в ней нет, числа: цитаты чужих работ и один численный опыт авторов. Двадцать страниц, открытая копия PMC6019115. Отсюда взяты три статистических пункта критики: распределение статистики при разных дисперсиях, поломка проверки при несимметричном распределении эффектов и обрезка крайних значений. Собственная симуляция авторов даёт от 14 % отвержений при выборке в 25 человек до 6 % при 500. Судьба: восемнадцать комментариев в том же номере. |
| Banerjee A, Banerji R, Berry J и др., пять испытаний обучения на своём уровне, Journal of Economic Perspectives | 2017 | Разбор пяти рандомизированных испытаний одной школьной программы в государственной системе Индии, напечатанный самими авторами программы. Читан препринт MIT от сентября 2017 года. Отсюда взята таблица процессных данных по бихарской ветви: обучение прошли 84,4 % учителей, материалами пользовались в 62,5 % классов, а группировать детей по уровню стали в 3,8 %. Провал доставки описан авторами программы, а не найден критиками. |
Что подтвердилось, а что нет
Отвергнуто печатными документами обеих сторон. Главный пункт критики 1992 года принят дословно в обзоре 2009 года. Авторы пишут, что полностью согласны: чтобы быть интересными, эксперименты должны быть амбициозными и опираться на теорию. Провал двух испытаний в Бихаре и Уттаракханде напечатан самими авторами программы, вместе с таблицей, где обучение прошли 84,4 % учителей, материалами пользовались в 62,5 % классов, а по уровню группировали в 3,8 %. Научная справка комитета по премии называет тот результат «largely disappointing» и сноской на двадцатой странице фиксирует ошибку в коде флагманской работы. Данные для перепроверки отдали сами авторы этой работы.
Отвергнуто словами самих критиков. Дитон в эссе 2020 года пишет дословно: отсутствие внешней валидности не упрёк, который следует предъявлять исследованию. Он же добавляет, что старается вовсе не пользоваться этим термином, потому что речь о применении результата, а не об исполнении работы. Сноска 19 научной справки комитета 2019 года говорит то же: помимо возможного смещения рандомизации, эти опасения о внешней валидности не специфичны для экспериментальной работы. Обзор 2009 года формулирует близко: опасения реальны, но часто не специфичны для экспериментов. Единственный признанный обеими сторонами специфичный пункт: смещение рандомизации, то есть отличие согласившихся участвовать от прочих.
Речь о трёх пунктах: распределение статистики при разных дисперсиях в группах, поломка проверки при несимметричном распределении эффектов и обрезка крайних значений, которая рушит оценку программы. Ответ на разбираемую статью напечатан в том же номере журнала, на страницах 50-52, одним из восемнадцати комментариев к ней. Полного текста этой заметки база курса не добыла, а аннотации у неё нет вовсе. В Нобелевских лекциях и в научной справке комитета ответа на эти три пункта нет: лекция отвечает на изображение метода соломенным чучелом и на тезис о выводе по одному испытанию. Поэтому сказать, что ответ по существу дан, нельзя, а сказать, что его нет, тоже.
Оборот ходит по пересказам спора как цитата из критиков метода. Поиск шёл по полным текстам четырёх работ: эссе Дитона 2020 года, работы Равальона 2020 года, работы Притчетта 2019 года и статьи Дитона и Картрайт 2018 года. Вхождений «price of everything» и «value of nothing» ноль. Принадлежит оборот Оскару Уайльду: так в «Веере леди Уиндермир» определён циник. Это не «проверили и не подтвердилось»: печатного применения, которое можно было бы проверить, не существует. Близкий по смыслу и проверяемый тезис у Дитона другой: выяснить, что работает, не то же самое, что выяснить, что желательно.
Термины
- внутренняя валидностьinternal validity
- Свойство самого испытания: относится ли найденная разница в исходах к вмешательству именно у тех людей, на которых мерили. Это утверждение о выборке испытания и ни о ком другом. С переносом результата в другое место она не связана и заменить его обоснование не может.
- внешняя валидностьexternal validity
- Свойство результата переноситься на другое место, время или другого исполнителя. Это не «применимость вообще». Чтобы говорить о ней предметно, надо назвать, чем именно новая площадка отличается от старой: ценой, размером вмешательства, условиями доступа, тем, кто исполняет. Названное отличие можно проверить, общая ссылка на нехватку данных его не заменяет.
- смещение рандомизацииrandomization bias
- Отличие людей, согласившихся участвовать в испытании, от тех, кто участвовать не согласился или кого не спрашивали. Единственная трудность переноса, специфичная именно для эксперимента: она возникает оттого, что испытание надо кому-то предложить. Признаётся обеими сторонами спора о методе.
- магическое мышление о методеmagical thinking about RCTs
- Убеждение, что случайное распределение само по себе делает вывод верным и снимает нужду в теории, механизме и внешнем свидетельстве. Оборот принадлежит Дитону и Картрайт, и они же оговаривают, что спорят именно с ним, а не с испытаниями.
- достоверность свидетельстваcertainty of evidence
- Пометка, которую свод работ ставит рядом с найденной величиной: насколько можно полагаться на неё саму, а не на её размер. Очень низкая достоверность при широком интервале означает «мы не знаем», а не «эффекта нет», и различает эти два ответа именно она, а не интонация.
- судьба работыpost-publication record
- Что случилось со статьёй после выхода: реплицирована, переанализирована, исправлена, оспорена, получила печатный ответ, или ответа не получила. Называется вместе с работой, потому что отсутствие ответа не равно согласию. В экономике эта судьба часто не видна в метаданных статьи и живёт отдельными публикациями в других журналах.
- число без первоисточникаzombie statistic
- Величина, которая ходит по пересказам, отчётам и пресс-релизам, а работы, из которой её можно взять, не находится. От опровергнутого числа отличается тем, что проверять было нечего: проверка не проводилась и провести её не на чем. Ставить такое число рядом с проверенным нельзя даже с оговоркой.
- проверяемое утверждениеtestable claim
- Предложение с глаголом, для которого можно назвать наблюдение, способное его не подтвердить: кого мерить, чем и что считать несовпадением. Именно ему, а не человеку, организации или программе, ставится оценка: у человека и у программы истинностного значения нет.
Практикум · Разобрать одно заявление по шести вопросам
Час и одно сообщение об эффекте какой-нибудь программы: школьной, городской, благотворительной, любой. Считать ничего не придётся, и решать судьбу программы тоже не придётся. Задача в том, чтобы пройти шестью вопросами по порядку и увидеть, на каком из них сообщение кончается.
- Выпишите заявленный результат дословно, с единицей и со сроком. Рядом отметьте, есть ли в сообщении вторая величина: то, что происходило там, где программы не было. Если её нет, дальше идти не обязательно: перед вами календарь, а не эффект.
- Найдите четыре строки паспорта: на ком мерили, сколько их было, сколько длилось наблюдение и что именно названо исходом. Четвёртую проверьте отдельно и придирчиво: в заголовке часто стоит одно, а измерено другое.
- Найдите долю тех, кто программу получил, и от чего эта доля считана. Если знаменатель не назван, запишите это отдельной строкой: без него доля ничего не значит и вычитать её из другой доли нельзя.
- Найдите интервал или стандартную ошибку и посмотрите, что осталось внутри. Назовите величину, ради которой программу затевали, и проверьте, лежит ли она за краем интервала. Если краёв в сообщении нет, значит, половина результата не напечатана.
- Сверьте, сколько исходов проверяли и что было объявлено заранее, и посмотрите, кто исполнял программу и в каком масштабе. В конце напишите одну фразу: на каком из шести вопросов сообщение перестало отвечать.
Вопросы для самопроверки
Читатель складывает 29 позиций «отвергнуто», 18 «мифов» и 4 «сильно ослаблено» и говорит, что курс опроверг 51 утверждение. Что здесь неверно?
- Ничего: все три пометки означают, что утверждение проверили и оно не подтвердилось
- Пометки отвечают на разные вопросы: миф значит, что такого поле не утверждало, а при радикальном ослаблении уцелела осторожная версия
- Неверна арифметика: таких позиций в реестре 47, а не 51
- Складывать нельзя, потому что позиции относятся к разным урокам и разным программам
«Испытание сделано безупречно, но его результат не переносится в другую страну». Как курс предлагает это читать?
- Значит, испытание всё-таки сделано плохо: непереносимый результат бесполезен
- Внутренняя валидность есть, внешней нет, и работа наполовину хороша
- Внешняя валидность это свойство применения: та же работа годится в одном месте и не годится в другом
- Такого не бывает: при достаточном числе повторений результат становится переносимым
Чем пометка «источника нет» отличается от пометки «отвергнуто»?
- При «отвергнуто» проверка была и не подтвердила, а при «источника нет» проверять было нечего: работы не находится
- Ничем по существу: обе означают, что утверждению верить нельзя, и разница только в вежливости формулировки
- «Источника нет» ставят слабым работам, а «отвергнуто» сильным, которые не удалось воспроизвести
- «Источника нет» относится к числам, а «отвергнуто» к утверждениям, записанным предложением с глаголом
Ошибку в коде флагманской работы зафиксировал официальный документ комитета по премии. Что из этого следует по курсу?
- Что работу отозвали, и её числа читать больше не стоит
- Что критики метода добились публичного признания, которого практики избегали
- Что журнал напечатал формальное исправление и оно видно в метаданных статьи
- Что премию дали за метод, и метод сработал против знаменитой работы одного из лауреатов
В сообщении сказано: показатель на площадках программы вырос вчетверо за три года. Какой вопрос курс задаёт первым?
- Какова была статистическая мощность и какой эффект прибор вообще различил бы
- Сколько исходов проверяли и была ли поправка на множественность проверок
- С чем сравнивали, с собой прежним или с тем, что происходило там, где программы не было
- Кто исполнял программу и в каком масштабе она шла
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Banerjee AV, Duflo E. «The Experimental Approach to Development Economics». Annual Review of Economics, 2009, 1(1):151-178. Рабочая версия: NBER Working Paper 14467, ноябрь 2008: Рабочая версия открыта целиком. Читать надо не аннотацию, а последний абзац заключения: там стоит согласие с главным пунктом Хекмана 1992 года. В аннотации же спрятана вторая полезная строка: что высказанные опасения реальны, но часто не специфичны для экспериментов. Главным достоинством метода авторы называют не несмещённость, а возможность оценить параметры, которые иначе оценить нельзя.
- Deaton A. «Randomization in the Tropics Revisited: a Theme and Eleven Variations». NBER Working Paper 27600, июль 2020: Открыт целиком, читается как связное эссе. Внешней валидности посвящена вариация 4, и там стоит самая жёсткая формулировка: её отсутствие не упрёк исследованию. Отдельно стоит прочесть сноску 1 на первой странице: заблуждения о том, что жребий уравнивает группы, автор приписывает обеим сторонам спора, включая критиков.
- The Committee for the Prize in Economic Sciences in Memory of Alfred Nobel. «Understanding Development and Poverty Alleviation». Scientific Background, The Royal Swedish Academy of Sciences, 14 октября 2019: Открытый PDF на 34 страницы. Три главные строки лежат не в тексте, а в сносках и в разделе о масштабировании: сноска 14 на двадцатой странице об ошибке в коде, сноска 19 о том, что опасения по внешней валидности не специфичны для экспериментальной работы, и слова «largely disappointing» о двух испытаниях в государственной школьной системе.
- Imbens G. «Understanding and misunderstanding randomized controlled trials: A commentary on Deaton and Cartwright». Social Science & Medicine, 2018, 210:50-52: Текст закрыт, аннотации у заметки нет вовсе, и потому курс берёт отсюда только факт публикации. Ценна запись тем, что показывает устройство спора: ответ напечатан в том же номере, что и разбираемая статья, и он один из восемнадцати комментариев к ней. Кто хочет прочесть сам спор целиком, начинает с этого номера журнала.
- Banerjee A, Banerji R, Berry J и др. «From Proof of Concept to Scalable Policies: Challenges and Solutions, with an Application». Journal of Economic Perspectives, 2017, 31(4):73-102: Открыта на сайте журнала. Читать надо таблицу с тремя столбцами процентов (обучен ли учитель, пользовались ли материалами, сгруппировали ли детей по уровню), а не выводы. Провал в Бихаре виден в третьем столбце и напечатан авторами самой программы. В пересказах эта таблица не появляется почти никогда.