Ретроспективная оценка против эксперимента
Одно вмешательство, одна страна и измеренный размер смещения: ретроспективно от 0,12 до 0,65 стандартного отклонения, а в испытании верхняя граница 0,07
Ретроспективное исследование сравнивает тех, у кого вмешательство было, с теми, у кого не было, и кенийские учебники показали, насколько это завышает эффект. Ретроспективные расчёты давали от 0,12 до 0,65 стандартного отклонения, а испытание в ста школах округов Бусиа и Тесо отвергло средний эффект выше 0,07. Причину измерили: учебник напечатан на английском, третьем языке ребёнка, и прочесть его смогли 16 % средних учеников третьего класса. Правило «наблюдение завышает, эксперимент прав» отсюда всё же не следует.
Глеве, Кремер и Мулен 2009 · Дюфло, Дюпа и Кремер 2011 и 2015 · Ангрист и Лави 1999 · Притчетт и Сандефур 2014 и 2015 · 27 мин · обновлено 24.09.2026
После урока вы сможете
- Читать «верхнюю границу 0,07 стандартного отклонения» как утверждение о величине, а не как отсутствие результата
- Называть измеренный размер расхождения между ретроспективной и экспериментальной оценкой одного вмешательства
- Объяснять провал программы через её устройство, а не через свойства детей и их семей
- Различать два знака смещения отбора в одной и той же задаче
- Излагать возражение о среднеквадратичной ошибке так, чтобы обе стороны были названы
В четвёртый год испытания в пятьдесят кенийских школ приехали с необычной просьбой. Из каждого класса с третьего по восьмой брали ученика, стоявшего ровно посередине по успеваемости, и просили прочесть вслух выданный программой учебник английского. В третьем классе с этим справились 16 % таких учеников. В четвёртом 28 %, в пятом 67 %, в шестых-восьмых больше 90 %.
Сама программа была устроена просто. Из ста школ округов Бусиа и Тесо двадцать пять случайно выбранных стали с 1996 года получать официальные государственные учебники. Мерили нормированные баллы школьных экзаменов по английскому, математике и естествознанию, четыре учебных года подряд. Средний эффект на баллы оказался неотличим от нуля.
Это не «эффекта нет». У работы три оценщика, и самый точный из них отвергает средний эффект величиной 0,07 стандартного отклонения и выше. То есть верхняя граница названа, и она мала. А до этого испытания то же вмешательство оценивали обычными методами. Считали в тех же округах и частью в тех же школах. Получалось от 0,12 до 0,65 стандартного отклонения.
Этот урок о расстоянии между двумя рядами чисел и о том, чем оно измерено.
Что именно сделали в ста школах
Начнём с паспорта, потому что дальше всё держится на нём. Районный отдел министерства отобрал 100 школ из 333 в округах Бусиа и Тесо западной Кении. Двадцать пять из них получили учебники: английский в третьих-седьмых классах, математику в третьих, пятых и седьмых, естествознание в восьмом. Первые пришли в начале 1996 года, часть учебников математики в начале 1997-го. Обеспеченность была неполной: 0,6 учебника на ученика по английскому и естествознанию, 0,5 по математике. Наблюдали четыре учебных года, а исходом были нормированные баллы районных экзаменов и экзаменов организации-исполнителя.
Распределяли школы систематически: список по алфавиту внутри географических подразделений, потом каждая четвёртая школа в первую группу. Что означает такое распределение, подробно разбирал четвёртый урок. Здесь достаточно того, что алфавит с успеваемостью не связан. И ещё одно авторы называют прямо. Они оценивают эффект предложения учебников, а не эффект самих учебников. Дети, сменившие школу после января первого года, числятся за исходной школой.
Числа выглядят так. В первый год эффект по всем предметам сразу составил 0,02 стандартного отклонения при стандартной ошибке 0,086. Такая ошибка позволяет отвергнуть истинный эффект 0,20 и выше. Во второй год снова 0,02, и отвергается 0,23 и выше. Разность разностей с учётом предтеста даёт 0,02 и −0,04, отвергая 0,13 и 0,11. Самое точное сравнение идёт внутри одного ученика: предметы с учебниками против предметов без них. Там выходит −0,01 стандартного отклонения, и отвергается уже 0,07 и выше.
Отсев авторы называют сами. В первый год не тестировали 26,0 % учеников в школах с учебниками против 26,3 % в группе сравнения. Во второй год 31,0 % против 33,3 %. Второгодников оказалось 22 % против 26 %. Авторы сделали крайнее допущение: будто все лишние четыре процента и есть самые слабые ученики. Пересчёт дал 0,044 стандартного отклонения при ошибке 0,098. Вывод от этого не изменился.
Опубликованная версия работы вышла в American Economic Journal: Applied Economics в 2009 году, и полный её текст закрыт платной стеной. Все числа этого урока взяты из рабочего документа NBER 13300 за август 2007 года, прочитанного целиком. Это сведение о точности, а не жалоба: в этом поле числа между рабочей и журнальной версией одной работы расходятся регулярно, и сверка здесь осталась несделанной. Отозвана работа не была, и поправок в базе издателей у неё нет.
Кому учебники всё-таки помогли
Средний ноль скрывает разное. Авторы разбили учеников на пятые части по среднему предтесту. Ряд первого года от нижней части к верхней вышел такой: −0,05, −0,02, 0,03, 0,14 и 0,22 стандартного отклонения. Значимы только две верхние: четвёртая на десятипроцентном уровне, пятая на пятипроцентном.
У самих авторов к этому есть добавление, работающее в обе стороны. Предтест шумный, и часть детей попала в верхнюю пятую часть случайно. Значит, у тех, кто действительно был наверху по начальному уровню, истинный эффект больше 0,22. Но во второй год картина повторилась не полностью: эффекты у двух верхних пятых частей оценены менее точно и значимости не сохранили.
Есть и второй след, уже не про баллы. Переход в среднюю школу после восьмого класса случился у 43 % учеников школ с учебниками против 38 % в группе сравнения. Различие значимо на пятипроцентном уровне. Балл и переход не одно и то же, и совпадать они не обязаны.
Пересказ опирается на ряд по пятым частям первого года, где верхние две значимы. Во второй год те же две части значимости не сохранили, и оговаривают это сами авторы. Дочитанный до второго года, вывод превращается в наблюдение одного года. Единица тут тоже своя: 0,22 стандартного отклонения это величина про баллы, а не доля детей, которым учебник пригодился.
Механизм: учебник на третьем языке
Почему средний эффект нулевой, в этой работе не гадают, а измеряют. В четвёртый год пятьдесят из ста школ случайно выбрали для визитов. В каждой брали среднего по классному рангу ученика третьих-восьмых классов и просили прочесть выданный программой учебник английского. Результат уже назван: 16 % в третьем классе, 28 % в четвёртом, 67 % в пятом и больше 90 % в шестом-восьмом.
Учебники были на английском, а английский для большинства этих детей был третьим языком. Обучение переходит на него с четвёртого класса. Ребёнок третьего класса, которому дали книгу, читать её попросту не мог. Дело здесь не в старании и не в отношении семьи к школе.
Вывод, который делают авторы, тоже стоит назвать точно. Они пишут не о бесполезности учебников, а о несоответствии централизованной программы составу учеников. Книгу составили под верхнюю часть класса, а класс устроен иначе. Это утверждение о программе, а не о детях. Переносить его на систему, где учебник напечатан на родном языке ребёнка, нельзя, и язык авторы называют главным механизмом прямо.
Тот же вопрос до испытания
Самое ценное в этой работе не ноль, а сравнение. В ней же, на тех же кенийских данных, авторы посчитали эффект учебников так, как его считали до полевых испытаний.
Простая перекрёстная оценка сравнивает тех, у кого учебники есть, с теми, у кого их нет, с поправками на образование родителей и землю. По английскому выходит плюс 0,18 стандартного отклонения, по математике плюс 0,09, по естествознанию плюс 0,05 и незначимо. Сводная величина составляет плюс 0,12 при стандартной ошибке 0,016. Ещё больше даёт разность разностей по более ранней программе фонда Джомо Кеньятты. Она раздала учебники в 95 школах из 334 в тех же округах. В седьмом классе в 1994 году вышло около 0,50 стандартного отклонения, в седьмом и восьмом в 1995-м около 0,65.
Тем же рядом идут своды прежних лет, и ряд этот уже не кенийский. Обзор 1988 года, разобравший четыре чужие работы, даёт 0,34, 0,36, 0,30 и 0,06 стандартного отклонения. Последняя из четырёх меньше тех 0,07, которые испытание отвергает: её рандомизированная проверка не опровергает вовсе. Обзор 1978 года нашёл положительный эффект в 15 работах из 18. Обзор 1986 года нашёл эффект значимым в 14 из 22, обзор 1994 года в 19 из 26. Дословный вывод самих авторов: ретроспективные оценки влияния учебников на баллы говорят о более сильном положительном эффекте, чем рандомизированная проверка.
Механизм смещения назван там же, и он двойной. Родители чаще покупают учебники тем детям, которые и так учатся лучше. Это тянет оценку вверх. Государство и доноры, наоборот, дают учебники самым нуждающимся школам, отчего школьные учебники в перекрёстных данных связаны с баллами отрицательно. Две силы разного знака, и результат зависит от того, чьи учебники попали в данные.
Размер класса: то же место, другой прибор
Учебники не единственное «больше того же самого», которое проверяли в кенийских школах. Другая программа в Западной провинции давала школе деньги нанять одного контрактного учителя. Школа обязана была открыть вторую секцию первого класса, а дети и новый учитель распределялись по секциям жребием. Соотношение учеников на учителя в первом классе упало с 82 до 44. Фон стоит назвать отдельно. Средний первый класс в 2005 году был 83 человека, медианный 74. Больше ста учеников было в 28 % первых классов.
Про то, кому достался новый учитель и кто его нанимал, речь пойдёт в пятнадцатом уроке. Здесь важна другая половина: что стало с теми, кто остался со штатным учителем в классе вдвое меньше прежнего. В работе о найме учителя эта прибавка напечатана как 0,087 стандартного отклонения при стандартной ошибке 0,098, то есть неотличима от нуля. В работе тех же авторов о пересборке классов та же прибавка напечатана как 0,09 стандартного отклонения через 18 месяцев, тоже незначимо. Интервала при ней нет. Обе величины относятся к одному эксперименту и к одному сроку.
Дальше начинается срок. В той же работе о пересборке классов сказано прямо: прибавка от уменьшения класса без смены стимулов полностью исчезает в течение года после того, как класс перестают делить. Мерили стандартизованный балл по математике и грамоте у детей кенийских школ Западной провинции. Повторный тест провели через год после конца программы.
Почему так: снова измерено, а не предположено. Штатные учителя на 16 процентных пунктов реже оказывались в классе и за уроком, если школа получала деньги на контрактного учителя. Класс уменьшился вдвое, а времени с учителем у ребёнка не прибавилось. И границу переноса стоит назвать прямо. Это падение с 82 до 44, а не с 25 до 20. Второго работа не измеряла.
Правило Маймонида: эффект был и исчез
Тот же вопрос о размере класса измеряли и вне бедных стран, и там вышла история про время. В 1999 году Джошуа Ангрист и Виктор Лави воспользовались старым школьным правилом: класс делят надвое, когда учеников становится больше сорока. Порог даёт скачок размера класса, с успеваемостью прямо не связанный, и по нему считали эффект. На израильских данных начала 1990-х уменьшение класса давало значимый и существенный прирост баллов у четвероклассников и пятиклассников, но не у третьеклассников.
Через двадцать лет те же авторы вернулись к тому же правилу на израильских выборках 2002-2011 годов. Прироста не нашлось. Заодно обнаружилось, что около порогов зачисление подправляли: численность подтягивали к нужной стороне границы. Модифицированное правило, где численность восстанавливают по датам рождения, манипуляцию обходит и даёт точно оценённые нули.
Точной причины исчезновения авторы не называют: в аннотации сказано, что возможные объяснения они обсуждают коротко. Величин эффекта ни одна из двух аннотаций не печатает, и в базе курса их нет. Но само сочетание стоит запомнить: та же страна, то же правило, тот же метод и те же авторы, а время другое. Здесь у результата не нашлось внешней валидности даже по отношению к самому себе двадцать лет спустя.
Симметричное возражение
Из кенийских учебников напрашивается общее правило: наблюдательная оценка завышает, экспериментальная говорит правду. Правило это неверно, и печатное возражение против него существует.
Лант Притчетт и Джастин Сандефур ставят вопрос так, как он стоит перед тем, кто решает. У него есть два источника: смещённая оценка по наблюдательным данным из его собственного места и несмещённая экспериментальная оценка из чужого. По среднеквадратичной ошибке (величине, которая складывает смещение и разброс) наблюдательное свидетельство из своего контекста выигрывает у экспериментального из чужого. Преимущество уменьшается по мере накопления повторных испытаний, но, по их словам, может и не смениться на обратное.
Логическая часть их довода сильнее числовой. Всякое утверждение о переносимости экспериментального результата опирается на пару допущений: эффект вмешательства постоянен по контекстам, а процессы отбора по контекстам меняются. Обратное допущение (эффект меняется, а отбор устойчив) ровно так же не доказано и ведёт к противоположному выводу. В систематических обзорах доказательств первое допущение, пишут они, редко проговаривается и почти никогда не защищается.
Проверяли они это на двух хорошо изученных литературах: эффект размера класса и выигрыш от частной школы. Величин среднеквадратичной ошибки в открытых аннотациях нет, полных текстов курс не добыл, и потому здесь приведён только качественный вывод. Ответа по существу на эту вилку в базе курса не нашлось ни у кого, а отсутствие ответа не равно согласию.
Кенийский случай измерил размер смещения в одной литературе, в одной стране и на одном вмешательстве. В общее правило он не превращается: у симметричного возражения есть печатная опора, и оно про другие литературы и другие величины смещения. Оба утверждения могут быть верны одновременно, потому что говорят о разном. Выбирать из них удобное значит подменять измерение вкусом.
Что здесь измерено
Соберём измеренное. В ста школах двух кенийских округов раздали учебники и четыре года мерили баллы. Средний эффект по самому точному оценщику не больше 0,07 стандартного отклонения. У верхней пятой части по предтесту в первый год прирост 0,22, во второй год значимость не сохранилась. Механизм измерен прямым испытанием на чтение: 16 % средних учеников третьего класса смогли прочесть свой учебник. Ретроспективные оценки того же вмешательства на тех же округах дают от 0,12 до 0,65.
Не измерено многое. Никто не проверял, что дали бы те же учебники на языке, которым дети владеют. Никто не считал, что вышло бы, раздай их не четверти школ, а всем. И величина смещения, измеренная здесь, на другие литературы не переносится. На этом настаивают и авторы работы, и их оппоненты, каждый по своей причине.
Что установлено твёрдо: в этой паре оценок расхождение есть, оно велико и посчитано на одном и том же материале. Случай редкий. Обычно ретроспективную и экспериментальную оценку одного вмешательства сравнивать не с чем, потому что их считают в разных местах и в разные годы.
Мерили нормированные баллы школьных экзаменов у учеников ста школ округов Бусиа и Тесо в 1996-1999 годах и отдельно измеряли способность прочесть выданный учебник. Из этих чисел не следует решение о том, что закупать для школьной системы: оно требует того, чего в измерении нет. На каком языке напечатан учебник там, куда переносят результат. Чего школа лишится, если купит это, а не другое. И кто в этой системе решает, что печатать и на каком языке. Принимают такое решение те, кто отвечает за учебную программу и за школьный бюджет, и на этом курс останавливается. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.
Что дальше
Модуль о школе начался с самого простого действия: привезти в класс больше того же самого. Учебники, потом учитель, и оба раза баллы почти не двинулись, зато измерился механизм. Учебник оказался написан не для того ученика, который сидит в классе. Уменьшение класса не поменяло в нём ничего, кроме числа детей.
Отсюда прямая дорога к следующему уроку. Если дело в несоответствии между программой и уровнем ребёнка, чинить надо не количество, а именно это соответствие. Четырнадцатый урок берёт такую починку и таблицу из трёх столбцов, по которой видно, что до класса доехало, а что нет. Различие там проходит между «идея не работает» и «идею не доставили».
Ключевые работы
| Glewwe P, Kremer M, Moulin S, учебники и экзаменационные баллы в кенийских школах, American Economic Journal: Applied Economics | 2009 | Рандомизированное испытание на 100 школах округов Бусиа и Тесо в западной Кении, отобранных из 333: 25 случайно выбранных школ получили государственные учебники в начале 1996 года, наблюдали четыре учебных года. Распределение систематическое: каждая четвёртая школа по алфавитному списку. Исход: нормированные баллы районных экзаменов и экзаменов организации-исполнителя. Средний эффект неотличим от нуля. Три оценщика отвергают эффекты 0,20, 0,13 и 0,07 стандартного отклонения. По пятым частям предтеста в первый год: −0,05, −0,02, 0,03, 0,14 и 0,22, значимы только две верхние, и во второй год значимость они не сохранили. Переход в среднюю школу составил 43 % против 38 %. Механизм измерен прямо: в четвёртый год в 50 школах средних по рангу учеников просили прочесть выданный учебник, и в третьем классе справились 16 %. В той же работе посчитаны и ретроспективные оценки того же вмешательства: от 0,12 до 0,65. Числа взяты из рабочего документа NBER 13300 за 2007 год. Журнальная версия закрыта платной стеной. |
| Duflo E, Dupas P, Kremer M, Journal of Public Economics | 2015 | Рандомизированное испытание найма контрактного учителя в Западной Кении. В этот урок отсюда взята половина про размер класса. Объём: 140 школ, 70 получили деньги на одного контрактного учителя и открыли вторую секцию первого класса, дети и учителя по секциям распределялись жребием. Период: с мая 2005 по ноябрь 2006, пять триместров, из них 15 месяцев занятий, плюс повторный тест через год. Исход: стандартизованный балл по математике и грамоте. Соотношение учеников на учителя в первом классе упало с 82 до 44. Фон: средний первый класс 83 человека, медианный 74, больше ста учеников в 28 % классов. У детей, оставшихся со штатным учителем, прибавка 0,087 стандартного отклонения при стандартной ошибке 0,098. Штатные учителя на 16 процентных пунктов реже оказывались в классе за уроком, если школа получала деньги на контрактного. Числа из рабочей версии NBER 17939. |
| Duflo E, Dupas P, Kremer M, American Economic Review | 2011 | Рандомизированное испытание пересборки классов в тех же кенийских школах. В этот урок отсюда взята одна напечатанная там величина про размер класса. Уменьшение класса без смены стимулов даёт прибавку 0,09 стандартного отклонения через 18 месяцев, незначимую и без интервала, и она полностью исчезает в течение года после того, как класс перестают делить. Мерили стандартизованный балл у детей кенийских школ Западной провинции, повторный тест провели через год после конца программы. Числа из рабочей версии NBER 14475. |
| Angrist JD, Lavy V, оценка эффекта размера класса по правилу Маймонида, Quarterly Journal of Economics | 1999 | Оценка на административных данных израильских школ через скачок размера класса у порога, который задаёт старое школьное правило: класс делят, когда учеников становится больше сорока. Дословный вывод: уменьшение класса даёт значимый и существенный прирост баллов у четвероклассников и пятиклассников, но не у третьеклассников. Величин прироста добытая аннотация не печатает, и в базе курса их нет. Судьба работы: не отозвана, продолжение тех же авторов вышло через двадцать лет и на новых данных прироста не нашло. |
| Angrist JD, Lavy V, Leder-Luis J, Shany A, повторная оценка по правилу Маймонида, American Economic Review: Insights | 2019 | Повторение того же приёма на больших израильских выборках 2002-2011 годов. Дословно: в отличие от работы 1999 года, новые оценки не дают свидетельств влияния размера класса. В данных обнаружена подправка зачисления около порогов. Модифицированное правило, восстанавливающее численность по датам рождения, манипуляцию обходит и даёт точно оценённые нули. Точная причина исчезновения эффекта не названа: авторы пишут, что возможные объяснения обсуждают коротко. Численных величин аннотация не приводит. |
| Pritchett L, Sandefur J, о переносе экспериментальных результатов между контекстами, American Economic Review: Papers & Proceedings | 2015 | Сравнение не на людях, а на литературе: сопоставляются разбросы оценок между контекстами и внутри контекста по нескольким изученным вмешательствам, среди них микрокредит, миграция и школьные программы. Дословный вывод: по среднеквадратичной ошибке наблюдательное свидетельство из своего контекста выигрывает у экспериментального из чужого, и преимущество уменьшается с накоплением повторных испытаний, но может не смениться на обратное. Полного текста курс не добыл. Величин среднеквадратичной ошибки аннотация не называет, и потому в урок идёт только качественный вывод. |
| Pritchett L, Sandefur J, о допущениях, на которых держится перенос результата, Journal of Globalization and Development | 2014 | Разбор двух хорошо изученных литератур (эффект размера класса и выигрыш от частной школы), сделанный на опубликованных оценках, а не на новых данных. Дословно: всякое утверждение о внешней валидности экспериментального результата обязано принять, что эффект вмешательства постоянен по контекстам, а процессы отбора по контекстам меняются, и это допущение в систематических обзорах редко проговаривается и почти никогда не защищается. Числа в аннотации не приведены, полного текста курс не добыл. |
Что подтвердилось, а что нет
Проверено на 100 школах округов Бусиа и Тесо: 25 случайно выбранных получили государственные учебники в начале 1996 года, наблюдали четыре учебных года, исходом были нормированные баллы школьных экзаменов. Средний эффект неотличим от нуля, и три оценщика дают три верхние границы: 0,20, 0,13 и 0,07 стандартного отклонения. Точечная оценка самого точного сравнения, внутри одного ученика по предметам с учебниками и без них, равна −0,01. У верхней пятой части по предтесту в первый год было 0,22, но во второй год эти оценки значимости не сохранили. Числа взяты из рабочего документа 2007 года. Журнальная версия закрыта платной стеной.
Обе стороны сравнения посчитаны в одной работе, на одном материале и частью на одних школах. Ретроспективный ряд: сводная перекрёстная оценка 0,12 при стандартной ошибке 0,016 и оценка по английскому 0,18. Разности разностей по более ранней программе, раздавшей учебники в 95 школах из 334 тех же округов, дают около 0,50 в седьмом классе в 1994 году и около 0,65 в седьмом и восьмом в 1995-м. Четыре работы обзора 1988 года дают 0,06, 0,30, 0,34 и 0,36. Рандомизированная часть той же работы отвергает средние эффекты 0,07 стандартного отклонения и выше. Механизм смещения назван авторами и он двойной: родители чаще покупают учебники детям, которые и так учатся лучше, а государство и доноры дают их самым нуждающимся школам.
Обе процедуры объявлены, и обе величины названы. С одной стороны, измерение на кенийских учебниках: ретроспективно от 0,12 до 0,65 стандартного отклонения против отвергаемых 0,07 и выше в испытании, на одних округах и частью на одних школах. С другой, счёт по среднеквадратичной ошибке у Притчетта и Сандефура: наблюдательное свидетельство из своего контекста выигрывает у экспериментального из чужого, и преимущество, по их словам, может не смениться на обратное даже с накоплением повторных испытаний. Их довод опирается на вилку допущений: перенос требует, чтобы эффект был постоянен по контекстам, а отбор менялся. Величин среднеквадратичной ошибки в открытых аннотациях нет, полных текстов курс не добыл, и ответа по существу на эту вилку не нашлось ни у кого.
В Западной Кении соотношение учеников на учителя в первом классе упало с 82 до 44, а у детей, оставшихся со штатным учителем, прибавка составила 0,087 стандартного отклонения при стандартной ошибке 0,098, то есть неотличима от нуля уже на замере через 15 месяцев занятий. В работе тех же авторов о пересборке классов та же величина напечатана как 0,09 через 18 месяцев, тоже незначимо, и там же сказано про срок: прибавка от уменьшения класса без смены стимулов полностью исчезает в течение года после того, как класс перестают делить. Мерили стандартизованный балл по математике и грамоте. Фон: средний первый класс в 83 человека. Границу переноса стоит назвать: это падение с 82 до 44, а не с 25 до 20.
Термины
- ретроспективная оценкаretrospective estimate
- Оценка эффекта вмешательства по уже собранным данным о тех, кто его получил и не получил, без распределения жребием. От экспериментальной отличается не качеством работы, а тем, что различие между группами создано не процедурой, а жизнью, и потому требует отдельного допущения о том, чем именно.
- смещение отбораselection bias
- Систематический сдвиг оценки, возникший оттого, что попадание в группу связано с самим исходом. Знак его заранее неизвестен и в одной задаче может быть разным: родители чаще покупают учебники детям посильнее, а государство даёт учебники школам послабее.
- верхняя граница эффектаupper bound on the effect
- Наибольшая величина эффекта, совместимая с данными на выбранном уровне значимости. Отвечает на вопрос, насколько большим эффект точно не был, а не на вопрос, был ли он вообще. Без неё утверждение о незначимом результате не различает измеренный ноль и отсутствие прибора.
- предтестbaseline test
- Измерение исхода до начала программы, по которому потом делят участников на группы по начальному уровню и уточняют оценку. Измеряется с ошибкой, и поэтому в верхнюю группу по предтесту попадают в том числе те, кто оказался там случайно. Истинный эффект у настоящей верхушки от этого недооценивается.
- сравнение внутри ученикаwithin-pupil comparison
- Сопоставление результатов одного и того же человека по разным предметам там, где вмешательство коснулось одних предметов и не коснулось других. Убирает все различия между людьми и школами разом и потому даёт самую узкую границу, зато требует, чтобы предметы были сравнимы между собой.
- среднеквадратичная ошибкаmean squared error
- Мера того, насколько оценка в среднем далека от истины: складывает квадрат смещения и разброс. Позволяет сравнить смещённую, но точную оценку с несмещённой, но разбросанной одним числом, а не спором о том, что важнее.
- внешняя валидностьexternal validity
- Свойство результата переноситься на другое место, время или другого исполнителя. Это не «применимость вообще». Чтобы говорить о ней предметно, надо назвать, чем именно новая площадка отличается от старой: ценой, размером вмешательства, условиями доступа, тем, кто исполняет. Названное отличие можно проверить, общая ссылка на нехватку данных его не заменяет.
- манипуляция у порогаmanipulation at the cutoff
- Подгонка численности или иного показателя к нужной стороне административной границы теми, кого эта граница касается. Ломает оценку, построенную на скачке у порога, потому что стороны границы перестают быть сравнимыми. Обходится тем, что показатель восстанавливают из независимого источника, например численность класса по датам рождения.
Практикум · Сверить две оценки одного вмешательства
Полтора часа и одно вмешательство, о котором есть и наблюдательные, и экспериментальные оценки: размер класса, частная школа, репетиторство, школьное питание. Считать ничего не нужно. Задача: увидеть, что именно расходится и на каком материале это посчитано.
- Выпишите две оценки одного и того же вмешательства: одну из наблюдательных данных, одну из рандомизированного испытания. Обе должны быть с единицей и с интервалом или стандартной ошибкой.
- Сверьте место и годы. Отметьте, совпадают ли страна, тип школы или хозяйства и период наблюдения. Если нет, разница оценок уже наполовину объяснена.
- Найдите, что считали исходом в каждой. Балл, посещаемость, переход на следующую ступень и заработок это разные величины, и подменяют их чаще всего.
- Спросите у наблюдательной оценки, кто попадал в число получивших. Выпишите названный авторами механизм отбора и его вероятный знак.
- Напишите одну фразу: во сколько раз разошлись оценки и на каком материале это посчитано. Если материал разный, так и запишите, тогда числа не сравнимы, а сравнение осталось несделанным.
Вопросы для самопроверки
Что означает фраза «эффект учебников не больше 0,07 стандартного отклонения»?
- Что учебники не дали ничего и величина эффекта в точности равна нулю
- Что верхняя граница названа: эффект такой величины и больше отвергается
- Что оценка вышла незначимой и потому о величине эффекта сказать нечего
- Что эффект нашёлся у 7 % учеников, а у остальных его не обнаружили
Чем в этой работе объяснён нулевой средний эффект учебников?
- Тем, что учебников привезли слишком мало: по 0,6 книги на ученика
- Тем, что учебники привезли только в последний, четвёртый год наблюдения
- Тем, что баллы мерили только у выпускного класса, а не по всей школе
- Тем, что учебник написан на английском, третьем языке этих детей
Что именно измерила пара «от 0,12 до 0,65» против верхней границы 0,07?
- Размер смещения ретроспективных оценок на одном вмешательстве
- Разницу между двумя странами, где одно вмешательство дало разный результат
- Разброс эффекта между сильными и слабыми учениками внутри одной школы
- Расхождение между рабочей и журнальной версией одной и той же работы
Правило Маймонида дало эффект на израильских данных начала 1990-х и не дало на данных 2002-2011 годов. Что из этого следует?
- Что первая работа содержала ошибку в коде, найденную через двадцать лет
- Что метод скачка у порога для оценки размера класса вообще непригоден
- Что результат не перенёсся во времени: та же страна, тот же метод, те же авторы
- Что классы в 2000-е стали меньше, и порог просто перестал срабатывать
Притчетт и Сандефур пишут, что наблюдательная оценка из своего места бывает полезнее экспериментальной из чужого. На чём держится этот довод?
- На том, что рандомизированные испытания в бедных странах ведут слишком малыми выборками
- На допущении о постоянстве эффекта, которое при переносе редко проговаривается
- На том, что наблюдательные оценки оказались ближе к истине во всех проверенных литературах
- На том, что смещение отбора можно посчитать заранее и вычесть из наблюдательной оценки
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Glewwe P., Kremer M., Moulin S. «Many Children Left Behind? Textbooks and Test Scores in Kenya». American Economic Journal: Applied Economics, 2009, 1(1):112-135, рабочая версия вышла как NBER Working Paper 13300, 2007: Журнальная версия закрыта платной стеной, рабочая открыта, и числа урока взяты из неё. Главное лежит не в аннотации: таблица трёх верхних границ, ряд по пятым частям предтеста и абзац о том, сколько средних по рангу учеников смогли прочесть свой учебник. Ретроспективные оценки того же вмешательства стоят в той же работе, а не в чужой.
- Duflo E., Dupas P., Kremer M. «School governance, teacher incentives, and pupil-teacher ratios: Experimental evidence from Kenyan primary schools». Journal of Public Economics, 2015, 123:92-110, рабочая версия вышла как NBER Working Paper 17939: Читать стоит фон, а не одну оценку: средний первый класс в 83 человека и больше ста учеников в 28 % классов. Там же измерено, что штатные учителя реже оказывались в классе за уроком, когда школе давали деньги на контрактного.
- Angrist J.D., Lavy V., Leder-Luis J., Shany A. «Maimonides Rule Redux». American Economic Review: Insights, 2019, 1(3):309-324: Аннотация говорит главное сразу: на данных 2002-2011 годов свидетельств влияния размера класса нет, около порогов найдена подправка зачисления, а модифицированное правило по датам рождения даёт точно оценённые нули. Читать её стоит вместе с работой тех же авторов 1999 года: порознь каждая выглядит окончательной.
- Pritchett L., Sandefur J. «Context Matters for Size: Why External Validity Claims and Development Practice do not Mix». Journal of Globalization and Development, 2014, 4(2):161-197: Вилка допущений стоит прямо в аннотации, и ради неё эту работу и открывают. Полный текст добыть не удалось, числовых величин в аннотации нет, так что дальше вывода о двух литературах (размер класса и частная школа) по ней двигаться нельзя.
- Pritchett L., Sandefur J. «Learning from Experiments when Context Matters». American Economic Review Papers & Proceedings, 2015, 105(5):471-475: Короткая работа с длинными последствиями: именно здесь сказано про среднеквадратичную ошибку и про то, что преимущество наблюдательной оценки из своего контекста уменьшается с повторными испытаниями, но может не смениться на обратное. Величин ошибки аннотация не приводит, открытая копия по адресу издателя не открывается.