Обучение на уровне ребёнка (TaRL)
Механизм проверили отдельно от его авторов, а доставка случилась в 0-3,8 % классов
Обучение на уровне ребёнка, которое часто зовут дифференцированным, группирует детей по измеренному умению, а не по возрасту, и учит от того, что они уже знают. В Вадодаре и Мумбаи программа Pratham дала 0,28 σ во второй год, а в Кении одна пересборка классов по уровню дала 0,138 σ и не исчезла через год после конца программы. В государственных школах Бихара и Уттаракханда та же идея дала ноль, и таблица хода программы объясняет почему: по уровню рассадили детей в 3,8 % и 0,0 % классов.
Banerjee, Banerji, Berry и др. 2017, Journal of Economic Perspectives · Duflo, Dupas, Kremer 2011 · Banerjee, Cole, Duflo, Linden 2007 · 29 мин · обновлено 01.10.2026
После урока вы сможете
- Отличать «идея не работает» от «идею не доставили» и называть измерение, которое их разводит
- Читать прирост в уровнях порядковой шкалы отдельно от прироста в стандартных отклонениях
- Называть, в каких квантилях группировка по уровню дала прибавку и что стало с ней через год
- Читать список из пяти испытаний как перечень условий, а не как приговор идее
- Отличать административный охват программы от эффекта, измеренного на школах испытаний
Статья 2017 года о пяти испытаниях одной школьной программы напечатала таблицу, которую обычно не печатают. В ней три столбца. Доля учителей, прошедших обучение. Доля классов, где пользовались розданными материалами. И доля классов, где детей действительно рассадили по уровню умения. По индийскому штату Бихар, по ветви с обучением и материалами, там стоит 84,4 %, 62,5 % и 3,8 %. По ветви, куда добавили ещё и волонтёров, стоит 84,7 %, 69,2 % и 0,0 %.
Третий столбец и есть программа. Первые два это то, что к ней прилагается: люди обучены, тетради на партах. Прирост по языку в ветви с обучением и материалами вышел 0,064 уровня (СО 0,059) на шкале от нуля до четырёх, при среднем контроля 1,8 и 6 490 наблюдениях за два учебных года. Это ноль. Во второй ветви прибавка была 0,20 уровня (СО 0,054), но дали её волонтёрские занятия вне школы, а не классы: в классах группировка по уровню не случилась вовсе.
Идея, которую не доставили, к тому времени была проверена трижды. В двух городах Западной Индии она дала прибавку 0,28 σ во второй год. Её механизм отдельно проверили в Кении, без коррекционных занятий и без людей, которые её придумали. А через четыре года после бихарского провала та же программа руками государственных учителей дала 0,154 σ по языку на 11 963 наблюдениях.
Этот урок о различии, которое в пересказах звучит одинаково. «Идея не работает» и «идею не доставили» это разные приговоры, и разводит их не спор, а третий столбец таблицы.
С чего это началось
Началось всё в муниципальных начальных школах Вадодары и Мумбаи. Индийская некоммерческая организация Pratham нанимала молодых женщин из тех же общин и обучала их. Каждая забирала отстающих третье- и четвероклассников из класса на два часа в день и учила азам чтения и счёта. Учителей в школах при этом не меняли, а программу класса не трогали.
Основание для затеи измерили заранее. В Вадодаре компетенции первого класса по математике проходили 19,5 % третьеклассников, в Мумбаи 33,7 %. То есть учитель вёл урок третьего класса детям, не освоившим первый. Оба города считались относительно благополучными: прогулы учителей там проблемой не были.
Испытание шло два учебных года, 2001/02 и 2002/03, и охватило больше 15 000 учеников за три года. Исходом был балл теста по языку и математике, нормированный по классу, году и городу. В первый год прибавка составила 0,14 σ, во второй 0,28 σ, а у нижней трети распределения во второй год больше 0,40 σ. Отсев составил 20 % в обеих группах, и выбывшие в них не различались.
Повторный тест в марте 2004 года, через год после конца программы, дал другое. Средний эффект стал незначимым, у нижней трети осталось около 0,10 σ по обоим предметам. Стоила программа 107 рупий на ученика в год, примерно 2,25 доллара. И тест, по которому мерили, разработала та же организация, которая вела занятия: работа это ограничение называет, но не подчёркивает.
Механизм отдельно от тех, кто его придумал
Кенийское испытание проверяло не программу Pratham, а одно её действие. Из 140 школ Западной провинции, где первый класс был один, взяли 121. В 61 школе детей раскидали по двум секциям жребием, в 60 других разделили по баллу экзамена первого триместра 2005 года. Девятнадцать школ, где секций и так было больше одной, из анализа выбыли.
Ни коррекционных занятий, ни дополнительных часов, ни людей из Индии тут не было. Классы просто пересобрали. Через 18 месяцев балл в школах с пересборкой оказался выше на 0,138 σ (СО 0,078), а с ковариатами на 0,175 σ (0,077). Мерили стандартизованный тест у детей, пошедших в первый класс. Исходом был суммарный балл по чтению и счёту.
Второй замер сделали через год после конца программы, когда дети уже сидели в обычных классах. Разница не исчезла: 0,163 σ (0,069), с ковариатами 0,178. Авторы сами называют такую стойкость необычной и ссылаются на работы, где эффект затухал. Среди этих работ есть вадодарская, где средний эффект через год стал незначимым.
Механизм здесь измерили, а не предположили. Контрактных учителей (нанятых на срочный договор вне штата) заставали в классе за уроком в 74 % внезапных визитов против 45 % у штатных. Штатный учитель, которому досталась верхняя секция, был на месте на 5,4 п. п. чаще, а у нижней это преимущество пропадало. По признаку «в классе и учит» разница вышла 11 п. п., четверть учебного времени.
Только теперь у этого появляется имя. Пересборка классов по измеренному умению называется группировкой по уровню. Педагогика, ради которой её делают, это обучение на своём уровне: ребёнка учат от того, что он уже умеет. В той же кенийской работе есть второе сравнение, про размер класса, и оно разобрано в предыдущем уроке.
Пять испытаний в государственной системе
Дальше идею повели в государственную школу, и об этом есть две статьи одних и тех же авторов. Обе описывают одни и те же пять испытаний. Журнальная печатает эффекты в уровнях шкалы от нуля до четырёх, а рабочий документ NBER 22746 в стандартных отклонениях. Шкала простая: по языку от «не узнаёт буквы» до «читает рассказ», по математике от «не считает» до деления.
Первое испытание: летний лагерь в Бихаре в июне 2008 года. Вели его государственные школьные учителя, обученные Pratham, вместе с обученными волонтёрами. Доплачивало учителям государство. За месяц вышло 0,12 уровня по языку (СО 0,059) и 0,085 по математике (0,050) при среднем контроля 2,2 и 2,1 и 2 839 наблюдениях. В стандартных отклонениях это 0,09 и 0,07. До лагерей дошли около 23 % детей лечебных деревень, и по математике оценка значима только на десятипроцентном уровне.
Второе: учебный год 2008-2010 в том же штате, три ветви. Одни материалы дали 0,027 уровня по языку (0,061). Материалы с обучением учителей: 0,064 (0,059). Ветвь, где к ним добавили волонтёров вне школы, дала 0,20 (0,054) по языку и 0,13 (0,046) по математике на 6 490 наблюдениях.
Третье: Уттаракханд, те же два года. Обучение с материалами дало 0,030 уровня по языку (0,053), а с волонтёрами внутри школы вышло −0,012 (0,044). Число наблюдений в двух статьях об этом эксперименте разное: 5 645 в журнальной и 3 763 в рабочем документе. Причины расхождения в добытых документах нет, и потому урок называет обе цифры вместе с их источником.
Один и тот же результат здесь напечатан в двух шкалах, и множителя между ними нет. Харьяна по языку это 0,20 уровня в журнальной статье и 0,154 σ в рабочем документе. Уттар-Прадеш по языку: 0,95 уровня и 0,701 σ. Уровень шкалы ASER есть порядковая ступенька умения: узнаёт буквы, читает слова, читает абзац, читает рассказ. Стандартное отклонение означает разброс балла в группе сравнения. Пересказ, который берёт число из одной статьи и приписывает ему единицу из другой, получает величину, которой нет ни в одной.
Что именно не доехало
Провал в Бихаре и Уттаракханде авторы объяснять словами не стали. Данные о ходе программы они собирали отдельно от исходов: наблюдатель приходил в класс и смотрел, обучен ли учитель, лежат ли на партах материалы, рассажены ли дети по уровню. Такие наблюдения называются процессными данными, и без них ноль на исходе истолковать нечем.
Таблица получилась говорящая. В бихарской ветви с обучением и материалами обучение прошли 84,4 % учителей, материалами пользовались в 62,5 % классов, а по уровню группировали 3,8 %. В ветви с волонтёрами 84,7 %, 69,2 % и 0,0 %. В Уттаракханде обучение дошло до 29,4 % и 53,8 % по двум ветвям, а группировка случилась в 10,0 % и 5,1 % классов. Формула авторов дословна: в обычных классах Бихара по уровню сгруппированы были от нуля до четырёх процентов.
Причину поведения учителей тоже спросили, а не додумали. В интервью учителя говорили, что материалы хорошие: язык простой, содержание уместное. И тут же объясняли, почему не пользуются ими постоянно. Работа с ними требует времени и терпения, а программу класса надо пройти до конца года. Это ограничение, а не порок: у учителя есть обязанность, которую программа не отменяла.
В Уттаракханде к этому добавилось своё. Ключевые люди в управлении образованием сменились прямо перед оценкой и потом менялись ещё несколько раз. Внутри ведомства шла борьба, учителя и их начальники бастовали по причинам, к программе отношения не имевшим. Местные сотрудники Pratham быстро уходили.
Отсюда главный вывод пяти испытаний. Провалилась не педагогика, а доставка. Обучение прошло, материалы дошли, а собственно вмешательство в классе не случилось. Проверяется это внутри того же штата. В бихарской ветви с волонтёрами по уровню группировали ноль процентов классов, а занятия вне школы дали 0,20 уровня по языку: педагогика сработала там, где ей нашлось отдельное место.
Что изменили и что из этого вышло
Харьяна 2012/13: та же педагогика после четырёх переделок. Программу подавали как государственную, а не как чужую. Появился слой государственных методистов, обученных Pratham: каждый отвечал за 12-15 школ и сам вёл в них занятия. Главное же: в расписании выделили отдельный час. Штат с 2011/12 обязал школы удлинить день.
В этот час детей 3-5 классов физически пересаживали в классы по уровню. Усмотрение учителя тем самым убрали: группировка перестала зависеть от того, найдёт ли он на неё время. Процессные данные это подтверждают: обучение прошли 94,7 % учителей, материалами пользовались в 81,0 % классов, по уровню группировали 91,3 %.
Испытание охватило 400 школ, программу получили 200. Прирост по языку составил 0,154 σ (СО 0,0173), в уровнях 0,20 (0,023), на 11 963 наблюдениях за учебный год. По математике вышло −0,006 (0,017), то есть ноль: математику харьянская программа не трогала вовсе. Без слов «по языку» число 0,154 σ ставить нельзя, и пересказ «в Харьяне сработало» без этой оговорки говорит больше, чем измерено.
Пятое испытание, Уттар-Прадеш 2013/14, устроено ещё иначе. Волонтёры и штат Pratham вели занятия в здании школы и в школьные часы, а обычные уроки на это время останавливали. Одна ветвь получила четыре круга по десять дней, другая два круга по двадцать, и всего выходило 50 дней в году.
Числа там самые большие в этой истории. Десятидневные лагеря дали 0,701 σ по языку (0,022) и 0,694 по математике (0,024). Двадцатидневные дали меньше: 0,609 (0,023) и 0,620 (0,024). Одни материалы, как и в Бихаре, почти ничего не дали: 0,034 (0,022). По линейке третьего урока 0,701 это семь медиан образовательного поля, и такие величины в нём почти не встречаются. Списать их на малый размер работы нельзя: испытание крупное, 17 254 наблюдения, а стандартная ошибка 0,022.
В человеческих единицах это выглядит так. На входе букв не узнавали 39 % детей, а прочесть абзац или рассказ могли 15 %. В контроле к концу года букв не узнавали 24 %, а читали абзац или рассказ тоже 24 %. В группе с лагерями 8 % и 49 %.
К 2017 году учительская харьянская модель шла в 107 921 школе тринадцати штатов Индии и доходила почти до пяти миллионов детей. Волонтёрская внутришкольная шла в 4 210 школах и больше чем до 200 000 детей. Это отчётность организации, которая ведёт программу, и она проверяема. Но группы сравнения у таких чисел нет, и прироста балла они не означают. Эффект измерен на школах испытаний: 400 школ Харьяны, из которых 200 получили программу, и около 480 школ Уттар-Прадеша. Складывать охват с эффектом нельзя, иначе выйдет величина, которую никто не мерил.
Кому это помогает
Средняя величина прячет распределение, и здесь его посчитали отдельно. Ясной картины «чем слабее ребёнок, тем больше пользы» не вышло. Наибольший сдвиг получили дети, которые на входе узнавали буквы, вторыми по величине стали те, кто не узнавал и их. Дети, уже читавшие рассказ, не получили почти ничего.
По Харьяне это выглядит так, в уровнях шкалы. Ничего не умел на входе: 0,167 (СО 0,0394). Узнавал буквы: 0,169 (0,0272). Читал слово или абзац: 0,132 (0,0246). Читал рассказ: 0,0288 (0,0195), то есть ноль. В Уттар-Прадеше на десятидневных лагерях ряд тот же: 0,771, 0,792, 0,446 и 0,048 без значимости.
Ноль у верхней группы не дефект программы. Она про догоняющих, и тот, кто уже дочитал до рассказа, догонять не должен. Разговора о вреде сильным здесь нет вовсе: их результат не падал ни в одной из пяти постановок.
Кенийская пересборка классов отвечает на тот же вопрос жёстче. Там выиграли все квантили, и фраза об этом стоит в самой работе. Суммарный эффект нижней половины составил 0,155 σ при p = 0,04. Через год после конца программы у нижней половины осталось 0,135 (p = 0,09), а у нижнего квартиля оценка стала незначимой.
Что говорят об этом сами авторы
Соблазн прочитать пять испытаний просто есть: государственные учителя не могут, волонтёры могут. Авторы этот вывод отвергают сами и называют причину. Летний лагерь в Бихаре вели государственные школьные учителя, и он сработал. Значит, дело не в том, кто стоит у доски: те же люди смогли вести коррекционные занятия, когда занимались только ими, и не стали этого делать в учебном году.
Второй их вывод спорит с ожиданием поля. Обсуждают обычно равновесные эффекты и зависимость от места: мол, на масштабе программа меняет условия вокруг себя, а в другой стране всё иначе. Здесь, пишут авторы, эти соображения оказались не особенно важны. Главным препятствием была трудность исполнения в масштабе.
Есть и случай, где проверки не вышло вовсе. Пилот в штате Тамилнад не состоялся: чиновники сопротивлялись. Причину авторы называют прямо. Pratham к тому времени стала слишком крупным игроком и виделась как организация, вскрывшая слабую работу государственных школ.
В рабочем документе NBER 22746 конфликт интересов раскрыт дословно. Рукмини Банерджи руководит Pratham. Она участвовала в разработке программы, в её исполнении и в финальном просмотре статьи, но не в сборе и не в анализе данных. Это раскрытие, а не обвинение: оно напечатано авторами, а не найдено критиками. Читать после него надо внимательнее, прежде всего ту часть, где программу переделывали после провала. Заметить стоит и обратное: таблицу с тремя столбцами процентов, из которой виден собственный провал, напечатала эта же группа.
Где кончается проверенное
За пределами Индии история обрывается. Авторы пяти испытаний ссылаются на успешную репликацию в Гане, проведённую вместе с правительством. Ссылка ведёт на отчёт организации, а не на статью в журнале, и его чисел в базе курса нет. По Замбии, Ботсване, Нигерии и Мадагаскару материалы продвигающих организаций называют «0,1-0,3 σ, до 0,7 σ» и «0,56 σ на Мадагаскаре».
Ни у одной из этих величин паспорта не нашлось. Нет числа школ, нет длительности, нет стандартных ошибок ни в одном добытом документе. Это не «проверили и не подтвердилось». Проверять было нечего. Различие здесь то же, что между Бихаром и Харьяной, только на уровне не программы, а самого числа.
Есть и обратная сторона счёта. Обзор шести систематических обзоров 2016 года разбирал, почему они расходятся в выводах. Ответ оказался скучным: они читали разные работы. Из 229 исследований с результатами по обучению самый полный обзор охватил меньше половины. При этом два класса программ рекомендуются с некоторым постоянством, и один из них это педагогика, подстроенная под уровень ученика.
Это обзор обзоров, а не новое измерение: он говорит, на чём сходятся своды, а не какова величина эффекта. Числа из него взять нельзя. Взять можно другое: педагогика, о которой урок, не единичная находка одной организации в одной стране.
Мерили балл по языку и математике у детей 3-5 классов индийских государственных школ: 11 963 наблюдения в Харьяне за учебный год и 17 254 в Уттар-Прадеше. Из этих величин не следует, что делать в другом месте, потому что решение требует того, чего в измерении нет. Своего расписания, в котором час либо выделен, либо нет. Своего надзора, здесь измеренного визитами методиста, а там не измеренного вовсе. И того, от чего ради этого часа откажутся: он занят другим предметом, и цена отказа в испытании не считалась. Принимают такое решение те, кто отвечает за расписание и за исполнение в своей системе, и на этом курс останавливается. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.
Что дальше
Из урока стоит унести три различения. Идея и её доставка не одно и то же, и разводит их измерение хода программы, а не спор о том, работает ли идея. Уровень порядковой шкалы и стандартное отклонение это разные единицы, и число без единицы не значит ничего. Административный охват и измеренный эффект две разные величины, и первая не наследует второй.
Следующий урок берёт объяснение, которое авторы пяти испытаний отвергли, и проверяет его прямо. Если летний лагерь в Бихаре вели государственные учителя и он сработал, дело не в том, кто стоит у доски. Тогда в чём? В Кении на этот вопрос ответили жребием: разыграли не программу, а того, кто нанимает исполнителя и платит ему.
Ключевые работы
| Banerjee AV, Cole S, Duflo E, Linden L, Quarterly Journal of Economics | 2007 | Рандомизированное испытание в муниципальных начальных школах Вадодары и Мумбаи. Исполнитель: некоммерческая организация Pratham. Отстающих третье- и четвероклассников забирали из класса на два часа в день и учили азам чтения и счёта. Объём: больше 15 000 учеников за три года, два учебных года 2001/02 и 2002/03, повторный тест в марте 2004. Исход: балл теста по языку и математике, нормированный по классу, году и городу. Прибавка 0,14 σ в первый год и 0,28 σ во второй, у нижней трети распределения больше 0,40 σ. Через год после конца программы средний эффект незначим, у нижней трети около 0,10 σ. Отсев 20 % в обеих группах. Базовый уровень: компетенции первого класса по математике проходили 19,5 % третьеклассников Вадодары и 33,7 % в Мумбаи. Цена 107 рупий на ученика в год. Тест разработала та же организация, которая вела занятия. |
| Duflo E, Dupas P, Kremer M, American Economic Review | 2011 | Рандомизированное испытание группировки по уровню в Западной провинции Кении. Объём: 121 школа из 140, где первый класс был один. В 61 школе детей раскидали по двум секциям жребием, в 60 разделили по баллу экзамена первого триместра 2005 года. 19 школ с несколькими секциями исключены. Длительность 18 месяцев плюс повторный замер через год после конца программы. Исход: суммарный стандартизованный балл по чтению и счёту. Через 18 месяцев 0,138 σ (СО 0,078), с ковариатами 0,175 σ (0,077). Через год после конца 0,163 σ (0,069), с ковариатами 0,178. Нижняя половина 0,155 σ при p = 0,04, и в работе сказано, что выиграли ученики всех квантилей. Механизм измерен через внезапные визиты: контрактных учителей заставали за уроком в 74 % визитов против 45 % у штатных. |
| Banerjee A, Banerji R, Berry J и др., пять испытаний обучения на своём уровне, Journal of Economic Perspectives | 2017 | Пять рандомизированных испытаний одной педагогики в государственной системе Индии. Те же испытания в стандартных отклонениях напечатаны в рабочем документе NBER 22746. Единица рандомизации: деревня в Бихаре и Уттаракханде, школа в Уттар-Прадеше. Исход: уровень умения ребёнка по шкале от нуля до четырёх. Летний лагерь в Бихаре, июнь 2008, руками государственных учителей: 0,12 уровня по языку (СО 0,059) и 0,085 по математике (0,050), 2 839 наблюдений, дошли около 23 % детей. Учебный год 2008-2010 в Бихаре: одни материалы 0,027 (0,061), с обучением учителей 0,064 (0,059), с волонтёрами вне школы 0,20 (0,054), 6 490 наблюдений. Уттаракханд: 0,030 (0,053) и −0,012 (0,044). Харьяна 2012/13 при выделенном часе: 0,154 σ по языку (0,0173) и −0,006 по математике (0,0170), 400 школ, 11 963 наблюдения. Уттар-Прадеш 2013/14, десятидневные лагеря: 0,701 σ по языку (0,022). Доставка измерена отдельно: обучены 84,4 % учителей и сгруппированы по уровню 3,8 % классов в Бихаре против 94,7 % и 91,3 % в Харьяне. Конфликт интересов раскрыт авторами. |
| Evans DK, Popova A, The World Bank Research Observer | 2016 | Разбор шести систематических обзоров об обучении в бедных странах, вышедших за два года и расходящихся в выводах. Это не одно исследование, а сопоставление сводов между собой: причина расхождения найдена в выборках работ, из 229 исследований с результатами по обучению самый полный обзор охватил меньше половины. Два класса программ рекомендуются с некоторым постоянством, и один из них это педагогика, подстроенная под уровень ученика. Величин эффекта такой разбор не даёт и дать не может. |
Что подтвердилось, а что нет
Так говорят пересказы школьного спора о трекинге в богатых странах, а данные этого не утверждают. В кенийском испытании выиграли все квантили, и фраза об этом стоит в самой работе. Суммарный эффект нижней половины 0,155 σ при p = 0,04. Мерили стандартизованный балл по чтению и счёту у детей 121 школы Западной провинции за 18 месяцев. Ни в одной из пяти индийских постановок результат сильных не падал. В Харьяне у детей, уже читавших рассказ, он просто равен нулю: 0,0288 уровня (СО 0,0195).
Проверено отдельным замером через год после конца программы, когда дети сидели уже в обычных классах: 0,163 σ (СО 0,069), с ковариатами 0,178. Это не меньше, чем было через 18 месяцев работы программы: 0,138 σ (0,078). Мерили тот же стандартизованный балл у детей 121 кенийской школы. Авторы сами называют такую стойкость необычной и ссылаются на работы, где эффект затухал. В Вадодаре и Мумбаи он и затух: средний стал незначимым через год, а у нижней трети осталось около 0,10 σ.
В сильной форме неверно. В Харьяне программу вели государственные учителя, и за учебный год 2012/13 вышло 0,154 σ по языку (СО 0,0173) на 11 963 наблюдениях. По математике −0,006 (0,0170), но математику программа и не трогала. Летний лагерь в Бихаре тоже вели государственные учителя, и за месяц он дал 0,12 уровня по языку (0,059). Выжила осторожная версия с названным условием: переносится там, где под группировку выделен час и детей пересаживают физически. В Харьяне так группировали 91,3 % классов, в Бихаре от нуля до 3,8 %.
Величина ходит по материалам организаций, продвигающих подход, вместе с «до 0,7 σ» и «0,56 σ на Мадагаскаре». Работы, из которой её можно взять, в базе курса нет: ни числа школ, ни длительности, ни стандартных ошибок ни в одном добытом документе. Авторы пяти испытаний ссылаются на успешную репликацию в Гане, но ссылка ведёт на отчёт организации, а не на статью в журнале, и его чисел тоже нет. Это не «проверили и не подтвердилось»: проверять было нечего.
Термины
- обучение на своём уровнеteaching at the right level
- Педагогика, в которой ребёнка учат от того, что он уже умеет, а не от того, что положено его классу. Проверяемая часть в ней одна: что именно делают с классом и с расписанием. Название организации, которая её продвигает, к проверке отношения не имеет, и механизм проверяется отдельно от авторов.
- группировка по уровнюtracking
- Пересборка классов по измеренному умению вместо распределения по возрасту или жребием. От коррекционных занятий отличается тем, что не добавляет ни часов, ни людей: меняется только состав секции и то, во что целится учитель. Поэтому её можно проверить как отдельное действие, без всей остальной программы.
- шкала уровнейlevels scale
- Порядковая шкала, где ответ ребёнка кодируется целым числом по высшему заданию, которое он выполнил: от «не узнаёт буквы» до «читает рассказ». Прирост по ней меряется в долях уровня и в стандартные отклонения множителем не переводится. Одно и то же испытание даёт 0,20 уровня и 0,154 σ, и единицу надо называть вместе с числом.
- доставка вмешательстваimplementation fidelity
- Доля мест, где вмешательство случилось в задуманном виде. Вопрос здесь не «получили ли материалы», а «произошло ли то, ради чего их раздали». Меряется наблюдением на месте, а не отчётностью исполнителя, и в этом поле регулярно оказывается меньше ожидаемого.
- процессные данныеprocess data
- Наблюдения о ходе программы, собранные отдельно от исходов: приходил ли методист, пользовались ли материалами, как рассажены дети. Нужны для истолкования нуля: без них непонятно, проверяли идею или её отсутствие. Собираются те же месяцы, что и исход, и в отчёте стоят отдельной таблицей.
- масштабированиеscale-up
- Перенос вмешательства с площадок испытания на систему целиком. Меняется при этом не только число мест: другими становятся исполнители, надзор и порядок, в который вмешательство надо встроить. Поэтому величина эффекта пилота на масштабе не наследуется и требует отдельного измерения.
- административный охватprogramme reach
- Число школ, деревень или людей, до которых программа доехала по отчётности исполнителя. Величина проверяемая и полезная, но это не измерение эффекта: группы сравнения у неё нет. Приписывать охваченным прирост, измеренный на площадках испытания, нельзя, иначе получится число, которого никто не мерил.
- затухание эффектаfade-out
- Уменьшение измеренной разницы между группами после конца программы. Величина, которую надо мерить отдельным замером, а не предполагать по общему правилу. У коррекционных занятий в Индии средний эффект через год стал незначимым, у группировки по уровню в Кении не уменьшился вовсе.
Практикум · Отделить «не сработало» от «не случилось»
Упражнение на час и на один отчёт об оценке программы, школьной, медицинской, любой, лишь бы там был измеренный исход. Считать ничего не нужно, решать что-либо тем более. Цель одна: увидеть, есть ли в отчёте вторая половина, то есть данные о том, что именно произошло на местах.
- Выпишите заявленный исход и его величину вместе с единицей: балл, уровень шкалы, доля, стандартное отклонение. Отдельно отметьте, стоит ли рядом стандартная ошибка или интервал.
- Найдите, что именно должно было случиться в классе, кабинете или во дворе. Сформулируйте это одной фразой, проверяемой наблюдением со стороны, а не словами о целях программы.
- Поищите числа о ходе программы: скольких исполнителей обучили, до скольких мест доехали материалы, в скольких местах сделали то, ради чего всё затевалось. Отсутствие третьего числа запишите отдельной строкой.
- Сверьте охват с выборкой измерения: на скольких местах мерили исход и скольким местам приписан результат. Если это разные числа, выпишите оба и не складывайте их.
- Назовите условие, при котором вмешательство случилось: выделенное время, отдельный человек, физическая пересадка детей. Если условие в отчёте не названо, так и запишите.
Вопросы для самопроверки
Что показала таблица о ходе программы в Бихаре?
- Учителей обучили и материалы раздали, а группировать детей по уровню стали в 0-3,8 % классов
- Учителя обучение прошли, но материалов до школ не довезли, и занятия шли по-старому
- Материалы дошли, а обучение провели лишь в трети школ, и этим объясняется нулевой результат
- Дети приходили в школу реже, чем в контрольных деревнях, и мерить эффект оказалось не на ком
Испытание в Харьяне даёт по языку 0,20 уровня и 0,154 σ. Как это читать?
- Это две разные величины: часть детей считали в уровнях шкалы, часть в стандартных отклонениях
- Это одна оценка в двух шкалах: порядковой шкале умения и стандартных отклонениях балла
- Это оценка до поправки на базовый уровень ребёнка и та же оценка после неё
- Это результат по языку и результат по математике, приведённые к одной общей шкале
Что нашло кенийское испытание группировки по уровню у слабых учеников?
- Прибавку только у верхней половины, а нижняя потеряла примерно столько же
- Ноль в обеих половинах при широком интервале, из которого не следует ничего
- Прибавку в обеих половинах. У нижней она составила 0,155 σ при p = 0,04
- Прибавку у нижней половины и потерю у верхней, обратную привычному спору
Почему «почти пять миллионов детей» нельзя ставить рядом с 0,154 σ?
- Потому что охват считали по другой шкале умений, чем эффект
- Потому что охват относится к волонтёрской модели, а эффект к учительской
- Потому что часть охваченных школ входила в контрольные группы тех же испытаний и программы не получала
- Потому что охват это отчётность исполнителя, а эффект измерен только на школах испытаний
Что из перечисленного НЕ следует из этих пяти испытаний?
- Что в Бихаре и Уттаракханде проверяли не столько педагогику, сколько её доставку
- Что результат зависит от того, случилась ли группировка по уровню
- Что эта педагогика даст такую же прибавку в стране, где её пока не проверяли
- Что государственные учителя способны вести такие занятия, если для них выделено время
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Banerjee AV, Cole S, Duflo E, Linden L. «Remedying Education: Evidence from Two Randomized Experiments in India». Quarterly Journal of Economics, 2007, 122(3):1235-1264: Рабочая версия NBER 11904 открыта, и разложение по годам (0,14 σ в первый, 0,28 σ во второй) стоит только в ней. В журнальной аннотации напечатано одно число второго года, и именно оно ходит по пересказам без указания года.
- Duflo E, Dupas P, Kremer M. «Peer Effects, Teacher Incentives, and the Impact of Tracking: Evidence from a Randomized Evaluation in Kenya». American Economic Review, 2011, 101(5):1739-1774: Рабочая версия NBER 14475 открыта. Главное не в аннотации, а в замере через год после конца программы и в таблице явки учителей: 74 % против 45 % по признаку «в классе и учит».
- Banerjee A, Banerji R, Berry J, Duflo E, Kannan H, Mukerji S, Shotland M, Walton M. «From Proof of Concept to Scalable Policies: Challenges and Solutions, with an Application». Journal of Economic Perspectives, 2017, 31(4):73-102: Открыт у издателя. Читать стоит вторую таблицу, а не аннотацию: там три столбца о ходе программы, из которых виден весь сюжет. Эффекты в стандартных отклонениях лежат в рабочем документе NBER 22746, там же раскрыт конфликт интересов.
- Evans DK, Popova A. «What Really Works to Improve Learning in Developing Countries? An Analysis of Divergent Findings in Systematic Reviews». The World Bank Research Observer, 2016, 31(2):242-270: Главная строка не в выводах, а в разборе выборок: из 229 работ с результатами по обучению самый полный обзор охватил меньше половины. Отсюда и берётся расхождение выводов, которое обычно приписывают разнице во взглядах.