К содержанию
Фонтум Борьба с бедностью Урок 6 / 24 Все уроки

Главная · Курсы · Борьба с бедностью · Программа курса · Модуль II. Как устроено полевое испытание · урок 6 из 24

Статистическая мощность и нулевой результат

Два разных нуля, которые в пересказах называются одним словом: у одного крупные эффекты исключены, у другого не исключено почти ничего, и различает их ширина интервала

Статистическая мощность это вероятность обнаружить эффект заданной величины, если он есть, и по ней различают два нуля, которые пересказы зовут одним словом. В хайдарабадском испытании микрокредита индекс прав женщин дал +0,007 стандартного отклонения при интервале от минус 0,04 до плюс 0,05: точный ноль, крупный эффект исключён. Потребление на взявших заём дало интервал от падения на 43 % до прироста на 60 %: это не ноль, а отсутствие прибора. Мощность здесь задаёт разрыв охвата, а не число опрошенных.

Banerjee, Duflo, Glennerster, Kinnan 2015, Хайдарабад · Banerjee, Karlan, Zinman 2015 · Ioannidis, Stanley, Doucouliagos 2017 · 25 мин · обновлено 24.09.2026

После урока вы сможете

  • Отличать точно измеренный ноль от неизмеренного по ширине интервала, а не по слову «незначимо»
  • Называть разрыв охвата главным источником мощности в полевых испытаниях программ
  • Читать минимально обнаружимый эффект как границу чувствительности прибора, а не как найденную величину
  • Не переносить общую оценку мощности в эмпирической экономике на полевые испытания в развитии
  • Записывать неточный результат как «мы не знаем» с интервалом, а не как «испытания доказали, что не работает»

В хайдарабадском испытании микрокредита мерили сразу многое, и две строки итогов стоят в соседних таблицах. Первая: по индексу самостоятельности женщин, собранному из шестнадцати показателей, плюс 0,007 стандартного отклонения. Вторая: по потреблению на человека в месяц плюс 10,24 рупии 2007 года при контрольном среднем 1 419. Обе величины незначимы. В пересказах обе называются одинаково: эффекта нет.

Интервалы у этих двух строк разные, и это меняет всё. Вокруг первой интервал идёт от −0,04 до +0,05, и авторы пишут прямо: прирост больше одной двадцатой стандартного отклонения исключён с 95-процентной уверенностью. Вокруг второй, в пересчёте на тех, кто заём действительно взял, интервал идёт от падения на 43 % до прироста на 60 %.

Слово «незначимо» означает в этих строках противоположные вещи. В первой измерено, что большого эффекта нет: прибор оказался достаточно чувствительным, чтобы это установить. Во второй не измерено ничего: интервал накрывает и рост в полтора раза, и падение почти вдвое. Оба числа получены на 6 862 домохозяйствах и одним и тем же опросом. Замер был один: через пятнадцать-восемнадцать месяцев после открытия отделения кредитора.

Этот урок о разнице между двумя нулями. Он показывает, чем задаётся чувствительность прибора в этом поле. Он же объясняет, почему она у одного испытания разная по разным исходам. И даёт признак, по которому измеренный ноль отличают от неизмеренного, не заглядывая в интонацию пересказа.

Чувствительность прибора: чем она задаётся

Теперь можно назвать вещи именами. Мощность испытания означает вероятность обнаружить эффект заданной величины, если он на самом деле есть. Обратный случай: не найти эффекта, который есть. Его называют ошибкой второго рода, а мощность равна единице минус её вероятность.

Мощности вообще не бывает: она бывает у конкретной величины эффекта. Поэтому в поле пользуются другой формой того же вопроса, минимально обнаружимым эффектом. Это граница: какую величину испытание отличит от нуля, если она есть. Про то, что меньше, испытание молчит, и молчание его говорит о приборе, а не об отсутствии эффекта.

От чего эта граница зависит, пятый урок разобрал наполовину: от числа единиц распределения и от того, насколько похожи люди внутри одной единицы. Вторая половина у испытаний программ оказалась важнее первой и удивительнее её. Мощность здесь задаётся не тем, скольких опросили, а тем, скольких удалось затронуть программой.

Причина арифметическая. Испытание предлагает программу, а принимают её не все. Сравнивают же в итоге всех, кому предложили, со всеми, кому не предлагали. Если предложение приняла восьмая часть, разница между группами получается разбавленной в восемь раз, и искать её приходится в том же шуме, что и прежде.

на заметкуОдна двадцатая чего именно

Индекс самостоятельности женщин собран из шестнадцати показателей и меряется в стандартных отклонениях самой выборки. Единица эта удобна и опасна сразу. Удобна тем, что сводит разнородные показатели (кто решает о покупках, кто о лечении детей, кто выходит из дома) в одно число, сравнимое с чужой работой. Опасна тем, что зависит от разброса именно в этой выборке: одна и та же прибавка в однородной группе даст большее число, чем в пёстрой. Поэтому 0,05 стандартного отклонения здесь составляет одну двадцатую разброса среди домохозяйств бедных кварталов Хайдарабада, а не одну двадцатую чего-то вообще.

Разрыв охвата: вот где мощность

Величина, которая всё решает, называется разрывом охвата: доля получивших программу в группе предложения минус та же доля в контроле. Во введении к выпуску шести испытаний микрокредита она названа главным определителем статистической мощности. И тут же сказано, как низко она у этих работ опускалась: до девяти процентов.

В Хайдарабаде разрыв составил 8,4 процентного пункта. Заём у какой-нибудь микрофинансовой организации был у 26,7 % домохозяйств в кварталах с отделением против 18,3 % в контрольных кварталах. Кварталов было 104, и в 52 из них жребий открыл отделение. Исходами служили факт займа, вложения и прибыль бизнеса, потребление по статьям, школа детей и индекс самостоятельности женщин.

Отсюда и берётся интервал от +60 % до −43 %. Чтобы получить оценку на тех, кто заём взял, прибавку по всем делят на разрыв охвата, то есть на 0,084. Делится вместе с ней и весь интервал, а значит, ширина его растёт почти в двенадцать раз. Приём этот законный, и у него есть имя и свои условия годности. Разбирает их седьмой урок.

Для мощности отсюда следует правило в одну строку. Пусть разрыв охвата девять процентов. Тогда на принявших программу испытание различает только те эффекты, что примерно в одиннадцать раз крупнее различимых при полном охвате. Увеличение выборки эту цену не отменяет: делитель остаётся прежним, и растягивать интервал он будет по-прежнему. Именно поэтому разрыв охвата в этом поле спрашивают раньше, чем число опрошенных.

ловушка«Незначимо» ещё не сведение о мире

Само по себе это слово говорит только, что интервал накрыл ноль. Что ещё он накрыл, оно не говорит. Лечится это одним числом, краем интервала. Если верхний край означает прирост на 60 %, то фраза «эффекта нет» описывает не измеренное, а надежду читателя. Проверять чужой текст поэтому надо не по слову, а по двум числам: где края. Если их нет ни в таблице, ни в сносках, ни в приложении, значит, половина результата просто не напечатана.

Два нуля в одной таблице

Вернёмся к паре, с которой урок начался, и подпишем оба нуля по сорту. Индекс самостоятельности женщин посчитан на 6 862 домохозяйствах через пятнадцать-восемнадцать месяцев после открытия отделения. Оценка вышла +0,007 стандартного отклонения при интервале от −0,04 до +0,05. В тексте работы это записано словами: прирост больше одной двадцатой стандартного отклонения исключается с 95-процентной уверенностью.

Это точный ноль. Величина мала, и мал сам интервал вокруг неё: крупные эффекты в обе стороны исключены. Утверждение здесь сильное и проверяемое. Не «мы ничего не нашли», а «эффекта такой величины тут нет». А это уже сведение о мире, а не о приборе.

У потребления другой сорт, и сорт этот зависит от того, о ком спрашивать. По всем, кому предложили, интервал идёт от −52 до +72 рупии при контрольном среднем 1 419. Это от минус 3,7 до плюс 5,1 процента контрольного среднего, то есть ноль довольно точный. А в пересчёте на тех, кто заём взял, интервал идёт от падения на 43 % до прироста на 60 %. Внутри него помещается и то, ради чего программу затевали, и её противоположность. Это уже не ноль, а отсутствие прибора, и верная запись такого результата: «мы не знаем».

Разница между двумя строками не в сроке и не в объёме выборки: они одинаковы. Она в другом. Индекс собран из шестнадцати показателей и меряется в стандартных отклонениях самой выборки. Потребление же пришлось делить на разрыв охвата в 8,4 пункта. Разрешающая способность одного эксперимента различается по его исходам в разы, и заметить это можно только по интервалам.

Признак, по которому эти два случая различают, простой и проверяемый. Назовите величину, ради которой программу затевали, и посмотрите, лежит ли она за краем интервала. Возьмём для примера десятую долю стандартного отклонения: третий урок показал, что в образовательных испытаниях это медиана, то есть величина для поля обычная. У индекса прав женщин она лежит за верхним краем, то есть исключена. У потребления за краями не лежит почти ничего: возможны и полуторный рост, и падение почти вдвое.

Что говорит пара «оценка и интервал»оценка близка к нулюоценка далеко от нуляинтервалузкийинтервалширокийточный нольэффекта такой величины нетправа женщин: от −0,04 до +0,05 SDэффект измеренназваны и величина, и краярезультат, который можно переноситьприбора нетмы не знаемпотребление на взявших: от −43 % до +60 %эффект есть,величина не определеназнак известен, размер нетпунктир: ноль, полоса: интервал, в левом столбце обе клетки называют словом «незначимо»шкалы у клеток разные: ширину полос между клетками сравнивать нельзя
Четыре случая, которые в пересказах сводят к двум словам. Слева: обе клетки, про которые говорят «незначимо», и говорят они разное. В нижние клетки вписаны две строки хайдарабадского испытания: индекс самостоятельности женщин и потребление на взявших заём. Схема показывает устройство, а не измерение: положение клеток условно

Пятьдесят исходов на одну работу

Ещё одно число из того же введения. На одну работу выпуска приходится в среднем пятьдесят оценённых эффектов, минимум тридцать шесть, максимум восемьдесят два. Это не признак неряшливости, а устройство предмета. Заём может подействовать на бизнес, на потребление, на школу детей, на здоровье, на решения в семье. Мерить приходится всё.

И тут же итог. Ни одна из шести работ не нашла значимых на десятипроцентном уровне эффектов даже на половине проверенных исходов. Разброс составил от 6 до 39 %. Авторы называют это неудивительным и тут же называют причину: разрыв охвата, который у части работ опускался до девяти процентов.

Из большого числа исходов растёт и обратный вопрос: не «почему так мало значимых», а «сколько значимых нашлось бы случайно». Это вопрос о поправках на множественность, и его разбирает девятый урок. Здесь важна другая половина: когда исходов пятьдесят, а прибор слаб, отсутствие значимости говорит о приборе, а не о программе.

Оговорку авторы выпуска написали сами, и написали жёстко. Многие из их выводов неточны, по крайней мере на уровне отдельных работ. Многие нулевые результаты составляют часть доверительных интервалов, содержащих экономически значимые величины в одну или в обе стороны. Статистическая мощность, заключают они, остаётся серьёзной трудностью исследований влияния микрокредита. Это не упрёк со стороны, а собственная строка авторов шести испытаний.

Мощность в экономике вообще

Есть и общая оценка, и обращаться с ней надо осторожно. Работа 2017 года в The Economic Journal просмотрела 159 эмпирических литератур экономики: 64 076 оценок из более чем 6 700 работ. Медианная статистическая мощность там составляет 18 % или ниже, а в половине областей почти 90 % результатов мощностью не обеспечены.

Вторая половина результата стоит в той же аннотации. Сведём взвешенно только те результаты, что мощностью обеспечены. Тогда окажется, что около 80 % опубликованных эффектов в этих литературах преувеличены. Обычно вдвое, а треть из них преувеличена вчетверо и больше. Механизм понятен: при слабом приборе значимости достигают преимущественно те оценки, которым повезло выпасть крупными.

Переносить эти 18 % на полевые испытания в развитии нельзя, и сказать это надо прямо. Выборка там состоит из мета-анализов по всей эмпирической экономике, а не из полевых испытаний. Верная формулировка такая: в эмпирической экономике в целом медианная мощность оценена в 18 %. Какова она у конкретного испытания, каждый раз считают по нему самому.

Как выглядит такой счёт, пятый урок уже показал числом. Кенийское испытание найма учителей: 192 государственные начальные школы, все восемь провинций, с июня 2010 по октябрь 2011 года, а исходом были баллы тестов учеников. При внутриклассовой корреляции 0,33 в итоговых тестах минимально обнаружимый эффект на одну ветвь вышел около 0,26 стандартного отклонения.

Полученные оценки оказались меньше этого порога: 0,184 при стандартной ошибке 0,088 в одной ветви и −0,022 при ошибке 0,090 в другой. Авторы пишут об этом сами: для эффектов такой величины схема недостаточно мощна. Порог обнаружения и порог значимости вещи разные, и путать их не стоит. Первая оценка обычную проверку значимости проходит, но лежит ниже той величины, которую испытание бралось находить надёжно. Кого с кем там сравнивали и что из сравнения вышло, разбирает пятнадцатый урок.

об исследованииОдно число в трёх видах

Головная оценка кенийского испытания найма учителей меняла вид от версии к версии, и это не дефект, а обычная жизнь числа. В рабочей версии 2013 года на её месте стояло 0,15-0,18 стандартного отклонения. В авторской версии ноября 2016 года названы три величины при разных спецификациях: 0,184, 0,175 и 0,162. В журнальной публикации 2018 года напечатано 0,19. Курс берёт числа из версии 2016 года и называет её вслух: журнальный текст закрыт и при сборке не сверялся. Ставить величины из разных версий рядом как разные результаты нельзя, ведь это одна работа.

Тренажёр: два нуля на одном экране

К уроку приложен тренажёр moshchnost. На первом экране стоят интервалы из работ, и каждый со своим паспортом. Первый: хайдарабадский индекс прав женщин, от −0,04 до +0,05 стандартного отклонения. Второй: потребление на взявших заём, от −43 % до +60 %. Рядом с ними порог обнаружения кенийского испытания найма учителей, 0,26 стандартного отклонения на ветвь.

Ручек три: истинный размер эффекта, число единиц распределения и разрыв охвата между группой предложения и контролем. Экран считает ширину интервала и подписывает под ней главное: какие содержательные величины этот интервал не исключает. Не «значимо или нет», а «что осталось возможным».

Второй экран помечен до первой цифры: числа на нём учебные, разыгранные, а не взятые из работ. Он показывает, в какой доле из ста таких испытаний эффект заданной величины был бы обнаружен. Поставьте разрыв охвата в девять процентов (то самое число, которое называют авторы выпуска), и доля обвалится почти для любой правдоподобной величины эффекта.

Тренажёр не считает читателя, не выставляет оценок и не говорит, какое испытание хорошее. Он делает одну вещь. Показывает, что при слабом приборе слово «незначимо» перестаёт быть сведением о мире и становится сведением о приборе.

Чего отсюда не следует

Не следует, что испытания ничего не показали. Точный ноль это результат, и получен он именно измерением. В Хайдарабаде исключён прирост индекса самостоятельности женщин больше одной двадцатой стандартного отклонения. Сказать так можно только про хорошо измеренную величину. Разница между «эффекта такой величины нет» и «мы не знаем» и есть то, ради чего интервалы печатают.

Не следует и того, что слабый прибор значит чей-то недосмотр. Разрыв охвата исследователь не назначает: программу предлагают, а принимают её люди. Там, где жребием разыгрывали сам приход кредитора, охват в группе предложения шёл от 13 до 31 процента. Подробности этого ряда разбирает седьмой урок. Довести охват до единицы удаётся только там, где разыгрывают не приход кредитора, а одобрение уже поданной заявки.

Не следует, наконец, что широкий интервал служит признаком недобросовестной работы. Он признак того, что вопрос потребовал прибора чувствительнее имеющегося. Работа, напечатавшая свои края, честнее той, что напечатала одно «незначимо». В хайдарабадской статье интервалы стоят в сносках к таблицам. Без них разница между двумя её нулями была бы невидима. И о нехватке мощности написали здесь не критики со стороны, а сами авторы шести испытаний, в собственном введении к собственному выпуску.

здесь кончается измерениеЗдесь кончается измерение

В Хайдарабаде мерили потребление по статьям и шестнадцать показателей самостоятельности женщин у 6 862 домохозяйств из 104 кварталов, через пятнадцать-восемнадцать месяцев после открытия отделения кредитора. Из того, что по одному исходу крупный эффект исключён, а по другому интервал идёт от падения на 43 % до прироста на 60 %, не следует ни одного решения о программе. Такое решение требует того, чего в интервалах нет: цен и спроса другого места, того, от чего ради этой траты откажутся, и порога (какую величину эффекта считать достаточной, чтобы её вообще стоило искать). Последнее задаётся до испытания и самим испытанием не измеряется. Взвешивают всё это те, кто распоряжается деньгами и отвечает за них перед теми, чьи это деньги. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.

Что дальше

Урок оставил в руках один вопрос, который задают любому «эффекта не нашли»: какой интервал. Если интервал узкий и содержательные величины из него исключены, то это результат, и его можно переносить дальше. Если он накрывает и рост, и падение, то это сведение о приборе, а с программой оно не связано никак.

И одну развилку, которую урок обошёл нарочно. Оценку на взявших получают делением на разрыв охвата. Но делить так можно не всегда и не всё, а получившаяся величина относится не ко всем подряд. Седьмой урок берёт эту развилку целиком: кому предложили, кто взял и почему одно и то же «семьдесят два процента» на одних и тех же данных означает два разных числа.

тренажёр урока 6

Нет эффекта или нет прибора

Три интервала из работ с паспортами и прибор, у которого настоящие внутриклассовая корреляция, размер школы и связь замеров, а три ручки ваши: число единиц распределения, разрыв охвата и истинный размер эффекта. Экран считает ширину интервала и подписывает, каких содержательных величин он не исключает. Второй экран помечен учебным до первой цифры: сотня разыгранных испытаний при ваших настройках.

Открыть тренажёр

Ключевые работы

Banerjee A, Karlan D, Zinman J, American Economic Journal: Applied Economics, введение выпуска2015Сводное введение к выпуску из шести рандомизированных испытаний микрокредита в шести странах на четырёх континентах. Отсюда взято главное методическое утверждение урока: разрыв охвата между группой предложения и контролем назван главным определителем статистической мощности и у работ выпуска опускался до девяти процентов. Там же: на работу приходится в среднем пятьдесят оценённых эффектов при минимуме тридцать шесть и максимуме восемьдесят два. Ни одна из шести не нашла значимых на десятипроцентном уровне эффектов даже на половине проверенных исходов, разброс от 6 до 39 %. Есть и оговорка авторов о том, что многие нулевые результаты составляют часть интервалов, содержащих экономически значимые величины в одну или в обе стороны.
Banerjee A, Duflo E, Glennerster R, Kinnan C, American Economic Journal: Applied Economics2015Кластерное рандомизированное испытание в бедных кварталах Хайдарабада: 104 квартала, в 52 выбранных жребием открылись отделения кредитора. Объём: 6 862 домохозяйства на первом замере через пятнадцать-восемнадцать месяцев после открытия отделения. Исходы: факт займа, вложения и прибыль бизнеса, потребление по статьям, школа детей, индекс самостоятельности женщин из шестнадцати показателей. Отсюда взята центральная пара урока: индекс прав женщин +0,007 стандартного отклонения при 95-процентном интервале от −0,04 до +0,05 и потребление +10,24 рупии 2007 года на человека в месяц при контроле 1 419, у которого интервал на взявших заём идёт от +60 % до −43 % при разрыве охвата 8,4 процентного пункта (26,7 % против 18,3 %). Интервалы напечатаны в сносках к таблицам, а не в самих таблицах.
Angelucci M, Karlan D, Zinman J, испытание микрокредита в Мексике при ставке 110 % годовых, American Economic Journal: Applied Economics2015Кластерное рандомизированное испытание расширения группового кредитования в северо-центральной Соноре: 238 кластеров, 16 560 подробных анкет домохозяйства и бизнеса в 2011-2012 годах, в среднем 26 месяцев работы кредитора в квартале при разбросе от нуля до 34. Исходов 35 в шести семьях. Ставка по займу составляет около 110 % годовых, и это середина рынка для займов такого размера в Мексике. После поправки на множественность значимы 12 из 35 средних эффектов. Вреда среди найденного нет, и авторы отдельно оговариваются, что многие их нулевые результаты имеют интервалы, включающие экономически значимые величины. Данные собирала независимая фирма, не связанная с кредитором.
Bold T, Kimenyi M, Mwabu G, Ng'ang'a A, Sandefur J, Journal of Public Economics2018Кластерное рандомизированное испытание, встроенное в общенациональную реформу найма учителей в Кении: 192 государственные начальные школы, по 24 из каждой из восьми провинций, с июня 2010 по октябрь 2011 года, а исходом были баллы тестов учеников. Отсюда взят пример счёта мощности по самому испытанию: при внутриклассовой корреляции 0,33 в итоговых тестах минимально обнаружимый эффект на одну ветвь составил около 0,26 стандартного отклонения, а полученные оценки (0,184 при стандартной ошибке 0,088 и −0,022 при ошибке 0,090) оказались меньше этого порога, о чём авторы пишут прямо. Числа из авторской рабочей версии ноября 2016 года. В рабочей версии 2013 года на том же месте стояло 0,15-0,18, а в журнальной публикации 0,19.
Ioannidis JPA, Stanley TD, Doucouliagos H, The Economic Journal2017Не отдельная работа, а сплошной разбор чужих сводов: 159 эмпирических литератур экономики, 64 076 оценок параметров из более чем 6 700 работ. Медианная статистическая мощность оценена в 18 % или ниже, и в половине областей почти 90 % результатов мощностью не обеспечены. При взвешенном сведении достаточно мощных результатов около 80 % опубликованных эффектов оказываются преувеличенными, обычно вдвое, а треть из них вчетверо и больше. Выборка там состоит из мета-анализов по всей эмпирической экономике, а не из полевых испытаний в развитии, и переносить 18 % на них нельзя. В уроке это сказано прямо.

Что подтвердилось, а что нет

мифШесть испытаний микрокредита доказали, что микрокредит не работает.

Так пишут пересказы, а авторы выпуска написали обратное и в том же введении. Дословно у них: многие нулевые результаты составляют часть доверительных интервалов, содержащих экономически значимые величины в одну или в обе стороны, и статистическая мощность остаётся серьёзной трудностью исследований влияния микрокредита. Ни одна из шести работ не нашла значимых на десятипроцентном уровне эффектов даже на половине проверенных исходов, разброс шёл от 6 до 39 % при среднем числе оценённых эффектов пятьдесят на работу и разрыве охвата, опускавшемся до девяти процентов. Правильная запись результата принадлежит им же: преобразующий эффект исключён, умеренный исключить не удалось.

выдержалоРазрешающая способность одного и того же испытания различается по его исходам в разы.

Хайдарабадское испытание мерило и то и другое одним опросом на 6 862 домохозяйствах из 104 кварталов, на первом замере через пятнадцать-восемнадцать месяцев после открытия отделения кредитора. По индексу самостоятельности женщин из шестнадцати показателей оценка +0,007 стандартного отклонения при 95-процентном интервале от −0,04 до +0,05: прирост больше одной двадцатой стандартного отклонения исключён. По потреблению оценка +10,24 рупии 2007 года на человека в месяц при контрольном среднем 1 419 и 90-процентном интервале от −52 до +72. В пересчёте на взявших заём интервал идёт от +60 % до −43 %. Разница не в сроке и не в объёме выборки: они одинаковы. Она в том, что вторую величину пришлось делить на разрыв охвата в 8,4 процентного пункта, а вместе с ней разделился и интервал.

спор открытМикрокредит вредит заёмщикам в среднем.

Обе стороны стоят в одном и том же введении, и обе названы его авторами. Первая: свидетельств вреда в этих работах мало, и при индивидуальной ответственности в Боснии и Монголии, и при реальной ставке 110 % годовых в Мексике, где после поправки на множественность значимы 12 из 35 средних эффектов и вреда среди них нет. Вторая: найденное всё-таки есть и названо поимённо. В Боснии значимо снизилось потребление и школьная посещаемость шестнадцати-девятнадцатилетних, в Эфиопии выросла доля семей, сообщавших о нехватке еды. Величин этих снижений введение не приводит. Разрешить спор мешает третье: многие из здешних нулей неточны, и интервалы вокруг них содержат экономически значимые величины в обе стороны. То есть по вреду это отсутствие прибора, а не точный ноль, и по этим работам вопрос не решается ни в одну сторону.

источника нетМощность типичного полевого испытания в развитии составляет около 50 %.

Величина ходит по методическим разговорам и восходит к цитате без расчёта: работы, где эти 50 % были бы посчитаны на выборке полевых испытаний в развитии, не находится. Существующие оценки мощности говорят про другое. По 159 эмпирическим литературам экономики, 64 076 оценкам из более чем 6 700 работ, медианная мощность оценена в 18 % или ниже, но выборка там состоит из мета-анализов по всей эмпирической экономике, и переносить это число на полевые испытания нельзя. Там же, где мощность считали по конкретному испытанию, выходили конкретные величины: минимально обнаружимый эффект около 0,26 стандартного отклонения на ветвь при 192 школах за шестнадцать месяцев наблюдения. Это не «проверили и не подтвердилось»: проверять было нечего.

Термины

мощностьstatistical power
Вероятность обнаружить эффект заданной величины, если он на самом деле есть. Мощности вообще не бывает: она всегда относится к конкретной величине эффекта, конкретному числу единиц распределения и конкретной доле охваченных программой.
ошибка второго родаtype II error
Не найти эффекта, который есть. Мощность равна единице минус вероятность такой ошибки. В отличие от ошибки первого рода, уровень которой объявляют заранее пятью или десятью процентами, эту вероятность в отчётах называют редко.
минимально обнаружимый эффектminimum detectable effect
Наименьшая величина эффекта, которую испытание способно отличить от нуля при заданных вероятностях ошибиться в обе стороны. Считается до начала работы. Про эффекты мельче этой величины испытание молчит, и молчание его говорит о приборе, а не об их отсутствии.
доверительный интервалconfidence interval
Пара чисел вокруг оценки, полученная по объявленному правилу так, что при многократном повторении опыта интервал накрывал бы истинную величину в объявленной доле случаев. Читается по краям, а не по середине: содержательный вопрос всегда в том, какие величины края исключают.
точный нольprecisely estimated null
Оценка вблизи нуля с узким интервалом вокруг неё, из которого крупные эффекты в обе стороны исключены. Это утверждение о мире и его можно проверить: надо назвать величину и посмотреть, лежит ли она за краем интервала.
неточный нольimprecise null
Оценка вблизи нуля с широким интервалом, накрывающим и заметный рост, и заметное падение. Это утверждение о приборе, а не о мире, и верная его запись: «мы не знаем». В пересказах он неотличим от точного нуля, потому что оба зовутся словом «незначимо».
разрыв охватаtake-up gap
Разница между долей людей, получивших вмешательство в группе предложения, и той же долей в контрольной группе. В полевом испытании программы её обычно нельзя довести до единицы: предложение принимают не все. Оценку на принявших получают делением на этот разрыв, и вместе с оценкой делится её ошибка, поэтому маленький разрыв делает интервал широким.
преобразующий эффектtransformative effect
Изменение, которое меняет положение домохозяйства качественно, а не на несколько процентов от прежнего уровня. Слово пришло из формулировки авторов сводного введения к выпуску шести испытаний микрокредита и полезно тем, что его можно проверить: надо назвать величину, ниже которой эффект перестаёт быть преобразующим, и посмотреть, исключена ли она интервалом.

Практикум · Подписать пять нулей по сорту

Час и одна работа с большим числом исходов: испытание программы, медицинская статья, отчёт об оценке. Считать почти ничего не нужно. Задача в том, чтобы у каждого «незначимо» найти края интервала и решить, что эти края исключают.

  1. Выпишите из таблиц работы пять исходов, у которых эффект назван незначимым, вместе с точечной оценкой и единицей, в которой она измерена.
  2. Найдите к каждому доверительный интервал или стандартную ошибку. Если в таблице их нет, ищите в сносках и в приложении: там они стоят чаще, чем в самой таблице.
  3. Напишите для каждого одной строкой, какие содержательные величины интервал не исключает. Величину берите не с потолка, а ту, ради которой программу затевали.
  4. Подпишите каждый из пяти нулей: точный, если крупные эффекты в обе стороны исключены, и неточный, если интервал накрывает и заметную пользу, и заметный вред.
  5. Проверьте, сказано ли в работе, какой минимально обнаружимый эффект закладывался до начала, и сравните его с тем, что получилось. Если такого расчёта нет вовсе, запишите это отдельной находкой.

Вопросы для самопроверки

Вопрос 1

Два исхода одного испытания. У первого интервал идёт от −0,04 до +0,05 стандартного отклонения, у второго интервал идёт от падения на 43 % до прироста на 60 %. Что отсюда следует?

  • Второй исход измерен на меньшей выборке и за более короткий срок, потому интервал вокруг него шире
  • Оба результата незначимы, поэтому означают они одно и то же: эффекта у программы нет
  • Первый интервал уже потому, что составные индексы измеряются точнее денежных величин
  • У первого крупные эффекты исключены, и это результат, а второй не исключает почти ничего, и это сведение о приборе
Вопрос 2

Введение к выпуску шести испытаний микрокредита называет главный определитель статистической мощности. Что это?

  • Разрыв охвата: разница между долей взявших заём в группе предложения и той же долей в контроле
  • Число опрошенных домохозяйств: выборки этих работ различаются между собой более чем в пятнадцать раз, и мощность растёт вместе с ними
  • Число проверяемых исходов: их в среднем пятьдесят на работу, и чем их больше, тем ниже мощность каждого
  • Реальная ставка по займу: она различается в девять раз, и от неё зависит сама величина искомого эффекта
Вопрос 3

Испытание сообщает: минимально обнаружимый эффект составляет 0,26 стандартного отклонения. Что это значит?

  • Что эффектов мельче 0,26 стандартного отклонения в этом испытании не нашлось ни у одного из проверенных исходов
  • Что найденный эффект составил 0,26 стандартного отклонения и оказался значимым
  • Что стандартная ошибка оценки в этом испытании равна 0,26 стандартного отклонения на каждую из его ветвей
  • Что эффекты мельче этой величины испытание от нуля не отличит, и молчание его о них ничего не значит
Вопрос 4

Работа 2017 года оценила медианную статистическую мощность в эмпирической экономике в 18 %. Как этим числом пользоваться в разговоре о полевых испытаниях в развитии?

  • Считать, что у полевых испытаний мощность примерно такая же: дисциплина одна и журнальный отбор один
  • Считать это число верхней границей: у полевых испытаний мощность выше, ведь данные они собирают сами и под собственный вопрос
  • Не переносить вовсе: там выборка из мета-анализов по всей эмпирической экономике, а мощность испытания считают по нему самому
  • Считать это число нижней границей: у полевых испытаний мощность ниже, ведь предложение программы принимают далеко не все
Вопрос 5

У половины исходов шести испытаний микрокредита интервалы широкие. Какой вывод отсюда сделать нельзя?

  • Слабость прибора признали сами авторы этих испытаний и написали об этом в собственном введении
  • Широкие интервалы здесь означают недобросовестность: авторам стоило просто опросить больше домохозяйств
  • Про такие исходы верна запись «мы не знаем», а не «эффекта нет», и различает их ширина интервала
  • Точный ноль по индексу самостоятельности женщин в том же испытании остаётся результатом

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Banerjee A., Karlan D., Zinman J. «Six Randomized Evaluations of Microcredit: Introduction and Further Steps». American Economic Journal: Applied Economics, 2015, 7(1):1-21: Для этого урока нужны два места, и оба вне аннотации. Третий раздел: разрыв охвата назван главным определителем статистической мощности и опускается до девяти процентов. Конец четвёртого: среднее число оценённых эффектов на работу, доля значимых от 6 до 39 % и последний абзац с оговоркой о том, что многие нулевые результаты составляют часть интервалов с экономически значимыми величинами.
  • Banerjee A., Duflo E., Glennerster R., Kinnan C. «The Miracle of Microfinance? Evidence from a Randomized Evaluation». American Economic Journal: Applied Economics, 2015, 7(1):22-53: Открытая копия лежит в депозите MIT DSpace и совпадает с журнальной вёрсткой. Читать надо сноски к таблицам 6 и 7: интервалы напечатаны именно там, а в самих таблицах их нет. Обе строки этого урока стоят рядом: исключённый прирост больше 0,05 стандартного отклонения по индексу прав женщин и интервал от +60 % до −43 % по потреблению на взявших заём.
  • Angelucci M., Karlan D., Zinman J. «Microcredit Impacts: Evidence from a Randomized Microcredit Program Placement Experiment by Compartamos Banco». American Economic Journal: Applied Economics, 2015, 7(1):151-182: Журнал закрыт, открыта рабочая версия NBER 19827. Читать введение: там сразу названы 12 значимых эффектов из 35 после поправки на множественность и оговорка о том, что многие нули имеют интервалы с экономически значимыми величинами. Полезно знать и то, что более ранняя рабочая версия ходила под другим названием, и при поиске две версии легко посчитать за две работы.
  • Bold T., Kimenyi M., Mwabu G., Ng'ang'a A., Sandefur J. «Experimental evidence on scaling up education reforms in Kenya». Journal of Public Economics, 2018, 168:1-20: Журнальная версия закрыта, открыта авторская рабочая версия ноября 2016 года, и числа курса взяты из неё. Для этого урока нужен абзац с расчётом мощности: внутриклассовая корреляция 0,33, минимально обнаружимый эффект около 0,26 стандартного отклонения на ветвь и прямое признание, что для найденных величин схема недостаточно мощна. Работ, где такое признание напечатано, немного.
  • Ioannidis J.P.A., Stanley T.D., Doucouliagos H. «The Power of Bias in Economics Research». The Economic Journal, 2017, 127(605):F236-F265: Открытая копия есть в свободном доступе. Здесь достаточно аннотации, но читать её надо целиком: первая половина даёт медианную мощность 18 %, вторая даёт преувеличение около 80 % опубликованных эффектов, обычно вдвое. И держать в голове границу выборки: это мета-анализы по всей эмпирической экономике, а не полевые испытания в развитии.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Борьба с бедностью»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?