Предрегистрация и план анализа эксперимента
Сорок процентов вероятности найти хоть что-нибудь, и что с этим делают индексы, поправки и план, написанный заранее
Предрегистрация исследования и план анализа, написанный до данных, нужны из-за арифметики множества исходов. Десять независимых проверок на пятипроцентном уровне дадут хотя бы одну ложную находку с вероятностью около 40 %. Поправка Бонферрони, сводный индекс и контроль доли ложных открытий отвечают на разные вопросы, а не строже друг друга. Запись в реестре Американской экономической ассоциации плана до сбора данных не означает: регистрировать разрешено на любой стадии.
«Toolkit» Дюфло, Гленнерстер и Кремера · Anderson 2008 · Casey, Glennerster, Miguel 2012 · Ofosu & Posner 2023 · 28 мин · обновлено 24.09.2026
После урока вы сможете
- Считать вероятность хотя бы одной ложной находки при нескольких независимых проверках
- Отличать подгруппу, объявленную заранее, от разбивки, придуманной после того, как данные увидели
- Называть три способа поправки на множественность и то, на какой вопрос отвечает каждый
- Читать q-величину рядом с оценкой и видеть, где у поправки проходит край
- Знать, что запись в реестре Американской экономической ассоциации не означает плана анализа, написанного до данных
Экономисты, оценившие общинную программу в Сьерра-Леоне, напечатали в приложении к статье результаты по всем 318 переменным исхода, какие собрали. Одно семейство этих переменных (про местные институты) насчитывало 146 штук. Из этих 146 авторы сложили две истории и напечатали обе рядом.
Первая история такая. Проект породил усталость от собраний: люди реже участвовали в решении, что делать с выданным брезентом, реже знали, на что он пошёл, реже хотели войти в комитет развития и реже ходили на местные выборы. Вторая история противоположна. Проект породил встречное коллективное действие: больше обучения общинных учителей, больше женских групп, чаще ведутся протоколы собраний, а вождь реже распоряжается брезентом единолично.
Обе собраны из коэффициентов одного и того же массива, и обе, по словам самих авторов, ложны. Дословно у них сказано: два правдоподобных, совершенно противоположных и одинаково ошибочных истолкования. Подделки здесь нет, есть арифметика. Исследователь, проверяющий десять независимых гипотез на пятипроцентном уровне, отвергнет хотя бы одну примерно с вероятностью 40 процентов.
Этот урок о том, что с этой арифметикой делают. Поправки, сводные индексы, объявленные заранее подгруппы и планы анализа, написанные до данных, это разные приёмы, и отвечают они на разные вопросы. У каждого приёма при этом есть край, за которым он перестаёт помогать.
Сорок процентов из десяти дверей
Считается это в две строки. Если проверка одна и порог пятипроцентный, вероятность промолчать при истинном нуле равна 0,95. Если проверок десять и они независимы, вероятность промолчать по всем десяти равна 0,95 в десятой степени, то есть 0,599. На «хотя бы одну находку» остаётся 0,401.
Слово «независимых» здесь несущее. Исходы одного испытания обычно связаны между собой: доход, потребление и активы двигаются вместе. При связанных исходах число выходит другим, и обычно меньшим. Поэтому самая грубая поправка, о которой ниже, считается чрезмерно строгой: она обращается с гипотезами как с независимыми.
Чем это кончается, пособие поля показывает на своём примере. Пусть эффект вмешательства оказался значим по баллам за математику и незначим по всем остальным предметам. Исследователь, который отчитается «программа сработала на математике, но не на других предметах», сделает неверный вывод. Одна значимая находка из десяти означает ровно то, что обещает случайность.
Первая защита от этого не арифметическая, а списочная. Правило пособия сказано дословно: все переменные, собранные в проспективной оценке, собирались как возможные исходы, и обо всех надо отчитаться независимо от того, значимы они или нет. Пока список исходов не опубликован, вероятность ложной находки считать не из чего. Число дверей и есть первое, чего в отчёте может не оказаться.
Фраза выглядит осторожной: автор не приписывает программе всего, а честно называет один предмет из нескольких. На деле это самая частая форма ошибки. Если предметов было десять и порог пятипроцентный, одна значимая находка при истинном нуле выпадает с вероятностью около 0,4, то есть чаще, чем в трети таких работ. Ошибка лечится числом, и числа два: сколько исходов проверяли и какая поправка применена. Без них «сработало на математике» не читается ни в какую сторону.
Три способа сузить сад
Первый способ называется поправкой Бонферрони: p-величину умножают на число проверок или, что то же самое, делят на это число порог. Приём простой и грубый. Пособие называет его чрезмерно консервативным ровно потому, что он считает все гипотезы независимыми. При десяти связанных исходах он выбросит и то, что выбрасывать не следовало.
Второй способ называется сводным индексом, он же средний стандартизованный эффект. Каждый из исходов делят на его стандартную ошибку, складывают и делят на число исходов. Связь между исходами при этом учитывают отдельно, системой внешне не связанных регрессий. Пособие предпочитает индекс совместной проверке всех исходов сразу: он однонаправлен и потому мощнее.
Третий способ отвечает уже на другой вопрос. Бонферрони и его ступенчатые родственники держат вероятность хотя бы одной ложной находки среди всех проверок. Контроль доли ложных открытий держит другое: какую долю среди объявленных находок мы согласны иметь ложной. Результат такого счёта печатают не p-величиной, а q-величиной, и читать её надо иначе.
Отсюда следствие, которое в пересказах теряется. Поправка не делает результат вернее и сама по себе не делает его надёжнее. Она меняет вопрос, на который отвечает число, а вместе с вопросом меняется и то, что значит слово «значимо». Три названных способа не строже и не мягче друг друга: они про разное.
Как было в поле в середине двухтысячных
Насколько всё это применялось, известно точно, потому что это посчитали. Обследование охватило рандомизированные оценки, вышедшие в рецензируемых журналах с 2004 по 2006 год по экономической и трудовой политике, образованию, криминологии, политологии и детскому благополучию. Это не одно исследование, а сплошной подсчёт статей по базе социальных наук. Нашлось их 44.
Числа такие. 37 работ из 44, то есть 84 процента, отчитались о проверке пяти и более исходов. 27 работ, то есть 61 процент, отчитались о проверке десяти и более. Хоть какую-нибудь поправку на множественность применили три работы из 44, то есть 7 процентов. Двое из этих троих взяли Бонферрони: самую грубую из возможных.
Автор обследования сам называет эти доли нижними границами. Проверок могло быть сделано больше, чем напечатано, и тогда доля работ с пятью и более исходами занижена. Обратного смещения тут нет: печатать поправку, которой не делали, незачем. Интервалов у этих долей первоисточник не приводит, и взять их неоткуда: это подсчёт всех найденных статей, а не выборка из них.
И граница у такого числа своя. Обследование меряет отчётность, а не истинность результатов. Из того, что поправку не применили, не следует, что находка ложна. Следует ровно одно: вероятность ложной находки в этих работах не считали никак.
Обследование сделано не ради счёта, а по ходу собственной задачи. Автор переоценивал три ранние американские программы дошкольного вмешательства с очень маленькими выборками, примерно от 60 до 120 человек. Общее число проверенных исходов там доходило до 47, и он свёл их в девять сводных индексов на каждый пол, объявив семьёй гипотез именно эти девять. Результат после такой сборки: у девочек польза видна и в короткую, и в длинную, у мальчиков значимой долгосрочной пользы нет. С «наивными» оценками, не поправленными на множественность, оба вывода выглядели неопределёнными.
Край поправки: три числа и семь прочерков
Как поправка выглядит на настоящих числах, видно на программе «большого толчка» для беднейших домохозяйств. Мерили на 21 063 взрослых в 10 495 домохозяйствах шести стран: Эфиопия, Гана, Гондурас, Индия, Пакистан, Перу. Первый замер прошёл через 2 года после начала, второй прошёл через 3. Исходы сведены в десять семей индексов, и q-величины посчитаны по Бенджамини-Хохбергу с поправкой на эти десять семей.
Три q-величины из десяти семей напечатаны в самой статье. Подушевое потребление: +0,12 SD при q = 0,001. Права женщин: +0,046 при q = 0,049, и единицы у этой величины первоисточник рядом не ставит. Физическое здоровье: +0,034 SD при q = 0,078. Саму программу, её состав и её цену курс разбирает отдельно. Здесь она нужна как прибор.
Теперь смотрим на порог. Потребление переживает любой разумный порог: 0,001 лежит далеко от края. А две другие семьи стоят по разные стороны от 0,05, и расстояние между ними составляет двадцать девять тысячных. Подвиньте порог на эти двадцать девять тысячных, и «физическое здоровье» окажется на той же стороне, где уже стоят «права женщин». Ни одного нового измерения при этом не случится.
Порог 0,05 при этом не измерен ни на ком. Это соглашение между исследователями, и после поправки на множественность оно соглашением быть не перестаёт. Вторая строка того же первоисточника это подтверждает: ко второму замеру физическое здоровье и права женщин значимость теряют, а потребление, продовольственная безопасность и активы держатся. Повторно опрошены 94 процента участников в первом замере и 91 процент во втором.
Подгруппа, объявленная заранее, и подгруппа найденная
Второй способ открыть лишние двери: разрезать выборку. Пособие пишет об этом прямо: деление выборки по переменной, не входившей в исходный замысел, ведёт к добыче данных. И называет техническую причину. Множество возможных разрезов неизвестно, поэтому ни границы Бонферрони, ни подобные поправки посчитать нельзя, и стандартные ошибки не считаются как следует.
Самый строгий стандарт тут медицинский, и пособие его приводит. Если подгруппы не объявлены заранее, результаты по ним не считаются достаточным свидетельством для регистрации препарата: надзорное ведомство требует нового испытания, спланированного под эту подгруппу заранее. Причина названа там же. При свободе перебирать произвольное число подгрупп обычно удаётся найти такую, в которой вмешательство выглядит работающим.
Собственная позиция поля мягче. Сообщать разбивки, придуманные после, можно, но отчёт обязан очень ясно показать, какие подгруппы объявлены заранее, а какая придумана потом. Это требование к тексту, а не к арифметике. Проверяется оно чтением, а не пересчётом, и потому обходится молчанием легче всего.
И тут же в пособии стоит оговорка, которая переворачивает интуицию. В кластерном испытании у подгруппы может остаться почти столько же мощности, сколько у всей выборки. Обычное испытание ограничивает себя само: разрезал выборку, потерял мощность и ничего не увидел. Кластерное так себя не ограничивает, и соблазн разрезать в нём больше, а не меньше. Объяснение, которым пособие эту оговорку сопровождает (будто число людей в группе важнее для мощности, чем число групп), расходится с формулой пятого урока. Своё объяснение у курса есть. Разрез по признаку, который различает людей внутри группы, оставляет число групп прежним и режет только глубину, а от глубины порог обнаружения зависит слабо.
Тренажёр: сад из десяти дверей
К уроку приложен тренажёр ishody, и экранов в нём три. Первый: жеребьёвка. Набор разыгран уже при загрузке. Читатель ставит число проверяемых исходов и уровень значимости, жмёт «Разыграть заново» и видит, в скольких из ста воображаемых испытаний нашлась хотя бы одна находка при истинном нуле. Числа этого экрана учебные: они смоделированы, и пометка об этом стоит перед ними, а не после.
Тут же печатается проверка, посчитанная формулой: при десяти исходах и пятипроцентном пороге 1 − 0,95¹⁰ = 0,401. Экран не оценивает читателя и не сообщает, сколько исходов мерить правильно. Он показывает одно: как быстро растёт вероятность находки с числом дверей.
Второй экран показывает край поправки, и числа на нём из работы, с паспортом прямо на экране: 21 063 взрослых в 10 495 домохозяйствах, шесть стран, замер через два года, поправка Бенджамини-Хохберга по десяти семьям исходов. Три настоящие q-величины стоят на своих местах: 0,001, 0,049 и 0,078. Порог читатель двигает сам и смотрит, какие семьи оказываются ниже него. У остальных семи в столбце q стоит прочерк, и он подписан: в базе курса выписаны только эти три, и учебные числа вместо недостающих не подставляются.
Третий экран: чем лечат. На нём обследование 44 работ 2004-2006 годов с его долями 84, 61 и 7 процентов и приём со сведением 47 исходов в девять индексов. Читатель переключает способ поправки (никакой, Бонферрони, сводный индекс, контроль доли ложных открытий) и смотрит, что каждый делает с находками из первого экрана. Вердиктов тренажёр не выносит: он не называет правильную поправку и не оценивает ни программу, ни читателя.
Реестр, который не предрегистрация
Реестр рандомизированных испытаний Американской экономической ассоциации завели решением её исполнительного комитета в апреле 2012 года. На 22 августа 2026 года он числит 12 626 исследований в 171 стране. Числа растут, и дата снятия здесь часть числа.
Дальше начинается то, из-за чего он попал в этот урок. Политика журналов ассоциации требует: всякая работа с полевым экспериментом должна быть зарегистрирована до подачи статьи в печать. И тут же сказано дословно, что регистрировать можно на любой стадии испытания: предстоящего, идущего или завершённого. Сам реестр отдельной строкой приглашает регистрировать и прошлые исследования.
Отсюда простое следствие. Запись в реестре говорит, что испытание зарегистрировано до подачи статьи, и молчит о том, был ли план анализа написан до сбора данных. Часть полей может быть закрыта до окончания испытания, а конфиденциальные документы хранятся и без разрешения исследователя не открываются. Проверка черновых регистраций редакцией реестра существует только с 5 января 2017 года и занимает от двух до пяти рабочих дней.
И ещё одна строка оттуда же. Это не одобренный реестр клинических испытаний в том смысле, в каком его понимают медицинские журналы, так сказано на самом сайте. Предрегистрация и регистрация различаются не словом, а временем. Первая означает, что план анализа зафиксирован до того, как исследователь увидел данные. Вторая означает, что испытание внесено в список.
Так читают запись в реестре и журналисты, и сами исследователи в пересказах чужих работ. Официальная политика говорит обратное открытым текстом: регистрировать разрешено предстоящее, идущее и завершённое испытание, а прошлые работы реестр приглашает вносить отдельно. Журналы требуют успеть до подачи статьи, и это никак не связано с моментом, когда автор впервые посмотрел на свои данные. Проверить, что было раньше (план или данные), по самой записи нельзя: для этого нужен текст плана и дата его закладки.
Что доходит до отчёта
Планы предварительного анализа в поле есть, и их тоже посчитали. Обследование взяло 195 планов, зарегистрированных на двух площадках в 2011-2016 годах. До публично доступной статьи довели дело 93 из них. Это не одно исследование, а разбор набора документов, и авторы сами предупреждают: сегодня картина могла бы выйти другой.
Когда регистрировали, известно точно. 81 процент планов зарегистрирован до сбора данных, остальные 19 зарегистрированы после сбора, но до того, как авторы получили доступ к своим данным. То есть до анализа зарегистрированы были все. Это та часть, которая работает.
Вторая половина про то, насколько план был точен. Ясные гипотезы сформулировали 90 процентов планов, первичные зависимые переменные ясно задали 77 процентов, точную статистическую модель указали 68, а способ счёта стандартных ошибок указали 37. Число контрольных переменных осталось неясным у 44 процентов. Среди планов, заявивших больше пяти гипотез, заранее обязались поправляться на множественность 29 процентов.
Что из этого дошло до статей, считали по 93 работам. Все заранее заявленные первичные гипотезы честно представлены в 61 проценте случаев. Больше трети работ имели хотя бы одну зарегистрированную гипотезу, о которой не отчитались нигде, а медианная статья не сообщила о четверти заявленных гипотез. Авторы обследования сами оговаривают: объём журнала, желание упаковать результат читабельнее и просьбы редакторов объясняют многие пропуски лучше, чем недобросовестность. Рядом стоит и обнадёживающее: все работы, где заранее прописали, что делать с пропусками, несоблюдением назначения и выбросами, этим правилам в статьях следовали.
Ту же вещь измерили ещё раз, по медицинской линейке. Инструмент собрали из консенсусных документов медицины и приложили к 54 отчётам об экономических испытаниях 2001-2011 годов и к 54 медицинским того же периода. Все критерии отчётности о смещении отбора проходят 12 экономических работ против 40 медицинских, а поток участников от набора до анализа описан в 17 против 51.
Две строки оттуда стоит прочесть внимательно. Предварительный расчёт размера выборки заявлен в двух работах из 54, и авторы сами пишут, что почти уверены: другие такие расчёты делались и не были напечатаны. Граница всей работы объявлена в её аннотации: измерена отчётность, а не смещение. Из ненапечатанной детали не следует, что она сделана плохо.
Измерено вот что: у 21 063 взрослых в 10 495 домохозяйствах шести стран исходы свели в десять семей и посчитали q-величины через два и через три года после начала программы. Отдельно посчитано, как часто поле объявляет число исходов и поправляется на него. Отсюда не следует решение о самой программе, и причина предметная. Порог 0,05 означает соглашение исследователей, а не свойство мира, и никакая поправка соглашение в измерение не превращает. А решение требует ещё и того, чего в q-величинах нет вовсе: цены такой программы там, где её будут вести, и того, кто будет её вести. Принимают его те, кто распоряжается этим бюджетом и отвечает за исполнение. Испытание говорит, что случилось в этом месте при этих условиях. Что из этого делать: решение, а не измерение, и курс его не принимает.
Что дальше
Из урока выходит очередной вопрос к любому сообщению об эффекте: сколько исходов мерили и сколько из них показали. Если число дверей неизвестно, значимость одной находки не читается вовсе. Если известно и поправка сделана, спрашивать надо, какая именно: три названных приёма отвечают на разные вопросы.
Следующий урок открывает разбор одного испытания от начала до конца. Это кенийская дегельминтизация 1998 года, то есть работа, из которой выросла половина спора о методе. Начинается разбор с самого скучного и самого нужного: что именно в ней измерили, каким прибором и на ком.
Сад из десяти дверей
Три экрана. На первом вы ставите число исходов и порог и разыгрываете сто воображаемых испытаний при истинном нуле. Числа этого экрана учебные, и пометка стоит перед ними. На втором показаны три настоящие q-величины программы «большого толчка» и семь прочерков, и порог двигаете вы. На третьем показаны сплошной подсчёт 44 оценок середины двухтысячных и четыре способа обойтись с множественностью, приложенные к вашему набору с первого экрана.
Ключевые работы
| Duflo E, Glennerster R, Kremer M, «Using Randomization in Development Economics Research: A Toolkit», рабочий документ NBER | 2006 | Методическое пособие поля, а не отдельная работа: измерений в нём нет. Читан полный текст рабочего документа, а опубликованная версия вышла главой в Handbook of Development Economics 2007 года. Отсюда взяты разделы о множественных исходах и подгруппах: арифметика 1 − 0,95¹⁰ = 0,401 при десяти независимых проверках на пятипроцентном уровне, разбор поправки Бонферрони как чрезмерно консервативной, устройство сводного индекса, правило отчитываться обо всех собранных исходах независимо от значимости и требование ясно различать в отчёте подгруппы, объявленные заранее и придуманные после. |
| Anderson ML, переоценка трёх ранних американских программ дошкольного вмешательства, Journal of the American Statistical Association | 2008 | Переоценка трёх ранних рандомизированных программ дошкольного вмешательства с очень маленькими выборками, примерно от 60 до 120 человек. Число проверенных исходов доходило до 47, и они сведены в девять сводных индексов на каждый пол. Контроль вероятности хотя бы одной ложной находки сделан методом ступенчатого пересчёта, отдельно посчитана доля ложных открытий. Вывод: у девочек польза видна и в короткую, и в длинную, значимой долгосрочной пользы у мальчиков нет. Здесь же напечатан сплошной подсчёт 44 рандомизированных оценок 2004-2006 годов: 84 процента мерили пять и более исходов, 61 процент мерили десять и более, 7 процентов применили хоть какую-то поправку. |
| Casey K, Glennerster R, Miguel E, оценка общинной программы в Сьерра-Леоне по плану предварительного анализа, Quarterly Journal of Economics | 2012 | Кластерное рандомизированное испытание общинной программы развития с планом предварительного анализа, заложенным в архив до итогового обследования: базовое обследование 2005 года, итоговое 2009-го. План задавал исходы и спецификации по одиннадцати областям воздействия, а в приложении раскрыты результаты по всем 318 переменным исхода. Двенадцатая гипотеза добавлена из уже включённых переменных, и авторы называют это отступление сами. Из 146 переменных институционального семейства авторы сложили две противоположные и, по их собственным словам, одинаково ошибочные истории. При следовании плану сводный эффект по этому семейству оказался точно оценённым нулём. |
| Banerjee A, Duflo E, Goldberg N, Karlan D, Osei R, Parienté W, Shapiro J, Thuysbaert B, Udry C, программа «большого толчка» в шести странах, Science | 2015 | Рандомизированная оценка многосоставной программы для беднейших домохозяйств на шести площадках: Эфиопия, Гана, Гондурас, Индия, Пакистан, Перу. Объём: 21 063 взрослых в 10 495 домохозяйствах. Первый замер через 2 года после начала, второй через 3. Повторно опрошены 94 и 91 процент. Исходы сведены в десять семей индексов, q-величины посчитаны по Бенджамини-Хохбергу с поправкой на десять семей. Напечатаны три q-величины: подушевое потребление +0,12 SD при q = 0,001, права женщин +0,046 при q = 0,049, физическое здоровье +0,034 SD при q = 0,078. Ко второму замеру физическое здоровье и права женщин значимость теряют, а потребление, продовольственная безопасность и активы держатся. |
| Реестр рандомизированных испытаний Американской экономической ассоциации и политика её журналов, официальные страницы | 2026 | Не исследование, а два официальных документа, сняты 22 августа 2026 года: страница «о реестре» и страница политики журналов ассоциации. Реестр заведён решением исполнительного комитета в апреле 2012 года и числит 12 626 исследований в 171 стране. Требование журналов означает регистрацию всякой работы с полевым экспериментом до подачи статьи в печать. Регистрировать разрешено на любой стадии испытания, включая завершённое, а прошлые работы реестр приглашает вносить отдельно. Часть полей может быть закрыта до окончания испытания. Проверка черновых регистраций редакцией существует с 5 января 2017 года и занимает от двух до пяти рабочих дней. Отдельной строкой сказано, что это не одобренный реестр клинических испытаний в понимании медицинских журналов. |
| Ofosu GK, Posner DN, разбор 195 планов предварительного анализа, Perspectives on Politics | 2023 | Сплошной разбор набора документов, а не отдельная работа: 195 планов предварительного анализа, зарегистрированных на двух площадках в 2011-2016 годах, из них 93 доведены до публично доступной статьи. Полевые эксперименты 63 процента, опросные 27. До сбора данных зарегистрирован 81 процент планов, остальные 19 зарегистрированы после сбора, но до доступа авторов к данным. Ясные гипотезы у 90 процентов, первичные переменные у 77, статистическая модель у 68, способ счёта стандартных ошибок у 37. Число контрольных переменных неясно у 44 процентов. Среди планов с более чем пятью гипотезами поправку на множественность заранее обещали 29 процентов. В статьях все первичные гипотезы представлены в 61 проценте случаев, медианная работа не сообщила о четверти заявленных. |
| Eble A, Boone P, Elbourne D, сравнение отчётности экономических и медицинских рандомизированных испытаний, The World Bank Economic Review | 2017 | Сравнение отчётности по единому инструменту, собранному из консенсусных документов медицины и различающему шесть типов смещения. Оценены 54 отчёта об экономических рандомизированных испытаниях 2001-2011 годов и 54 медицинских отчёта того же периода. Все критерии отчётности о смещении отбора проходят 12 экономических работ против 40 медицинских. Поток участников от набора до включения в анализ описан в 17 против 51. Предварительный расчёт размера выборки заявлен в двух работах из 54, и авторы оговаривают, что почти уверены в существовании ненапечатанных расчётов. Граница объявлена в аннотации: измерена отчётность, а не смещение. |
Что подтвердилось, а что нет
Сплошной подсчёт по базе социальных наук нашёл 44 рандомизированные оценки, вышедшие в рецензируемых журналах с 2004 по 2006 год. Пять и более исходов проверяли 37 из них, то есть 84 процента. Десять и более проверяли 27, то есть 61 процент. Хоть какую-нибудь поправку применили три работы, то есть 7 процентов, и двое из троих взяли Бонферрони. Автор называет эти доли нижними границами: проверок могло быть больше, чем напечатано. Интервалов у долей первоисточник не приводит, и взять их неоткуда: это подсчёт всех найденных статей, а не выборка из них.
Официальная политика разрешает регистрировать испытание на любой стадии (предстоящее, идущее или завершённое), а сам реестр отдельной строкой приглашает вносить прошлые исследования. Журналы ассоциации требуют зарегистрировать до подачи статьи в печать, а не до сбора данных. Проверка черновых регистраций редакцией существует с 5 января 2017 года и занимает от двух до пяти рабочих дней. На 22 августа 2026 года реестр числит 12 626 исследований в 171 стране, и о том, у скольких из них план написан до данных, сведений он не даёт.
Один и тот же инструмент, собранный из консенсусных документов медицины, приложили к 54 экономическим отчётам 2001-2011 годов и к 54 медицинским отчётам того же периода. Все критерии отчётности о смещении отбора проходят 12 экономических работ против 40 медицинских. Поток участников от набора до включения в анализ описан в 17 против 51. Предварительный расчёт размера выборки заявлен в двух экономических работах из 54. Авторы оговаривают дословно: измерена отчётность, а не смещение, и из ненапечатанной детали не следует, что она сделана плохо.
Методическое пособие поля пишет обратное: в кластерном дизайне у подгруппы может остаться почти столько же мощности, сколько у всей выборки. Следствие из этого неприятное. Обычное испытание ограничивает себя само: разрезал выборку, потерял мощность и ничего не увидел. В кластерном такого ограничителя нет, поэтому соблазн перебирать подгруппы там больше, а не меньше, и требование объявлять подгруппы до данных весит там тяжелее. Объяснение, которым пособие эту оговорку сопровождает (будто число людей в группе важнее для мощности, чем число групп), расходится с формулой пятого урока. Курс объясняет иначе: разрез внутри группы оставляет число групп прежним и режет только их глубину.
Термины
- множественная проверка гипотезmultiple hypothesis testing
- Проверка нескольких гипотез на одних данных. Вероятность найти хотя бы одну ложную находку растёт с числом проверок: при десяти независимых проверках на пятипроцентном уровне она равна 0,401. Значимость отдельной находки без числа сделанных проверок не читается.
- поправка БонферрониBonferroni correction
- Простейшая поправка на множественность: p-величину умножают на число проверок или на это же число делят порог. Обращается с гипотезами как с независимыми и потому при связанных исходах выбрасывает больше нужного. Методическое пособие поля называет её чрезмерно консервативной.
- семья исходовoutcome family
- Группа показателей, объявленная единицей проверки вместо отдельных переменных. Поправку считают по числу семей, а не по числу переменных, поэтому от разбиения на семьи зависит и порог, и то, что окажется значимым. Разбиение объявляется вместе с результатом, иначе его нельзя проверить.
- сводный индексmean standardized treatment effect
- Способ свести несколько исходов в одну величину: каждый исход делят на его стандартную ошибку, складывают и делят на число исходов, а связь между исходами учитывают отдельно. Отвечает на вопрос, идут ли эффекты в одну сторону, и потому мощнее совместной проверки всех исходов сразу.
- доля ложных открытийfalse discovery rate
- Величина, которую держат вместо вероятности хотя бы одной ложной находки: какую долю ложного мы согласны иметь среди объявленных находок. Результат печатают q-величиной, а не p-величиной. Это не более строгая и не более мягкая поправка, а ответ на другой вопрос.
- подгрупповой анализsubgroup analysis
- Отдельная оценка эффекта в части выборки: по полу, возрасту, исходному уровню. Объявленный заранее, он обычная часть замысла. Придуманный после того, как данные увидели, поправке не поддаётся, потому что множество возможных разрезов неизвестно.
- план предварительного анализаpre-analysis plan
- Документ, в котором до данных записаны гипотезы, исходы, спецификации и правила обращения с пропусками, несоблюдением назначения и выбросами. Это проверяемое обещание, а не декларация: сверять статью с планом можно построчно.
- предрегистрацияpre-registration
- Фиксация плана анализа до того, как исследователь увидел данные. От регистрации испытания в реестре отличается временем: реестр принимает и завершённое испытание, и запись в нём сама по себе не свидетельствует о плане, написанном заранее.
Практикум · Посчитать двери в одной работе
Упражнение на сорок минут и на один отчёт о рандомизированном испытании: годится любой, у которого открыт полный текст с приложениями. Считать и пересчитывать ничего не нужно. Цель одна: увидеть, сколько дверей в этой работе и сколько из них показано читателю.
- Выпишите все исходы, о которых работа отчитывается, включая приложения. Считайте переменные, а не абзацы: одна таблица часто несёт десяток.
- Найдите, объявлены ли исходы первичными и вторичными, и где это объявлено: в самой статье, в реестре или нигде. Отсутствие такого деления запишите отдельной строкой.
- Проверьте, сведены ли исходы в семьи или в сводные индексы, и по какому числу семей считалась поправка. Число семей и число переменных выпишите рядом.
- Найдите, названа ли поправка по имени: Бонферрони, ступенчатая процедура, сводный индекс, контроль доли ложных открытий. Если имени нет, так и запишите: «поправка не названа».
- Выпишите все подгрупповые разбивки и отметьте у каждой, сказано ли в тексте, объявлена она заранее или придумана после. Молчание текста считайте отдельным ответом, а не отсутствием разбивки.
Вопросы для самопроверки
Откуда берётся вероятность 40 процентов, о которой пишет методическое пособие поля?
- Из арифметики: 1 − 0,95¹⁰ = 0,401 при десяти независимых проверках на пятипроцентном уровне
- Из доли работ, в которых при независимой перепроверке нашлась хотя бы одна ошибка кодирования или округления
- Из обследования 44 рандомизированных оценок, где поправку на множественность применили только 7 процентов работ
- Из расчёта мощности типичного полевого испытания, которой хватает примерно на четыре исхода из десяти
Чем контроль доли ложных открытий отличается от поправки Бонферрони?
- Он строже: после него значимыми остаются только находки с очень маленькими p-величинами, и число находок падает сильнее
- Он мягче: он позволяет объявить находкой любой результат ниже исходного порога значимости
- Он применяется к заранее объявленным подгруппам, а Бонферрони ко всем исходам работы сразу
- Он держит другую величину: долю ложного среди объявленных находок, и печатается q-величиной
Что означает запись испытания в реестре Американской экономической ассоциации?
- Что план анализа был подан в реестр до того, как исследователи получили доступ к своим данным и начали счёт
- Что испытание внесено в список, а регистрировать разрешено и уже завершённое
- Что испытание признано клиническим по стандарту медицинских журналов и внесено в их общий указатель
- Что редакция реестра проверила план анализа и приняла его к исполнению
Чем подгруппа, объявленная заранее, отличается от разбивки, придуманной после?
- У придуманной после неизвестно множество возможных разрезов, поэтому поправку на множественность посчитать не из чего
- Первая берётся из более крупной выборки, вторая из остатка, и потому у второй заведомо хуже мощность
- Придуманную после запрещено печатать в отчёте, поэтому в статьях остаются только объявленные заранее
- Различие только в порядке изложения: на арифметику самой оценки оно не влияет
Что из перечисленного НЕ следует из чисел этого урока?
- Что в кластерном испытании подгрупповой анализ теряет мощность меньше, чем в обычном
- Что значимость одной находки нельзя прочесть, не зная, сколько исходов проверяли
- Что порог 0,05 означает соглашение исследователей, а не измеренную на ком-то величину
- Что результаты работ, в которых поправку на множественность не применили, ложны
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Duflo E., Glennerster R., Kremer M. «Using Randomization in Development Economics Research: A Toolkit». NBER Technical Working Paper 333, 2006: Рабочий документ открыт, а опубликованная версия вышла главой в Handbook of Development Economics 2007 года. Нужны седьмые разделы: там и арифметика сорока процентов, и разбор Бонферрони, и устройство сводного индекса. Оговорку про мощность подгрупп в кластерном дизайне ищите не в начале раздела о подгруппах, а в самом его конце.
- Anderson M.L. «Multiple Inference and Gender Differences in the Effects of Early Intervention: A Reevaluation of the Abecedarian, Perry Preschool, and Early Training Projects». Journal of the American Statistical Association, 2008, 103(484):1481-1495: Открытая копия лежит на сайте автора в Беркли. Подсчёт 44 работ 2004-2006 годов стоит не в аннотации и не в выводах, а во вводной части, где автор обосновывает задачу: там и 84, и 61, и 7 процентов с описанием того, как искали статьи.
- Casey K., Glennerster R., Miguel E. «Reshaping Institutions: Evidence on Aid Impacts Using a Preanalysis Plan». Quarterly Journal of Economics, 2012, 127(4):1755-1812. Рабочая версия: NBER Working Paper 17012, май 2011: Рабочая версия открыта, журнальная закрыта. Читать стоит таблицу с двумя панелями: в одной собрана «плохая» история, в другой «хорошая», и обе сложены из значимых коэффициентов одного массива. Признание авторов, что они добавили двенадцатую гипотезу, стоит рядом и написано без прикрас.
- Ofosu G.K., Posner D.N. «Pre-Analysis Plans: An Early Stocktaking». Perspectives on Politics, 2023, 21(1):174-190: Открытая копия в репозитории Лондонской школы экономики. Главное не общая доля зарегистрированных до данных, а таблицы о содержании планов: что именно в них задано и что оставлено на потом. Оговорку авторов о том, что выборка кончается 2016 годом, читать обязательно вместе с числами.
- Eble A., Boone P., Elbourne D. «On Minimizing the Risk of Bias in Randomized Controlled Trials in Economics». The World Bank Economic Review, 2017, 31(3):687-707: Рабочая версия открыта в архиве Всемирного банка. Смотреть надо построчную таблицу сравнения с медициной, а не аннотацию: там видно, по каким именно строкам разрыв велик, а по каким его нет. Оговорка «это отчётность, а не смещение» стоит прямо в аннотации и снимает половину возможных перетолкований.