К содержанию
Фонтум Основы статистики Урок 20 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль VII. Где статистика ломается · урок 20 из 24

Публикационное смещение

Почему литература смещена, даже когда все работают честно

Публикационное искажение это систематическое расхождение между проведёнными и опубликованными исследованиями: решение о публикации зависит от результата. Недобросовестности не требуется: если сто лабораторий проверяют нулевой эффект при пороге 0,05, около пяти получат значимый результат. Читатель увидит именно их. Долю верных среди значимых задают базовая доля истинных гипотез, мощность и порог: это выкладка Иоаннидиса 2005 года.

Ioannidis, 2005 · Open Science Collaboration, 2015 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Объяснять, как отбор публикаций по значимости смещает литературу без чьей-либо недобросовестности
  • Считать долю верных результатов среди значимых по базовой доле истинных гипотез и мощности
  • Показывать на числах, почему при малой мощности опубликованный размер эффекта завышен
  • Формулировать, каких работ не хватает, чтобы прочитанное число можно было понимать буквально

Представим сто лабораторий, независимо друг от друга проверяющих одну и ту же гипотезу: новая методика обучения повышает результат теста. Пусть на самом деле она не повышает ничего, истинный эффект в точности равен нулю. Каждая лаборатория работает добросовестно, берёт порог 0,05, заранее фиксирует, что будет измерять, и в промежуточные данные не подглядывает.

Примерно пять лабораторий из ста получат p < 0,05. Не потому, что кто-то ошибся, а потому, что порог ровно это и означает: примерно одна случайная выборка из двадцати даёт отклонение, которое мы условились считать необычным. Остальные девяносто пять получат «различие не обнаружено».

Теперь спросим, что из этого попадёт в журналы. Пять находок дают готовый материал для статьи: результат новый, значимый, есть о чём рассказать. Девяносто пять «ничего не нашли» остаются материалом, в котором рецензент не видит вклада, редактор не видит новизны, а сам автор чаще всего даже не садится писать: незаконченная папка на диске выгоднее, чем полгода на текст, который отклонят.

В литературе окажется пять работ, и все пять покажут, что методика работает. Никто не солгал, ни одна из пяти статей не содержит ошибки, каждая честно докладывает то, что получила. И тем не менее читатель, добросовестно изучивший всё опубликованное по теме, придёт к выводу, прямо противоположному истине. Этот урок про механизм, который так делает, и про то, как считать поправку на него.

Три фильтра и ящик стола

Отбор происходит не в одном месте, а в трёх, и это важно, потому что чинить приходится каждое.

Автор. Незначимый результат тяжелее опубликовать, а время конечно. Работа откладывается «до лучших данных» и остаётся в ящике стола. Отсюда и название механизма, эффект ящика стола: литература состоит из того, что вынули, а оценивать её приходится вместе с тем, что осталось внутри.

Рецензент. Незначимый результат труднее оценить: непонятно, эффекта нет или мощности не хватило. Замечание «выборка мала, вывод неубедителен» справедливо почти всегда, и оно чаще звучит там, где результат отрицательный, потому что там оно легче формулируется.

Редактор. Место в журнале ограничено, и решение принимается по ожидаемой ценности. Сообщение «мы проверили и не нашли» ценно ровно настолько, насколько сильно кто-то ожидал обратного, а такое бывает редко.

Ни один из трёх не делает ничего предосудительного. Каждый принимает решение, которое по отдельности защитимо. Но их совместное действие устроено как фильтр, пропускающий результаты по признаку значимости, а значит, литература систематически смещена в сторону эффектов, и величина смещения тем больше, чем меньше эффектов на самом деле есть.

Полезно проговорить, чем это отличается от смещения выборки из второго урока. Там в данные не попадали определённые люди. Здесь в данные не попадают определённые исследования. Механизм тот же самый, попадание в выборку связано с измеряемой величиной. Но стоит он на уровень выше: смещена не выборка внутри работы, а выборка самих работ.

методВопрос к любой ссылке на литературу

Не «сколько работ подтверждают», а «сколько работ по этой теме было проведено». Первый вопрос почти всегда имеет ответ, второй почти никогда, и именно поэтому первый почти ничего не значит. Пять подтверждений из пяти опубликованных и пять из ста проведённых это два разных мира, неразличимых по списку литературы.

Арифметика Ioannidis

В 2005 году Джон Иоаннидис опубликовал в PLoS Medicine работу с заголовком «Почему большинство публикуемых результатов исследований ложны». Это эссе, а не эмпирическое измерение, и вся его сила в одной арифметической выкладке, которую стоит проделать самому.

Возьмём поле, где за год проверяется 1000 гипотез, и пусть верны из них 100, то есть одна десятая. Мощность исследований равна 0,5, порог 0,05. Считаем четыре клетки.

Из 100 верных гипотез значимый результат дадут 50 (это и есть мощность), остальные 50 будут пропущены. Из 900 неверных значимый результат дадут 45, это 5 % от 900, то есть ложные срабатывания на пороге. Значимых результатов всего 95, и верны из них 50. Доля верных среди значимых составляет примерно 53 %.

Проверьте это число на ощущение. Каждая из 95 работ докладывает «p < 0,05», и вроде бы каждая имеет пятипроцентный шанс ошибиться. На деле шанс ошибиться у случайно взятой из них близок к половине. Разница возникает оттого, что 5 % считается от неверных гипотез, которых 900, а 50 % от верных, которых 100. Это ровно та же арифметика базовой частоты, что в пятом уроке про медицинский тест, только вместо больных и здоровых здесь истинные и ложные гипотезы.

Теперь опустим мощность до 0,2, для небольших исследований такая величина не экзотическая. Верных гипотез значимыми станут 20, ложных срабатываний по-прежнему 45. Значимых результатов 65, верны из них 20: доля падает до 31 %. Мощность не изменила ни одной гипотезы и ни одного порога, но перевернула вывод о литературе.

Отсюда виден и порог, за которым большинство опубликованного оказывается неверным. При мощности 0,2 доля верных среди значимых опускается ниже половины, как только истинных гипотез среди проверяемых меньше 20 %. При мощности 0,5 для этого достаточно, чтобы их было меньше примерно 9 %. Эти два числа считаются в одну строчку и стоят того, чтобы посчитать их своей рукой в практикуме.

Третья величина в аргументе это число независимо работающих групп. Пусть двадцать команд проверяют одну и ту же неверную гипотезу, каждая на пороге 0,05. Вероятность того, что хотя бы одна из них получит значимый результат, равна единице минус 0,95 в двадцатой степени, то есть примерно 0,64. Почти в двух случаях из трёх в литературе появится подтверждение несуществующего эффекта, а девятнадцать неудачных проверок останутся в ящиках столов, потому что рассказывать о них негде. Чем интереснее тема и чем больше групп ею занято, тем надёжнее срабатывает этот механизм.

осторожноЗаголовок сильнее содержания

Работа Ioannidis (2005) считается основополагающей для метанауки, но передавать её как «измерено: больше половины статей ложны» неверно. Это модельный расчёт при заданных допущениях о доле истинных гипотез, мощности и числе групп. Стоит подставить другие допущения, и ответ окажется другим, а в этом весь смысл: вывод показывает, от чего доля зависит, а не чему она равна.

Недобросовестность не требуется

Это главный пункт урока, и его стоит сформулировать отдельно, потому что при разговоре о смещённой литературе разговор обычно сворачивает на подтасовки.

Во всех примерах выше не было ни одного нечестного действия. Сто лабораторий из вводного примера работали безупречно. Пять опубликованных статей содержат корректные расчёты и правдивые описания процедуры. Рецензенты не покрывали друзей, редакторы не продавали место. И тем не менее итоговая картина ложна.

Из этого следует практический вывод, неудобный для привычного разговора о науке. Если бы искажение порождалось недобросовестностью, лечилось бы оно контролем: поймать, проверить, отозвать статью. Но искажение порождается правилом отбора, а правило нельзя поймать за руку. Лечится оно только изменением самого правила: публикацией отрицательных результатов, предрегистрацией плана до сбора данных, форматом, где решение о публикации принимается по описанию замысла, а не по тому, что получилось.

Есть и обратная сторона, о которой стоит помнить, чтобы не впасть в противоположную крайность. Из существования механизма не следует, что конкретная прочитанная вами работа неверна. Смещение остаётся свойством совокупности публикаций, а не отдельной статьи, и утверждение «эта статья ошибочна, потому что литература смещена» такая же ошибка перехода, как вывод о человеке из статистики по группе.

Малая мощность завышает найденный эффект

У публикационного искажения есть второе действие, менее заметное и более важное для чтения чисел. Оно не только наполняет литературу лишними находками, но и раздувает те находки, которые верны.

Пусть методика действительно работает и повышает результат в среднем на 4 балла. Пусть исследование маленькое, и стандартная ошибка разности средних составляет те же 4 балла: разброс оценки такой же по величине, как сам эффект. Порог значимости при таком разбросе составляет примерно две стандартные ошибки, то есть 8 баллов.

Первое следствие касается мощности. Значимый результат получится, если оценка превысит 8 при истинном значении 4, то есть отклонится вверх на одну стандартную ошибку. Это происходит примерно в 16 % случаев. Мощность такого исследования составляет около одной шестой: пять раз из шести настоящий эффект останется незамеченным, и это разбиралось в двенадцатом уроке.

Второе следствие важнее. Всякая работа, которая всё-таки пересечёт порог, покажет эффект не меньше 8 баллов, вдвое больше истинного. Не потому, что оценка сама по себе смещена: до отбора она честно колеблется вокруг четырёх. Смещение вносит отбор. Публикуются ровно те выборки, где случайность сыграла вверх, и средняя опубликованная оценка окажется где-то около девяти-десяти при истине в четыре.

Это явление называют проклятием победителя: выигрывает конкурс за публикацию тот, кому больше повезло, и его число тем сильнее преувеличено, чем жёстче конкурс. Обратите внимание, что оба следствия вытекают из одной величины, а именно из мощности. При мощности 80 % порог достигается уже при оценках, близких к истинному эффекту, и завышение почти исчезает. Малая мощность не просто мешает найти эффект, но и гарантирует, что найденный будет преувеличен.

Отсюда прямо следует то, что увидели проекты по воспроизводимости: при повторении на большой выборке эффект оказывается систематически меньше опубликованного. Это не свидетельство обмана и даже не обязательно свидетельство того, что исходный результат ложен. Это ожидаемое поведение оценки, отобранной по превышению порога. Числам, которые получили эти проекты, посвящён двадцать второй урок.

на заметкуНесмещённость до отбора и после

Оценка разности средних несмещена: в среднем по всем возможным выборкам она равна истинному значению. Но «в среднем по всем выборкам» и «в среднем по опубликованным выборкам» означают разные величины, и вторая больше первой всякий раз, когда публикация зависит от значения оценки. Свойство оценки при этом никуда не делось, просто изменился набор, по которому усредняют.

Как читать литературу, зная это

Полностью снять смещение при чтении нельзя, ведь недостающих работ у вас нет. Но три приёма делают чтение заметно осторожнее.

Первый: спросить о мощности поля, а не отдельной работы. Если в области принято работать на выборках, где мощность заведомо мала, то значимые результаты в ней встречаются в основном потому, что незначимые не публикуются, а размеры эффектов завышены по построению. Это оценка литературы целиком, и она делается до чтения конкретной статьи.

Второй: посмотреть на форму совокупности результатов. Существует простой приём, надо расположить все известные по теме оценки эффекта против их точности: маленькие исследования дают широкий разброс, большие узкий. При отсутствии искажения картина симметрична относительно общего среднего и сужается кверху, как воронка. Если из неё выеден угол и маленьких исследований с малым и отрицательным эффектом нет вовсе, перед вами тот самый ящик стола, ставший видимым. Приём диагностический, а не доказывающий: асимметрия может возникнуть и по другим причинам.

Третий: изменить вес одиночной находки. Одно значимое исследование в поле с низкой мощностью даёт слабое свидетельство, а не сильное. Правильная реакция на новость «исследование показало» звучит не как «значит, это так», а как вопрос: сколько групп занималось этим вопросом и что стало с их результатами.

И последнее, о чём легко забыть. Метаанализ, добросовестно собравший все опубликованные работы, наследует смещение целиком и вдобавок придаёт ему узкий доверительный интервал. Объединение смещённых оценок не отменяет смещения, а делает его увереннее, ловушка ровно та же, что с выборкой в два миллиона из второго урока. Вопрос «как отбирались вошедшие работы» к метаанализу задаётся раньше, чем вопрос об их числе.

Ключевые работы

Ioannidis, «Why Most Published Research Findings Are False», PLoS Medicine 2(8): e1242005Модельный расчёт: доля верных среди значимых результатов зависит от доли истинных гипотез среди проверяемых, мощности исследований и числа независимо работающих групп. Эссе, а не эмпирическое измерение доли.
Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-1332016Принцип четвёртый заявления: корректный вывод требует полной отчётности и прозрачности. Выборочная публикация результатов делает интерпретацию p-значений невозможной.
Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science2015Повторение 100 исследований: значимый результат в 97 % оригиналов и в 36 % репликаций, средний размер эффекта r = 0,403 против примерно 0,20. Ожидаемая картина при отборе публикаций по значимости.

Что здесь путают

отвергнутоПубликационное искажение следует из недобросовестности исследователей.

Механизм воспроизводится при полностью корректном поведении всех участников. Сто честных лабораторий, порог 0,05, нулевой истинный эффект дают пять безупречных статей, все с положительным результатом. Ни автор, откладывающий незначимую работу, ни рецензент, требующий большей выборки, ни редактор, отбирающий по новизне, не совершают ничего предосудительного. Отсюда следствие: контроль за добросовестностью искажение не устраняет, потому что чинить надо правило отбора, а не людей.

сильно ослабленоУстановлено, что большинство публикуемых результатов ложны.

Ioannidis (2005) показал не это. Работа это эссе с модельным расчётом: при заданных допущениях о доле истинных гипотез, мощности и числе независимых групп доля верных среди значимых опускается ниже половины. Заголовок оказался сильнее содержания и живёт отдельно от него. Верная передача звучит скучнее и полезнее: доля верных среди опубликованных находок зависит от трёх измеримых величин, и при низкой мощности в поле с редкими истинными гипотезами она мала.

отвергнутоНезначимый результат публиковать незачем: он ничего не сообщает.

Незначимый результат сообщает ровно столько, сколько позволяет мощность, и при достаточной мощности он информативен: он сужает диапазон возможных величин эффекта. Но главное даже не в этом. Значение отдельного значимого результата вычисляется только вместе со знанием о том, сколько проверок было сделано всего. Отбрасывая незначимые работы, поле уничтожает знаменатель, без которого числитель невозможно истолковать, и делает собственную литературу непригодной для расчёта.

Термины

публикационное искажениеpublication bias
Систематическое расхождение между совокупностью проведённых исследований и совокупностью опубликованных, вызванное тем, что решение о публикации зависит от результата.
эффект ящика столаfile-drawer problem
Накопление неопубликованных исследований с незначимым результатом. Делает недоступным читателю знаменатель, то есть число проведённых проверок.
доля верных среди значимыхpositive predictive value
Вероятность того, что значимый результат отражает реальный эффект. Зависит от доли истинных гипотез, мощности и порога, а не от одного лишь p-значения.
базовая доля истинных гипотезbase rate of true hypotheses
Какая часть проверяемых в области гипотез верна до всякого эксперимента. Чем она ниже, тем большая часть значимых результатов оказывается ложными срабатываниями.
мощностьstatistical power
Вероятность обнаружить эффект заданной величины при условии, что он существует. Равна единице минус вероятность ошибки второго рода. Низкая мощность делает незначимость неинформативной, а значимость завышенной.
воронкообразный графикfunnel plot
Диаграмма оценок эффекта против их точности. Асимметрия воронки служит диагностическим признаком публикационного искажения, но не его доказательством.
метанаукаmeta-research
Исследование самого исследовательского процесса: как результаты получаются, отбираются, публикуются и воспроизводятся.

Практикум · Посчитать долю верных для своего поля

Задача в том, чтобы получить собственные числа, а не согласиться с чужими. Понадобится калькулятор и та область, о которой вы читаете новости: медицина, экономика, педагогика, спортивная наука, подойдёт любая, где вам попадаются заголовки «исследование показало».

  1. Выберите область и оцените, сколько из 1000 проверяемых в ней гипотез верны. Запишите число и одну фразу обоснования: смелые ли там гипотезы или проверяют в основном давно ожидаемое. Точность здесь не нужна, нужна явно названная величина.
  2. При мощности 0,5 и пороге 0,05 заполните четыре клетки: сколько верных гипотез дадут значимый результат, сколько будут пропущены, сколько ложных срабатываний придёт от неверных гипотез, сколько неверных будут отвергнуты правильно.
  3. Посчитайте долю верных среди всех значимых результатов. Сравните её с 5 %, с тем числом, которое читатель обычно держит в голове, увидев «p < 0,05».
  4. Повторите расчёт при мощности 0,2, ничего больше не меняя. Запишите обе доли рядом и подбором найдите, при какой доле истинных гипотез результат опускается ровно до половины.
  5. Добавьте отбор публикаций: вычеркните все незначимые клетки, ведь их читатель не увидит. Напишите одно предложение о том, какой процент подтверждений покажет литература вашего поля и чему он равен на самом деле.

Вопросы для самопроверки

Вопрос 1

В поле проверяется 1000 гипотез, верны 200 из них. Мощность 0,4, порог 0,05. Сколько будет значимых результатов и какая доля из них верна?

  • 40 значимых, и все они ложные: порог 0,05 отсекает только неверные гипотезы
  • 120 значимых, верны две трети
  • 200 значимых, верны 40 %: значимыми становятся все верные гипотезы без исключения
  • 80 значимых, и все они верны
Вопрос 2

По теме вышли пять статей, и все пять нашли эффект. Что из этого следует?

  • Почти ничего, пока не известно, сколько работ по теме было проведено
  • Что истинный размер эффекта близок к среднему из пяти опубликованных: усреднение независимых оценок снимает случайную ошибку
  • Что эффект надёжно установлен: пять подтверждений
  • Что вероятность совпадения равна 0,05 в пятой степени
Вопрос 3

Как корректно передать содержание работы Ioannidis (2005)?

  • Измерено, что больше половины опубликованных статей содержат ложные выводы
  • Установлено, что доля ложных публикаций растёт год от года
  • При заданных допущениях о доле истинных гипотез, мощности и числе групп доля верных среди значимых может опускаться ниже половины
  • Показано, что p-значения непригодны для научного вывода
Вопрос 4

Истинный эффект равен 4 баллам, стандартная ошибка оценки тоже 4 балла. Что можно сказать о работах, которые получат значимый результат?

  • Их оценка будет занижена, потому что мощность мала
  • Их оценка будет колебаться около 4 баллов: оценка несмещённая
  • Значимых работ не будет вовсе: эффект слишком мал
  • Их оценка будет не меньше примерно 8 баллов, то есть завышена вдвое и сильнее
Вопрос 5

Метаанализ собрал все опубликованные работы по теме и получил уверенный положительный эффект с узким интервалом. Что нужно выяснить прежде всего?

  • Согласуется ли полученная величина с теоретическими ожиданиями: расхождение с теорией и есть первый признак смещения
  • Как отбирались вошедшие работы и сколько исследований осталось неопубликованными
  • Каков объём выборки в самом крупном из вошедших исследований
  • Применялась ли поправка на множественные сравнения внутри работ: метаанализ обязан пересчитывать её заново по всем вошедшим сравнениям

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Ioannidis, «Why Most Published Research Findings Are False», PLoS Medicine, 2005: Открытый доступ, читается за вечер. Читать стоит ради выкладки, а не ради заголовка: полезно проследить, какие допущения делают вывод сильным и что происходит при их изменении.
  • Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science, 2015: Данные, на которых видно предсказанное здесь падение размера эффекта. Разбирается в двадцать втором уроке.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?