К содержанию
Фонтум Основы статистики Урок 23 / 24 Все уроки

Главная · Курсы · Основы статистики · Программа курса · Модуль VIII. Что с этим делать · урок 23 из 24

Как читать научные статьи

Шесть групп вопросов и одно сообщение, разобранное от заголовка до методов

Работу с числами читают в порядке «методы, результаты, обсуждение», а не от заголовка к выводу: смещение основы выборки, самоотбор и ошибка выжившего не видны в таблицах и обнаруживаются только в описании сбора данных. Проверка укладывается в шесть групп вопросов, и каждая закрывает один известный способ сломать вывод, от «откуда данные и кого в них нет» до отличия заявленного основного исхода от вынесенного в заголовок.

заявление ASA 2016 · Simmons и др., 2011 · 45 мин · обновлено 01.10.2026

После урока вы сможете

  • Читать работу в порядке «методы, результаты, обсуждение», а не наоборот
  • Задавать шесть групп вопросов, каждая из которых закрывает известный способ сломать вывод
  • Отличать заявленный основной исход от того, что вынесено в заголовок
  • Отделять пресс-релиз от исследования и понимать, на каком звене появляется преувеличение

Сообщение в ленте: «Перенос начала уроков на час позже повышает успеваемость школьников на четверть». Под ним ссылка на пресс-релиз университета, а под пресс-релизом ссылка на саму работу. Пример учебный, придуманы и числа, и школы, и результаты. Устроено сообщение при этом ровно так, как устроены настоящие, и разбирается тоже как настоящее.

К концу урока оно будет разобрано до конца, до формулировки, которую можно произнести, не соврав. Разбор занимает минут двадцать, не требует ни одной формулы и опирается только на арифметику и на вопросы, накопленные предыдущими двадцатью двумя уроками.

Урок устроен как чек-лист, а не как повторение. Курс уже показал, где вывод ломается. Здесь это превращается в порядок действий: что читать первым, что спрашивать, где остановиться и в какой момент можно перестать читать вовсе.

Порядок: методы раньше результатов

Обычный порядок чтения начинается с заголовка, дальше идёт вывод, потом, если хватит терпения, числа. Порядок неудачный по одной причине: к моменту, когда читатель доберётся до чисел, вывод у него в голове уже есть, и числа он будет разбирать не на предмет «что здесь показано», а на предмет «чем это подтверждается». Разница между этими двумя занятиями велика, и вторым занимаются охотнее.

Рабочий порядок обратный: сначала раздел о том, как собирались данные, потом таблицы с результатами, и только в конце авторское обсуждение. Обещание читать методы раньше результатов было дано во втором уроке, и вот его основание: ни один из механизмов, которые там разбирались, в числах не виден. Смещение основы выборки, самоотбор, ошибка выжившего не оставляют следов в таблице средних. Обнаружить их можно только в описании того, как объекты попадали в данные, и если этого описания нет, никакая аккуратность в расчёте положения не спасёт.

Отсюда первое практическое правило. Если раздела о сборе данных нет вовсе или он состоит из одной фразы вроде «был проведён опрос», читать дальше нечего: перед вами сообщение о результате, а не работа с числами. Это не обвинение авторам. Чаще всего такого раздела нет просто потому, что текст пересказывает работу, а не является ею. Значит, надо найти саму работу, и это отдельный шаг, который занимает минуту.

методВопрос, который задаётся первым

Что именно я увидел бы в этих таблицах, если бы эффекта не было вовсе? Если ответа нет, ни в виде числа, ни в виде описания процедуры, которая позволяет его получить, то работа не в состоянии отличить наличие эффекта от его отсутствия, и остальные вопросы можно не задавать.

Шесть групп вопросов

Вопросов много, но они делятся на шесть групп, и каждая закрывает один известный способ сломать вывод. Порядок групп важен: первые две решают, имеет ли смысл вообще смотреть на числа.

1. Откуда данные и кого в них нет. Из какого списка отбирали, кто мог не попасть, кто мог отказаться. Ответ формулируется не как оценка качества, а как направление сдвига: «недопредставлены такие-то, поэтому оценка завышена». Урок 2.

2. Эксперимент или наблюдение. Кто решал, в какую группу попадёт объект: жребий, исследователь или сам объект. Если распределяли не жребием, группы различаются не только тем, что сравнивают, и любое различие в результате объясняется двумя способами сразу. Уроки 16 и 17.

3. Какой размер эффекта. Не «значимо ли», а «сколько». Насколько велика разница, в каких единицах, и что она означает для одного человека, а не для средней по выборке. Заявление ASA (2016) формулирует это прямо: p-значение не измеряет ни величину эффекта, ни важность результата. Уроки 11 и 12.

4. Мощность и число сравнений. Сколько наблюдений в каждой группе и какой эффект такая выборка вообще способна заметить. И отдельно: сколько сравнений сделано на самом деле, по предметам, по подгруппам, по способам обработки. Эти два вопроса ходят парой, потому что маленькая выборка и много сравнений вместе дают почти гарантированную находку ниоткуда. Уроки 12 и 13.

5. Какой исход заявлен основным. Была ли одна названная заранее величина, по которой судят об успехе, и совпадает ли она с той, что вынесена в заголовок. Расхождение здесь даёт самый частый и самый дешёвый способ получить сенсацию из пустого результата. Уроки 13 и 21.

6. Согласуется ли вывод с другими работами. Единственная работа не устанавливает ничего, и это не придирка: опубликованная литература отобрана по значимости, а размер эффекта в повторениях систематически оказывается меньше исходного. Уроки 20 и 22.

Пресс-релиз и заголовок не исследование

Между работой и строкой в ленте стоит цепочка из трёх звеньев, и на каждом сообщение меняется. Авторы пишут статью, где вывод обставлен условиями. Пресс-служба университета пишет релиз, где условия занимают место, а место дорого. Редакция пишет новость по релизу, обычно не открывая статью. Заголовок к новости ставит выпускающий редактор, у которого задача не «передать содержание», а «сделать так, чтобы прочитали».

Отсюда следствие, которое стоит принять как техническое, а не моральное: заголовок не является утверждением авторов. Спорить с ним как с научным тезисом бессмысленно, смотреть надо, что в работе. Часто оказывается, что авторы написали ровно то, что показали, а преувеличение появилось на втором звене, и тогда претензии к исследованию оказываются претензиями к пресс-службе.

Вот признаки, по которым текст опознаётся как пересказ, а не как работа. Не назван объём выборки. Нет ни одного числа, кроме итогового процента. Есть прямая речь исследователя с оценкой значения открытия. Стоят глаголы «доказали», «установили», «выяснили» без указания условий. Нет ни единой оговорки. Отдельный сильный признак в том, что приведено только относительное изменение вроде «на четверть выше», а абсолютных чисел, из которых оно получено, нет.

Что делать дальше: искать источник. У работы есть название, авторы, журнал или препринт. В любой из этих форм найдутся краткое изложение, раздел о методах и таблицы, а дальше работают шесть групп вопросов.

осторожно«На четверть» не число

Относительное изменение без абсолютного не сообщает почти ничего. Рост доли с 41 % до 51 % это одновременно «на четверть больше», «на десять процентных пунктов больше» и «на двадцать человек из двухсот больше». Все три формулировки описывают одни и те же данные, а в заголовок попадает первая, потому что она самая крупная на вид.

Разбор до конца

Возвращаемся к сообщению про уроки. В работе, на которую оно ссылается, написано следующее. Шесть школ: три перенесли начало занятий с восьми часов на девять, три оставили как было. Всего 1 200 учеников, по 600 в каждой группе, по три параллели, то есть седьмые, восьмые и девятые классы, примерно по 200 человек в параллели на группу. Основным исходом в плане исследования назван средний годовой балл по всем предметам.

Откуда данные. Три школы не были выбраны жребием, они вызвались сами. Значит, они отличаются от остальных не только временем начала уроков: вызывается администрация, у которой хватает сил на перестройку расписания, и родители, которые согласны на новый график. Всё, что связано с этой готовностью, попадает в сравнение вместе с переносом.

Эксперимент или наблюдение. Наблюдение. Вывод «перенос повышает успеваемость» из такого устройства не следует даже при идеальных числах: он требовал бы, чтобы группы различались только переносом, а они различаются как минимум ещё и тем, что вызвались.

Основной исход. Средний годовой балл: 71,5 в перенёсших школах против 70,8 в остальных. Разница составляет 0,7 балла при разбросе баллов около 12. Стандартная ошибка разницы при шестистах наблюдениях в группе получается тоже около 0,7 балла, интервал тянется примерно от минус 0,7 до плюс 2,1 балла, p = 0,31. По заявленному основному исходу работа различия не обнаружила, а интервал совместим и с небольшим ухудшением, и с умеренным улучшением.

Откуда взялась четверть. Заголовок построен не на основном исходе, а на одной клетке таблицы: доля девятиклассников, справившихся с контрольной по математике на «четыре» и «пять», составила 51 % в перенёсших школах против 41 % в остальных, p = 0,04. Переведём в людей: 102 ученика из двухсот против 82 из двухсот, то есть двадцать человек разницы. Переведём в проценты по-другому: десять процентных пунктов. «На четверть» получается делением 51 на 41, выходит 1,24, и это округляют вверх.

Сколько сравнений. В таблицах результаты приведены по четырём предметам, в трёх параллелях, и для каждого сочетания даны два показателя, средний балл и доля справившихся. Четыре умножить на три и умножить на два: двадцать четыре сравнения. Если эффекта нет вовсе, при пороге 0,05 ожидаемое число значимых результатов равно 24 × 0,05 = 1,2. Вероятность получить хотя бы один значимый считается как единица минус 0,95 в двадцать четвёртой степени, то есть около 0,71, семь шансов из десяти. Найден ровно один. Это в точности то, что должно найтись при полном отсутствии эффекта.

Мощность. По основному исходу выборка приличная: шестьсот человек в группе, и эффект величиной в пятую часть стандартного отклонения такая работа заметила бы почти наверняка. А вот в подгруппе девятиклассников на группу приходится двести человек, и тот же эффект обнаруживается там примерно в половине повторений исследования. У этого есть неприятное следствие, о котором стоит помнить всегда: чтобы при малой мощности перейти порог, наблюдаемая разница должна оказаться крупной. Поэтому находки, добытые на маленьких подгруппах, при проверке систематически уменьшаются. Это тот самый механизм, который дал систематическое падение размера эффекта в проектах воспроизводимости из двадцать второго урока.

Что можно сказать честно. «В трёх школах, которые сами вызвались перенести начало занятий, средний годовой балл не отличался от трёх остальных, а интервал для разницы тянется от небольшого ухудшения до умеренного улучшения. В одной подгруппе из двадцати четырёх проверенных различие перешло порог значимости и составило двадцать учеников из двухсот. Работа совместима и с отсутствием эффекта, и с эффектом, различить который эта выборка не в состоянии.» Из такой формулировки заголовок не следует ни в какой форме. Но и обратный заголовок «перенос уроков не помогает» из неё не следует тоже, и это вторая половина навыка.

Где остановиться и что повышает доверие

Чек-лист нужен не для того, чтобы забраковать всё. Вот три ситуации, в которых дальше действительно можно не читать. Нет описания сбора данных. Не назван заранее заявленный основной исход, а результатов в таблицах много. В тексте есть только относительные изменения без абсолютных. Во всех остальных случаях разбор даёт не приговор, а формулировку того, что именно показано и насколько узко.

Есть и признаки, работающие в обратную сторону, и знать их полезно не меньше. Указана ссылка на предрегистрацию с датой раньше начала сбора данных. Назван один основной исход, и результат по нему приведён первым, независимо от того, понравился он авторам или нет. Приведены интервалы, а не только p-значения. Выложены данные и код, на которых можно повторить расчёт. Есть независимое повторение другой группой. Ни один из этих признаков не гарантирует правильности вывода, но каждый закрывает конкретную дырку из тех, что курс разбирал в седьмом модуле.

Перечисленное здесь не список пожеланий. Это набор практик, который сложился за последние двадцать лет как прямой ответ на разобранные поломки, и последний урок курса посвящён тому, что именно изменилось и что из этого можно взять себе.

на заметкуРазбор не приговор

Итог хорошего разбора звучит как «показано вот что, в таких-то границах», а не как «работа плохая». Формулировка с границами проверяема и с ней можно работать дальше, а отказ читать числа не даёт ничего и обходится дороже, чем кажется.

Ключевые работы

Wasserstein, Lazar, «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician 70(2), 129-1332016Шесть принципов Американской статистической ассоциации: p-значение не измеряет ни величину эффекта, ни важность результата, а решения не должны приниматься по одному порогу.
Simmons, Nelson, Simonsohn, «False-Positive Psychology», Psychological Science 22(11), 1359-13662011Свобода в выборе момента остановки, ковариат, условий и обработки выбросов поднимает вероятность получить p < 0,05 при отсутствии эффекта существенно выше 5 %.
Open Science Collaboration, «Estimating the Reproducibility of Psychological Science», Science2015Значимый результат получили 97 % оригинальных работ и 36 % повторений, а средний размер эффекта упал примерно вдвое.

Что здесь путают

сильно ослабленоКорреляция не означает причинности, этим разбор наблюдательной работы и заканчивается.

Как утверждение верно, как позиция в разговоре бесполезно: произнёсший его обычно останавливается, хотя работа только начинается. Корреляция при определённых условиях является свидетельством о причине, и содержательный вопрос в том, каковы эти условия в конкретном случае: кто решал, в какую группу попадёт объект, какие смешивающие факторы измерены, что было бы, если бы причина отсутствовала. В разборе примера этого урока фраза про корреляцию не даёт ничего, а вопрос «кто вызвался переносить занятия» даёт направление сдвига.

отвергнутоОсновной исход не значим, значит, эффекта нет.

Отсутствие свидетельства эффекта не является свидетельством отсутствия эффекта. Незначимость означает только, что данные совместимы с нулевой моделью, и она совместима с ними тем легче, чем меньше мощность. Проверяется это не спором, а интервалом: если он тянется от заметного ухудшения до заметного улучшения, работа не различает варианты, и правильный вывод звучит как «не установлено», а не «опровергнуто». Разница между двумя формулировками решает, надо ли ставить исследование заново.

сильно ослабленоЗаголовок исказил исследование, потому что журналист не разобрался.

Звеньев в цепочке три, и преувеличение входит на любом. Пресс-служба вправе выбирать, какой из результатов вынести, и обычно выносит самый крупный на вид. Редакция пересказывает релиз. Заголовок ставит выпускающий редактор, который статью не читал и читать не обязан. Практический вывод не «журналисты плохи», а «заголовок не является утверждением авторов»: прежде чем предъявлять претензию, стоит открыть работу, иногда она содержит ровно то, что показано, с оговорками на месте.

Термины

основной исходprimary outcome
Единственная величина, названная заранее как та, по которой судят об успехе. Всё остальное считается вторичным.
вторичный исходsecondary outcome
Любая дополнительная измеренная величина. Результат по ней требует отдельной проверки и не заменяет основного.
подгрупповой анализsubgroup analysis
Сравнение внутри части выборки: по полу, возрасту, параллели. Всегда менее мощное, чем сравнение целиком, и всегда умножает число сравнений.
абсолютное и относительное изменениеabsolute and relative change
Разница в исходных единицах и её отношение к базе. Из двух чисел в заголовок попадает то, что крупнее на вид.
протокол исследованияstudy protocol
Описание плана: гипотеза, основной исход, объём выборки, правила обработки. Записанный заранее, он превращает порог значимости в осмысленную величину.
размер эффектаeffect size
Величина различия или связи в единицах, которые можно истолковать: баллы, минуты, доли, стандартные отклонения. В отличие от p-значения, не зависит от объёма выборки.
мощностьstatistical power
Вероятность обнаружить эффект заданной величины при условии, что он существует. Равна единице минус вероятность ошибки второго рода. Низкая мощность делает незначимость неинформативной, а значимость завышенной.
препринтpreprint
Полный текст работы, выложенный до или помимо журнальной публикации. Позволяет добраться до методов и таблиц, не имея подписки.

Практикум · Разбор одной публикации

Работа на живом материале: нужна настоящая новость с числами, вышедшая за последнюю неделю, и первоисточник, до которого вы дойдёте сами. Не учебный пример. На разбор уходит от двадцати минут до сорока, из них половина приходится на поиск источника.

  1. Найдите новость, где утверждается связь или эффект и есть хотя бы одно число. Выпишите заголовок дословно, а отдельно от него фразу, которую вы считаете главным утверждением сообщения.
  2. Дойдите до первоисточника: по названию работы, авторам или журналу. Отметьте, сколько звеньев вы прошли, считая новость, пресс-релиз и работу. Если источник найти не удалось, зафиксируйте это как результат и разберите пресс-релиз по признакам из урока.
  3. Прочитайте раздел о методах раньше результатов и ответьте на первые две группы вопросов письменно: из какого списка набраны объекты и кто решал, в какую группу они попадут. Ответ на первый вопрос сформулируйте как направление сдвига.
  4. Найдите заявленный основной исход и результат по нему. Отдельно посчитайте, сколько всего сравнений приведено в таблицах, и умножьте это число на 0,05. Столько значимых результатов ожидается при полном отсутствии эффекта. Сверьте с тем, сколько их найдено.
  5. Напишите одно предложение вида «показано вот что, в таких-то границах» и поставьте его рядом с заголовком. Если два предложения совпали, случай редкий и хороший, его стоит запомнить. Если разошлись, укажите звено цепочки, на котором разошлись.

Вопросы для самопроверки

Вопрос 1

Отчёт о рассылке: «Новая тема письма увеличила открываемость на 50 %». В приложении: 1,2 % против 0,8 %, по 5 000 писем на вариант. Как правильнее всего описать результат?

  • Без p-значения о результате нельзя сказать ничего: абсолютные числа без проверки значимости не интерпретируются
  • Прирост в 50 % это крупный эффект, тему стоит менять во всех рассылках: относительная величина и есть мера пользы
  • Различие слишком мало, чтобы быть настоящим: при долях меньше 2 % статистические методы неприменимы
  • Разница составляет 0,4 процентного пункта, около двадцати писем на пять тысяч, и «плюс 50 %» описывает те же данные
Вопрос 2

В работе заявлен один основной исход, различия по нему нет. Значимая разница найдена в одной из двадцати проверенных подгрупп. Какая формулировка честная?

  • Заявленный исход не подтвердился, а находка в подгруппе поисковая и требует проверки на новых данных
  • Находка в подгруппе весома, потому что перешла порог 0,05: порог одинаков для основного исхода и для подгрупп
  • Работа опровергла гипотезу: основной исход не показал различий, а это и есть отрицательный результат
  • Эффект есть, но проявляется только в определённой подгруппе: именно на неё и указывает значимое различие
Вопрос 3

Две работы измеряли одно и то же. В первой 600 человек в группе, во второй 60. Обе получили p чуть меньше 0,05, но во второй наблюдаемый эффект вдвое больше. Что разумно ожидать при повторении?

  • Что первая работа ошибочна: при таком объёме p должно быть меньше
  • Что обе работы повторятся одинаково, раз p у них близкие
  • Что вторая работа точнее: она нашла более сильный эффект
  • Что эффект во второй работе при повторении окажется заметно меньше
Вопрос 4

Два опроса о доходах дали одинаковые средние и одинаковые интервалы. В первом случайная выборка по адресам с двумя попытками дозвона, во втором форма на сайте городского портала. Что из этого следует?

  • Второй опрос лучше: на портале выборка больше, а больший объём при равном интервале означает более точный метод
  • Совпадение чисел ничего не говорит о совпадении качества: механизм отбора в числах не виден
  • Раз результаты совпали, оба опроса надёжны: независимое совпадение двух оценок подтверждает обе
  • Первый опрос надёжнее ровно во столько раз, во сколько у него уже интервал: ширина интервала и есть мера надёжности
Вопрос 5

Заголовок новости заметно сильнее вывода в самой статье. Что стоит сделать первым делом?

  • Проверить по работе, что показано, и не приписывать заголовок авторам
  • Считать работу ненадёжной: серьёзные исследователи следят за заголовками
  • Сравнить заголовок с пресс-релизом и принять релиз за позицию авторов
  • Написать авторам о недобросовестной подаче их результатов

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Wasserstein, Lazar, «The ASA Statement on p-Values», The American Statistician, 2016: Шесть принципов на четырёх страницах, написанных как памятка читателю. Здесь они и работают как памятка: третий и пятый закрывают половину чек-листа урока.
  • Simmons, Nelson, Simonsohn, «False-Positive Psychology», Psychological Science, 2011: Откуда берётся находка в одной подгруппе из двадцати четырёх. Читается как инструкция от противного.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Основы статистики»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?