К содержанию
Фонтум Доказательная медицина Урок 2 / 24 Все уроки

Главная · Курсы · Доказательная медицина · Программа курса · Модуль I. Почему кажется, что помогло · урок 2 из 24

Уровни доказательности в медицине

Почему «есть исследование» не ответ, пока не сказано, какое именно

Уровни доказательности, или иерархия доказательств, расставляют типы исследований по силе: внизу мнение специалиста и описания случаев, в середине наблюдательные работы, выше рандомизированные, а наверху систематический обзор с метаанализом. Порядок задаёт один признак: сколько посторонних объяснений результата отсекает ступень, а число участников по лестнице не поднимает. Расставлены типы, а не отдельные работы: плохо сделанное рандомизированное исследование бывает слабее хорошего когортного.

Иерархия доказательств, первое современное рандомизированное сравнение (1948), CAST (1989-1991) и WHI (2002) · 22 мин · обновлено 01.10.2026

После урока вы сможете

  • Расставлять типы исследований по силе и объяснять, чем обоснован этот порядок
  • Понимать, почему рандомизация стоит выше наблюдения при любом числе участников
  • Знать, почему систематический обзор весит больше одной работы
  • Не делать двух зеркальных ошибочных выводов: «нет РКИ, ничего не известно» и «есть исследование, значит доказано»

Спор за столом идёт четверть часа и никуда не движется. Один говорит, что средство работает: он пробовал сам, и у сестры получилось. Другой отвечает, что читал про исследование, где ничего не подтвердилось.

Со стороны кажется, что доводы уравновешены и дело сводится к тому, кому больше доверяешь. На самом деле они не равны, и различие между ними можно объяснить без всякой медицины. Оно в том, какие объяснения результата каждый из доводов исключает.

Личный опыт не исключает ничего из трёх механизмов прошлого урока. Исследование, устроенное правильно, исключает их все сразу. Из этой разницы и вырастает иерархия доказательств, то есть порядок, в котором типы исследований расставлены по силе.

Лестница, а не выключатель

Первое, что стоит принять: «доказано» и «не доказано» не образуют двух ячеек, между которыми распределяются утверждения. Доказательства бывают разной силы, и сила эта измеряется не убедительностью изложения, а устройством проверки. Поэтому правильная картинка здесь не выключатель, а лестница.

Ступеней в ней шесть, и снизу вверх они выглядят так. Мнение специалиста и личный опыт. Описание отдельного случая и серия случаев. Исследование «случай-контроль». Когортное исследование. Рандомизированное контролируемое исследование. Систематический обзор с метаанализом качественных рандомизированных работ.

Дальше пройдём по ступеням снизу вверх и на каждой спросим одно и то же: какие посторонние объяснения результата эта ступень отсекает, а какие оставляет. Именно ответ на этот вопрос и расставляет ступени по порядку. Никакой другой причины у иерархии нет.

мнение и личный опытописание и серия случаевслучай-контролькогортное исследованиерандомизированноесистематический обзоротсекает почти всёне отсекает ничего
Ступени расставлены по одному признаку: сколько посторонних объяснений каждая отсекает

Нижние ступени: опыт и случаи

На нижней ступени стоит мнение специалиста и личный опыт. Прошлый урок объяснил, почему они там: три механизма улучшения без лечения действуют здесь в полную силу, и разделить их нечем. Опыт врача отличается от опыта пациента только числом наблюдений, но не устройством вывода.

На следующей ступени стоят описание случая и серия случаев. Врач заметил необычное течение болезни и описал его подробно, а потом собрал десяток похожих. Это уже полезнее личного впечатления, потому что подробности зафиксированы и доступны другим.

Но группы сравнения здесь по-прежнему нет, и потому серия случаев не отвечает на вопрос «помогает ли». Она отвечает на другой вопрос, тоже важный: «бывает ли такое вообще». Серия случаев служит способом заметить явление и предложить гипотезу, а не проверить её.

Недооценивать эту ступень не стоит. Именно с описания нескольких случаев начинались истории почти всех неожиданных побочных эффектов и новых болезней. Гипотезу надо откуда-то взять, и берут её чаще всего отсюда.

Средние ступени: наблюдение

Дальше идут два типа исследований, в которых сравнение уже есть, а вмешательства исследователя ещё нет. Оба называются наблюдательными, и различаются они направлением взгляда во времени.

Случай-контроль. Берут людей с болезнью и похожих людей без неё, а затем смотрят назад: чем группы отличались раньше. Способ быстрый и незаменимый для редких болезней, но память участников подводит, а подбор «похожих» всегда спорен.

Когортное исследование. Берут большую группу здоровых, записывают, кто как живёт, и наблюдают вперёд годами. Кто-то заболевает, кто-то нет, и различия между ними ищут в том, что записали в начале. Взгляд вперёд надёжнее взгляда назад, потому что данные собраны до того, как исход стал известен.

Обе ступени страдают одной общей болезнью, и она разбирается в следующем уроке подробно. Люди, выбравшие себе некоторый образ действий, отличаются от невыбравших не только им. Наблюдение честно показывает, что две группы различаются исходом, но не может сказать, что именно из множества различий этот исход создало.

на заметкуРазмер не поднимает по лестнице

Когортное исследование на двухстах тысячах человек остаётся когортным. Число участников уменьшает случайный разброс, но систематическое различие между группами оно не трогает: если группы отличались с самого начала, увеличение выборки только уточнит неверный ответ.

Верхняя ступень: сравнение с монетой

На предпоследней ступени исследователь перестаёт наблюдать и начинает распределять. Участников делят на группы жребием, и только после этого одна группа получает проверяемое лечение, а другая плацебо или обычную помощь. Это и есть рандомизированное контролируемое исследование, сокращённо РКИ.

Вся сила приёма в одной особенности жребия: он не спрашивает, кто есть кто. Группы получаются похожими не только по возрасту, полу и тяжести болезни, но и по всему, что никто не измерял и не догадался измерить. Ни один способ учёта различий такого не даёт, потому что учесть можно лишь то, что записали.

Первое современное сравнение такого рода провели в 1948 году: стрептомицин при туберкулёзе лёгких распределяли по жребию, а не по решению врача. Работа считается началом целой эпохи не из-за препарата, а из-за метода. С неё медицина получила способ отвечать на вопрос «помогает ли» так, чтобы ответ не зависел от того, кому досталось лечение.

К жребию обычно добавляют вторую защиту: ослепление. Пациент не знает, что получает, а в двойном ослеплении не знает и врач, который оценивает результат. Зачем это нужно и что происходит без этого, разбирает урок 3.

Над РКИ: сведение всех работ сразу

Наверху лестницы стоит не исследование, а способ обращаться с исследованиями. Систематический обзор собирает по заранее объявленным правилам все работы по одному вопросу: и удачные, и неудачные, и опубликованные, и найденные в регистрах. Если результаты можно сложить численно, обзор дополняют метаанализом.

Причина, по которой обзор весит больше отдельной работы, проста. Любое одно исследование могло получить свой результат случайно, и по нему одному различить случайность и закономерность нельзя. Несколько независимых работ, пришедших к одному ответу, различить это позволяют.

Есть и вторая причина, менее очевидная. Отдельная работа попадает в новости избирательно: громкий результат печатают, скучный реже, а вовсе неудавшийся иногда не печатают совсем. Систематический обзор ищет и то, что осталось непрочитанным, и потому даёт менее радужную и более верную картину. Урок 19 показывает, насколько велика бывает разница.

ловушка«Обзор» бывает и не систематическим

Статья, где автор перечисляет исследования, которые счёл нужным упомянуть, тоже называется обзором. Систематическим её делает объявленное заранее правило поиска и включения работ, то есть невозможность отобрать удобные. Разница между двумя видами обзоров больше, чем между соседними ступенями лестницы.

Правдоподобия в лестнице нет

Одного довода в этом списке нет вовсе, хотя в разговорах он встречается чаще всех остальных. Это объяснение механизма: понятно, как средство должно работать, и оттого кажется, что оно работает. Довод звучит убедительно и по силе не стоит нигде. Он не ступень, а гипотеза.

Самый дорогой урок на эту тему медицина получила в конце восьмидесятых. После инфаркта у части людей возникают перебои ритма, и чем их больше, тем хуже прогноз. Логика напрашивалась: если подавить перебои, прогноз улучшится. Препараты, которые их подавляли, существовали и применялись широко.

Исследование CAST проверило эту логику рандомизированным сравнением с плацебо. Перебои ритма препараты подавляли, как и предполагалось: механизм работал ровно так, как его описывали. А смертность в группе лечения оказалась выше, чем в группе плацебо, и практику пришлось отменить.

Вывод из этой истории стоит того, чтобы взять его в остальной курс целиком. Правдоподобное объяснение говорит, почему средство могло бы помогать, и ничего не говорит о том, помогает ли оно. Проверять приходится сам исход, потому что тело устроено сложнее любой нашей схемы. Чем именно опасна подмена исхода измеряемым признаком, разбирает урок 6.

об исследованииКак читать CAST

Рандомизированное сравнение с плацебо у людей, перенёсших инфаркт и имеющих желудочковые нарушения ритма. Измеряли не сам ритм, а смертность, и именно потому работа смогла опровергнуть практику. Если бы измеряли ритм, она бы её подтвердила.

Чего лестница не делает

Теперь самое важное, и здесь ошибаются чаще всего. Иерархия расставляет типы исследований, а не отдельные работы, и не отменяет необходимости смотреть на конкретную. Плохо сделанное рандомизированное исследование бывает слабее хорошего когортного.

Испортить работу верхней ступени можно многими способами, и все они встречаются. Слишком мало участников, слишком короткий срок, измеренный суррогат вместо настоящего исхода, потерянная по дороге четверть участников, отобранные для наблюдения люди, не похожие ни на кого из тех, кому лечение потом назначают. Ступень при этом остаётся прежней, а вес работы падает.

Второе ограничение важнее первого. Рандомизировать можно не всё: не позволяют ни возможности, ни совесть. Нельзя жребием назначить одним людям курить двадцать лет, а другим не курить, и нельзя таким же способом изучать последствия голода или травмы.

Отсюда следует вывод, который многие делают ровно наоборот. Отсутствие рандомизированных работ не означает отсутствия знания: связь курения с раком лёгкого установлена без единого РКИ и держится прочно. Вес такому выводу дают повторяемость на разных странах и группах, устойчивость связи и её сила, а не одна работа, какой бы крупной она ни была.

Есть и зеркальная ошибка, встречающаяся не реже. Из того, что рандомизировать нельзя, выводят, будто в этой области годится любое мнение. Не годится: слабые доказательства остаются доказательствами и по-прежнему сравнимы между собой по силе.

миф«Нет РКИ, значит, ничего не известно»

Формулировка звучит строго и на деле разрушает больше знания, чем защищает. Часть вопросов не поддаётся рандомизации по этическим причинам, и ответы на них собирают иначе: из наблюдений, повторенных независимо и согласующихся между собой. Требовать РКИ там, где его не может быть, значит требовать не строгости, а молчания.

Зачем это нужно при чтении новостей

Практическая польза лестницы обнаруживается сразу же, как встречаешь фразу «исследования показали». Сама по себе она не значит почти ничего, потому что не сказано главное: какого рода исследования и сколько их было. Одна серия случаев и метаанализ двадцати рандомизированных работ описываются в новостях одинаковыми словами.

Поэтому вопрос к любому такому сообщению звучит одинаково. Что это было за исследование, сколько человек в нём участвовало, у кого именно и что измеряли. Четыре пункта, ни один из которых не требует медицинского образования.

Дальше курс будет применять эти четыре пункта постоянно, и уже к восьмому уроку станет видно, зачем такая настойчивость. Две работы с одним и тем же названием вмешательства дали противоположные ответы, и разошлись они ровно по третьему и четвёртому пунктам. А что из полученного знания следует для конкретного человека с конкретной болезнью, решение принимается врачом вместе с ним и зависит от обстоятельств, которых ни курс, ни новость не знают.

Что дальше

Мы разложили доказательства по силе и назвали причину порядка: сколько посторонних объяснений отсекает каждая ступень. Осталось разобрать самый резкий перепад на этой лестнице, между наблюдением и жребием. Ему посвящён следующий урок целиком.

Там же будет показано, почему наблюдение обманывает даже при огромном числе участников и почему заметить обман изнутри данных невозможно. Тренажёр урока 3 даёт увидеть это на четырёхстах людях и лекарстве, которое по условию задачи не делает ничего.

Ключевые исследования

Совет по медицинским исследованиям, стрептомицин при туберкулёзе лёгких1948Первое современное рандомизированное сравнение: 107 участников, стрептомицин с постельным режимом против одного постельного режима. Распределение задавала последовательность случайных чисел в запечатанных конвертах. Плацебо-контроля не было: группа сравнения получала не имитацию, а обычный уход того времени. Пациенты и лечащие врачи группу знали.
CAST, антиаритмические препараты после инфаркта1989Рандомизированное двойное слепое сравнение с плацебо у людей, перенёсших инфаркт и имеющих нарушения ритма: рандомизировано 1727 человек. Препараты подавляли аритмию, как и предполагалось, а смертность в группе лечения оказалась выше, чем в группе плацебо.
WHI, заместительная гормональная терапия2002Рандомизированное сравнение эстрогена с прогестином против плацебо у здоровых женщин в постменопаузе: 16 608 участниц. Остановлено досрочно после среднего наблюдения 5,2 года: сводный индекс пользы и вреда дал перевес вреда, а границу мониторинга перешёл показатель по инвазивному раку молочной железы. Защиты сердца, которую обещали наблюдения, не нашлось: риск сердечно-сосудистых событий в когорте в целом оказался не ниже, а выше. Насколько прочно это «выше», разбирает урок 9.

Что подтвердилось, а что нет

сильно ослабленоЛичный опыт тоже служит доказательством, просто послабее.

В осторожной форме утверждение верно: личный опыт стоит на нижней ступени иерархии и годится, чтобы заметить явление. В сильной форме оно неверно, потому что опыт не отсекает ни одного из трёх механизмов улучшения без лечения и потому не отвечает на вопрос «помогает ли». Разница не в надёжности, а в том, на какой вопрос ответ получен.

выдержалоРандомизация уравнивает группы по всему, включая неизмеренное.

Жребий не спрашивает, кто есть кто, и потому распределяет поровну и то, о чём исследователь не подумал. Ни один способ статистического учёта различий этого не даёт: учесть можно лишь записанное. Свойство проверялось с 1948 года и остаётся главным основанием иерархии доказательств.

мифЕсли по вопросу нет рандомизированных исследований, о нём ничего не известно.

Часть вопросов рандомизировать нельзя ни технически, ни этически: нельзя жребием назначить людям двадцать лет курения. Связь курения с раком лёгкого установлена без РКИ и держится на повторяемости в разных странах и группах, на силе связи и на её устойчивости. Требование РКИ там, где оно невозможно, ведёт не к строгости, а к отказу от знания.

Термины

иерархия доказательствhierarchy of evidence
Порядок типов исследований по силе. Основание порядка одно: сколько посторонних объяснений результата отсекает каждый тип.
серия случаевcase series
Описание нескольких похожих наблюдений без группы сравнения. Отвечает на вопрос «бывает ли такое», но не на вопрос «помогает ли».
случай-контрольcase-control study
Сравнение людей с болезнью и похожих людей без неё с обращением взгляда назад: чем группы отличались раньше. Быстрый способ, незаменимый для редких болезней.
когортное исследованиеcohort study
Наблюдение за большой группой вперёд во времени: кто как живёт в начале и кто чем заболевает потом. Вмешательства исследователя нет.
рандомизированное контролируемое исследованиеrandomised controlled trial, RCT
Исследование, в котором распределение участников по группам решает жребий, а не человек. Так группы уравниваются и по тому, что не измерялось.
систематический обзорsystematic review
Сведение всех работ по одному вопросу по объявленным заранее правилам поиска и включения. Правило, объявленное заранее, лишает автора возможности отобрать удобное.
метаанализmeta-analysis
Численное объединение результатов нескольких исследований в одну оценку. Применяется, когда работы достаточно похожи, чтобы их вообще можно было складывать.
доказательная медицинаevidence-based medicine
Подход, при котором решение опирается на явно названные доказательства с указанием их силы, а не только на опыт и авторитет.

Практикум · Определить ступень за одну минуту

Навык, ради которого написан урок, проверяется на любой новости о здоровье. Возьмите три таких сообщения (из ленты, из мессенджера, из разговора) и доведите каждое до его ступени на лестнице. Скорее всего, две из трёх ступени не назовут вовсе, и это само по себе будет ответом.

  1. Найдите три сообщения о здоровье, в каждом из которых есть слова «исследование», «учёные» или «доказано». Берите те, что попались случайно, а не те, что кажутся сомнительными: выборка должна быть честной.
  2. Для каждого выпишите, что именно сказано об устройстве исследования. Не о результате, а о дизайне: было ли сравнение, было ли распределение по жребию, сколько человек участвовало.
  3. Поставьте сообщение на ступень лестницы. Если данных на это не хватает, так и запишите: «ступень не названа». Это самый частый исход и самый показательный.
  4. Для тех сообщений, где ступень названа, проверьте, соответствует ли ей громкость вывода. Серия случаев с выводом «средство работает» и есть расхождение между тем, что измерено, и тем, что заявлено.
  5. Найдите первоисточник хотя бы для одного из трёх. Сравните вывод в статье с выводом в новости и запишите, что изменилось по дороге.

Вопросы для самопроверки

Вопрос 1

Чем обоснован порядок ступеней в иерархии доказательств?

  • Числом участников: чем больше людей, тем выше ступень
  • Авторитетом журнала, в котором опубликована работа
  • Тем, сколько посторонних объяснений результата отсекает каждый тип исследования
  • Стоимостью исследования и его длительностью
Вопрос 2

Когортное исследование на двухстах тысячах человек показало, что у принимающих средство исходы лучше. Что это позволяет заключить?

  • Что группы различались исходом, но неизвестно, что из множества различий его создало
  • Что средство работает: при таком числе участников случайность исключена
  • Что средство работает, если разница статистически значима
  • Что средство работает для этой популяции, но не для других
Вопрос 3

Почему систематический обзор стоит выше отдельного рандомизированного исследования?

  • Потому что его пишут более опытные исследователи
  • Потому что в нём больше участников суммарно
  • Потому что он новее и учитывает современные методы
  • Потому что независимые работы вместе различают случайность и закономерность, а правило поиска мешает отобрать удобное
Вопрос 4

Связь курения с раком лёгкого установлена без единого рандомизированного исследования. Что из этого следует?

  • Что связь остаётся недоказанной и требует проверки
  • Что рандомизация не нужна, если связь достаточно сильная
  • Что часть вопросов рандомизировать нельзя, и знание по ним собирают иначе
  • Что курение рандомизировали, но результаты не опубликовали
Вопрос 5

В новости сказано: «исследование показало пользу метода». Какие четыре вещи нужно узнать, прежде чем читать вывод?

  • Кто автор, где работает, в каком журнале и когда вышла статья
  • Какой дизайн, сколько участников, у кого именно и что измеряли
  • Сколько стоило исследование, кто платил, сколько длилось и где проходило
  • Насколько велик эффект, значим ли он, повторяли ли работу и что говорят критики

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Cochrane Library, раздел о том, как устроены систематические обзоры: Открытое описание правил поиска и включения работ. Полезно прочесть один раз, чтобы понимать, чем систематический обзор отличается от подборки ссылок.
  • Курс школы «Статистика», уроки о выборках и значимости: Аппарат, который здесь только применяется: откуда берутся интервалы неопределённости и что именно означает значимость. Дополнение к этому уроку, а не условие его понимания.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Доказательная медицина»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?