Ошибка базовой частоты
Задача о медицинском тесте, в которой ошибаются почти все
Базовая частота показывает долю события в подходящей совокупности: сколько таких случаев на сотню или на тысячу. При болезни у 1 человека из 1000 и 1 % ложных срабатываний у здоровых положительный тест получат 1098 человек из 100 000, и лишь 99 из них действительно больны: вероятность болезни около 9 %. Запись условий числом людей вместо процентов поднимает долю верных решений примерно вдвое-втрое.
Модуль V. Байесовское мышление · навыки Д1 · 20 мин · обновлено 12.09.2026
После урока вы сможете
- Насколько часто событие встречается вообще, до того, как учитывать конкретное свидетельство.
Задача, на которой ломаются даже врачи. Ответь навскидку, до всяких вычислений:
Редкая болезнь есть у 1 человека из 1000. Тест находит её у 99% больных и лишь в 1% случаев ложно срабатывает у здоровых. Твой тест положительный. Какова вероятность, что ты болен?
Интуиция кричит: «99%! Тест же точен на 99%». Правильный ответ: около 9%. Не девяносто девять, а девять. Положительный результат этого точного теста в девяти случаях из десяти оказывается ложной тревогой. Похожую задачу когда-то давали врачам, и разбор их ответов будет ниже, вместе с оговоркой, которую в пересказах обычно теряют.
Стало слегка не по себе? Отлично, это правильная реакция. Сегодня разберёмся, откуда берётся девятка, почему интуиция промахивается на порядок и как считать такие вещи в уме за тридцать секунд.
Метод: посчитай людей, а не проценты
Проценты скользкие, а люди нет. Возьмём город в 100 000 человек и просто переберём его:
Сколько больных? Один из тысячи, значит, 100 человек. Остальные 99 900 здоровы.
Что покажет тест у больных? Он ловит 99%, то есть из 100 больных поймает 99. Все они получат положительный результат, честно.
Что покажет тест у здоровых? Он ошибается в 1% случаев, и из 99 900 здоровых ложно «поймает» 999 человек. Почти тысячу.
Теперь собери всех с положительным тестом: 99 настоящих больных + 999 ложных тревог = 1098 человек с одинаковой бумажкой в руках. Больны из них 99. Доля: 99 из 1098, те самые ~9%.
Вот и весь секрет. Никакой формулы тут нет, есть таблица из четырёх клеток, посчитанная на пальцах. Психолог Герд Гигеренцер показал: в процентах эту задачу проваливают почти все, а в «естественных частотах», то есть «из 10 000 человек…», доля решивших вырастает в разы. Насколько именно и на ком это мерили, разберём отдельно: цифры там интереснее лозунга. Метод переносится на любую задачу этого класса: переведи все проценты в людей и пересчитай толпу.
Что на самом деле показал опыт с врачами
История про медиков ходит по пересказам в удобной форме: «сотрудникам лучшей медицинской школы дали эту задачу, и типичный ответ был 95 %». Сверим её с первоисточником. Курс, который учит проверять чужие примеры, обязан начинать со своих.
Работа Кассселса, Шёнбергера и Грейбойса вышла в New England Journal of Medicine в 1978 году. Задачу решали 60 человек: врачи, ординаторы и студенты-медики бостонских больниц. Условия были такие: болезнь встречается у одного человека из тысячи, а тест ложно срабатывает у 5 % здоровых. Чувствительность теста в задаче не указана вовсе. Правильный ответ там около 2 %.
Верно ответили 11 человек из 60, то есть 18 %. Ответ «95 %» дали 27 человек из 60, то есть 45 %. Такой ответ называется модальным: самый частый из всех. Назвать его типичным уже нельзя: так ответило меньше половины, а остальные пятьдесят пять процентов сказали что-то другое.
Теперь главное, и это и есть навык урока. Задача, с которой начался наш урок, оказывается другой задачей. В ней своя чувствительность (99 %), своя доля ложных срабатываний (1 %) и свой ответ (9 %). Арифметика в ней верна, девятка настоящая. Но результат врачей относится не к ней, и пришивать его сюда нельзя. Сшивание условий одной задачи с результатами другой и есть ровно тот приём, который ты учишься ловить в чужих текстах. В этом уроке он до недавнего времени стоял в первом абзаце.
Опыт повторили в 2014 году: Манрай с соавторами, 61 медик, журнал JAMA Internal Medicine. Верных ответов стало 23 % вместо прежних 18 %. Медиана ответов равна 66 % при правильном ответе около 2 %. Самым частым ответом снова было «95 %». За тридцать шесть лет картина почти не сдвинулась, и это свидетельство посильнее любого круглого числа.
Насколько на самом деле помогают естественные частоты
У метода, который ты только что применил, есть измерения, и их полезно знать в цифрах. Обещание «в частотах эту задачу решают даже школьники» ими не подтверждается, а там всё интереснее и честнее.
Гигеренцер и Хоффраге, 1995. Шестьдесят участников, 1774 решения. В формате вероятностей байесовский ход рассуждения давали 16 % решений, а в формате естественных частот 46-50 %. В опыте участвовали платные студенты университетов Зальцбурга и Констанца, отобранные как незнакомые с теоремой Байеса. Не школьники.
Хоффраге и Гигеренцер, 1998. Сорок восемь практикующих врачей, четыре диагностические задачи. В вероятностях верно оценивали ценность результата в 10 % случаев, а в частотах в 46 %.
Метаанализ Макдауэлл и Джейкобс, 2017. Двести двадцать шесть оценок результативности из 35 статей. Около 4 % верных решений в формате вероятностей и около 24 % в формате естественных частот.
Прочти эти пары ещё раз, и увидишь сразу две новости. Формат даёт выигрыш в два-три раза, и это много, ради этого метод и стоит держать в руках. И одновременно: даже в лучшем формате большинство не решает. Двадцать четыре процента верных означают три четверти ошибок. Курс, обещающий, что в частотах справляются все, продаёт не метод, а спокойствие.
Есть и разброс по людям. Брамвелл, Уэст и Салмон в 2006 году дали задачу четырём группам: 41 акушеру, 42 акушеркам, 43 беременным и 40 сопровождающим. В процентах верно решили 6 %, а в частотах 24 %. Но выигрыш достался почти целиком акушерам (65 %), у остальных групп он едва заметен. Формат помогает не всем одинаково.
И оговорка о механизме, без которой метод превращается в заклинание. Барби и Сломан в обзоре 2007 года показывают: выигрыш даёт не слово «частоты», а любое представление, которое делает видимой вложенность множеств, а именно то, что 99 настоящих больных сидят внутри 1098 положительных. В части репликаций преимущество частот оказывалось незначимым. Работает картинка вложенных групп, и частоты остаются самым дешёвым способом её нарисовать.
Практический вывод из всего этого один, и он про осторожность в обе стороны. Перевод в людей остаётся лучшим, что у нас есть, и он превращает неберущуюся задачу в арифметику начальной школы. Но он не гарантия правильного ответа, а инструмент, который надо взять в руки и довести счёт до конца. Поэтому дальше в уроке идёт не рассказ о методе, а второй прогон руками.
Почему интуиция промахивается на порядок
Потому что смотрит только на тест и в упор не видит базовую частоту, то есть тот факт, что болезнь исходно редкая. Здоровых в 999 раз больше, чем больных, и даже крошечный 1% ошибки на огромной толпе здоровых даёт больше ложных тревог, чем настоящих находок на маленькой кучке больных. Яркое свидетельство (положительный тест!) захватывает внимание, скучная фоновая цифра (1 из 1000) остаётся за кадром. Узнаёшь почерк Системы 1 и эвристики доступности из модуля 3.
Правило на стену: насколько сигналу можно верить, зависит не только от качества сигнала, но и от редкости того, что он ищет. Сканер багажа, ловящий запрещённое «почти без ошибок», выдаёт почти одни ложные тревоги, потому что запрещённое встречается в одной сумке из ста тысяч. По этой арифметике работают спам-фильтр, антивирус, детектор лжи и «чутьё на людей».
И симметричное следствие, чтобы не превратить правило в лозунг: когда ошибка теста ещё реже, чем само событие, чаша весов переворачивается, и положительный результат становится почти достоверным. Байес это всегда сравнение двух частот, а не заклинание «тесты врут».
Такси Канемана: прогон номер два
Закрепим метод на классике. В городе 85% такси зелёные и 15% синие. Ночью такси задело машину и скрылось. Свидетель говорит: «Оно было синим». Проверка показала: в таких условиях свидетель называет цвет верно в 80% случаев. Насколько верить показанию?
Интуиция: «80%, он же надёжный». Считаем людей, точнее сотню похожих ДТП. Синих такси в них 15: свидетель верно опознает 12 (80% от 15). Зелёных в них 85, и в 20% случаев он ошибётся и назовёт их синими, а это 17 машин. Итого «синее!» прозвучит 29 раз, и лишь в 12 из них такси правда синее. 12 из 29 дают около 41%. Надёжный свидетель, называющий синий цвет, чаще ошибается, чем прав, потому что зелёных такси попросту намного больше.
И продолжение, из-за которого формулировка «люди просто игнорируют базовую частоту» выглядит слишком сильной. Тверски и Канеман давали и вторую версию задачи. В ней 85 % относились не к числу машин на улицах, а к доле аварий: зелёные такси попадают в 85 % происшествий. Условия математически те же, а медианный ответ сдвигался с .80 к .60. Значит, дело не в неспособности к арифметике. Дело в том, видит ли человек в базовой частоте причину: «их просто больше» работает хуже, чем «они хуже ездят».
Компания проверяет резюме «детектором накруток», который помечает 90% фальшивых резюме и ложно срабатывает на 10% честных. Фальшивым оказывается каждое двадцатое (5%). Резюме помечено. Посчитай через «из 1000 резюме»: какова вероятность, что оно правда фальшивое?Показать ответ
из 1000 резюме фальшивых 50, и детектор поймает 45. Честных 950, из них ложно пометит 95. Помечено всего 140, из них фальшивых 45: около 32%. Две трети помеченных оказываются честными людьми. Вывод для практики: пометка детектора служит поводом проверить руками, а не поводом отказать.
Письмо: «Вы выиграли автомобиль! Для получения оплатите доставку». Текст грамотный, логотип настоящий, ссылка похожа на правду. Почему базовая частота важнее всех этих деталей и какова она здесь на глаз?Показать ответ
доля честных «вы выиграли, заплатите за доставку» среди таких писем исчезающе мала, ведь на миллионы рассылок настоящих розыгрышей с предоплатой практически нет (законные розыгрыши доставку не просят). При такой базе даже очень убедительные детали не вытягивают вероятность из зоны «почти наверняка мошенничество»: качественная подделка выглядит убедительно по определению, на то она и качественная. База бьёт впечатление.
Конспект
Метод естественных частот: переведи проценты в людей («из 100 000: 100 больных → 99 поймано, 99 900 здоровых → 999 ложных, 99 из 1098 ≈ 9%»), и получается таблица толпы вместо формулы. Интуиция смотрит на яркий тест и игнорирует скучную базу. Доверие сигналу = качество сигнала × редкость искомого (сканер багажа: почти все срабатывания ложные). Опыт 1978 года говорит о другой задаче: там 5 % ложных, чувствительность не названа, верный ответ около 2 %, верно ответили 18 %, а «95 %» остаётся модальным ответом 45 % респондентов, не типичным. Частоты дают выигрыш вдвое-втрое (16 % против 46-50 % у Гигеренцера и Хоффраге, 4 % против 24 % по метаанализу), но большинство не решает и в них. Работает видимая вложенность множеств, а не слово «частоты». Обратная сторона: если ошибка теста реже самого события, положительный результат почти достоверен. Байес и есть сравнение частот, а не лозунг. Такси: точность свидетеля 80% превращается в 41% правоты, а в причинной версии ответ сдвигается к .60. Тренажёр: Д1.
Почему точный тест врёт
Сначала ответьте как есть, не считая. Потом разложим на людей, и ответ соберётся сам.
Ключевые работы
| Casscells, Schoenberger & Graboys | 1978 | 60 врачей, ординаторов и студентов-медиков решали задачу с распространённостью 1 на 1000 и долей ложноположительных 5 %: верно ответили 11 из 60 (18 %), а самым частым ответом было «95 %», его дали 27 из 60 (45 %) при правильном ответе около 2 %. |
| Tversky & Kahneman | 1982 | Задача о такси: при 85 % зелёных машин и свидетеле, различающем цвет в 80 % случаев, вероятность того, что машина синяя, равна .41, а медианный и модальный ответ участников равен .80. Если ту же базовую частоту подать как долю аварий, ответ сдвигается к .60. |
| Gigerenzer & Hoffrage | 1995 | 60 платных студентов университетов Зальцбурга и Констанца, 1774 решения: в формате вероятностей байесовский ход рассуждения давали 16 % решений, а в формате естественных частот 46-50 %. Относительные частоты, в отличие от естественных, не помогали. |
| Hoffrage & Gigerenzer | 1998 | 48 практикующих врачей на четырёх диагностических задачах: в формате вероятностей верно оценивали прогностическую ценность в 10 % случаев, а в формате естественных частот в 46 %. |
| Bramwell, West & Salmon | 2006 | 41 акушер, 42 акушерки, 43 беременные и 40 сопровождающих: в формате процентов верно решили 6 %, в формате частот 24 %, причём выигрыш получили почти только акушеры (65 %). |
| Barbey & Sloman | 2007 | Обзор с открытой дискуссией: выигрыш даёт не частотный формат сам по себе, а любое представление, делающее видимой вложенность множеств. В ряде репликаций преимущество естественных частот оказывалось незначимым. |
| Manrai и др. | 2014 | Репликация задачи 1978 года на 61 медике: верно ответили 23 %, медиана ответов составила 66 % при правильном ответе около 2 %, а самым частым ответом снова было «95 %». |
| McDowell & Jacobs | 2017 | Метаанализ 226 оценок результативности из 35 статей: доля верных байесовских решений составляет около 4 % в формате вероятностей и около 24 % в формате естественных частот. |
Разбор
Под одной историей склеены две задачи. У Касселса и соавторов (1978) доля ложноположительных 5 %, чувствительность не указана вовсе, правильный ответ около 2 %. В задаче урока чувствительность 99 %, ложных срабатываний 1 %, ответ 9 %. Числа разные, ответ разный, и результат шестидесяти медиков относится к первой задаче, а не ко второй. Вдобавок «95 %» остаётся модальным ответом 45 % участников, а не типичным: большинство отвечало иначе, а верно ответили 18 %.
У Гигеренцера и Хоффраге (1995) участвовали платные студенты университетов Зальцбурга и Констанца, отобранные как незнакомые с теоремой Байеса. Доля верных решений там выросла с 16 % до 46-50 %, то есть примерно до половины. По метаанализу Макдауэлл и Джейкобс (2017) она поднялась с 4 % до 24 %. Метод действительно даёт выигрыш вдвое-втрое, и это много. Но «решают даже школьники» не следует ни из одной работы: даже в лучшем формате большинство не решает.
Не всегда и не одинаково. У Тверски и Канемана та же задача о такси в причинной версии, где 85 % относятся к долям аварий, а не машин, даёт медианный ответ .60 вместо .80 при математически тождественных условиях. Значит, база не выпадает из счёта сама по себе: она учитывается хуже, когда её нечем объяснить. Практический вывод меняется вместе с этим: чтобы база сработала, ей нужно дать причинный смысл, а не повторить число.
Гигеренцер и Хоффраге: 60 участников, 1774 решения, и байесовский ход рассуждения давали 16 % решений в формате вероятностей и 46-50 % в формате естественных частот. На практикующих врачах отдельно: 10 % против 46 % (Хоффраге и Гигеренцер, 48 человек). Метаанализ Макдауэлла и Джейкобс, 35 статей и 226 оценок результативности, даёт около 4 % против около 24 %. Устоял выигрыш формата, а не обещание «задача становится лёгкой»: в лучшем формате большинство решений всё равно неверно. И механизм спорен, ведь Барби и Слоуман показывают, что помогает не частотность сама по себе, а любое представление, делающее вложенность множеств видимой.
Термины
- Базовая частотаbase rate
- Доля события в подходящей совокупности: сколько таких случаев на сотню или на тысячу. Противоядием доступности служит цифра вместо воспоминания.
- Естественные частотыnatural frequencies
- Запись условий числом людей вместо процентов: «из 1000 человек болен 1, у 999 здоровых тест ложно сработает у 50». Математику формат не меняет, а долю верных решений поднимает примерно вдвое-втрое.
- Ложноположительный результатfalse positive
- Срабатывание теста у того, у кого искомого нет. Доля ложноположительных считается от числа здоровых, а не от числа сработавших тестов. Путаница этих двух знаменателей и есть самая частая ошибка в чтении диагностики.
- Чувствительность тестаsensitivity
- Доля больных, которых тест находит. В задаче 1978 года она не была указана вовсе, и это одна из причин, по которым её результат нельзя переносить на задачи, где она задана.
- Прогностическая ценность положительного результатаpositive predictive value
- Вероятность, что у человека с положительным тестом действительно есть искомое. Зависит не только от прибора, но и от базовой частоты, поэтому один и тот же тест в массовом скрининге и в профильной клинике даёт разные числа.
- Модальный ответmodal response
- Самый частый ответ в группе. Не то же самое, что типичный: если один вариант выбрали 45 % респондентов, большинство ответило иначе, и называть его ответом группы уже нельзя.
- Вложенность множествnested sets
- Устройство задачи, в котором искомая группа целиком лежит внутри другой: 99 настоящих больных входят в 1098 получивших положительный результат. Видимая вложенность и есть то, что помогает решать, а частоты остаются самым дешёвым способом её показать.
- Причинная базовая частотаcausal base rate
- Базовая частота, у которой есть объяснение через свойства объектов: «зелёные такси чаще попадают в аварии» вместо «зелёных такси больше». Учитывается людьми заметно охотнее, чем чисто численная.
Практикум · Задача о тесте через естественные частоты
Метод Гигеренцера: перевести проценты в людей, и задача, на которой ошибаются врачи, становится арифметикой.
- Возьмите условие опыта 1978 года: болезнь у одного из тысячи, доля ложных срабатываний 5 %, чувствительность не названа, так что примите её за 100 %.
- Разложите на 10 000 человек: сколько больных, сколько здоровых, сколько положительных тестов в каждой группе.
- Посчитайте долю действительно больных среди всех с положительным тестом.
- Сравните с интуитивным ответом, который приходит первым. Разрыв обычно в несколько раз.
- Придумайте небанальный пример из своей жизни, где базовая частота важнее впечатления: отбор кандидатов, подозрение, диагноз.
Вопросы для самопроверки
Болезнь есть у 1% населения. Тест находит 90% больных, но даёт 9% ложных срабатываний у здоровых. Твой тест положительный. Посчитай через «из 10 000 человек»: какова примерно вероятность болезни?
- Около 1%
- Около 9%
- Около 90%
- Около 50%
В городе 85 зелёных такси и 15 синих. Свидетель ДТП различает цвет в темноте верно в 80% случаев. Рассмотрим 100 случаев, когда свидетель сказал «такси было синим»: в скольких из них такси действительно синее?
- Примерно в 15, по доле синих такси в городе
- Примерно в 41: зелёных такси намного больше, и их ложные опознания перевешивают
- Почти во всех: свидетель видел цвет своими глазами, а очевидец надёжнее расчётов
- Примерно в 80, по точности свидетеля, она и есть ответ
На конвейере 1% изделий идёт с дефектом. Автотест ловит 95% дефектных, но помечает и 3% исправных. Изделие помечено тестом. Вероятность, что оно дефектное, ближе к…
- 95%
- 1%
- 50%
- 24%
В фотобанке 2% загружаемых фото нарушают правила. Автомодерация ловит 90% нарушений, но ошибочно помечает и 5% нормальных фото. Фото помечено. Вероятность, что оно действительно нарушает правила, ближе к…
- 90%
- 27%
- 2%
- 55%
Тест на редкую болезнь (1 на 10 000) находит почти всех больных и почти не даёт ложных срабатываний, всего 1 на миллион здоровых. Тест положительный. Что теперь?
- Тест нужно игнорировать: любой тест ошибается
- Всё равно почти наверняка ложная тревога: болезнь редкая, а редкое остаётся редким
- Теперь положительный результат почти наверняка верен: ложные срабатывания ещё в 100 раз реже болезни
- База всегда побеждает точность теста: редкое остаётся редким
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Casscells, Schoenberger & Graboys, «Interpretation by physicians of clinical laboratory results», New England Journal of Medicine, 1978: Первоисточник истории про врачей занимает две страницы. Открыть стоит хотя бы затем, чтобы увидеть, из чего выросла легенда: 60 человек, одна задача, 5 % ложных срабатываний и ни слова о чувствительности.
- Gigerenzer & Hoffrage, «How to improve Bayesian reasoning without instruction», Psychological Review, 1995: Работа, с которой пошли естественные частоты. Читать ради таблиц: там видно и то, что выигрыш формата большой, и то, что доля решивших всё равно не дотягивает до половины.
- Barbey & Sloman, «Base-rate respect», Behavioral and Brain Sciences, 2007: Обзор напечатан вместе с двумя десятками комментариев несогласных. Полезен как образец живого спора: «частоты помогают» и «почему они помогают» это два разных вопроса, и второй не закрыт.