Теорема Байеса простыми словами
Почему точный тест при редкой болезни ошибается чаще, чем попадает
Условная вероятность это вероятность события в мире, где известно, что произошло другое событие. P(A при условии B) и P(B при условии A) это разные числа. Учебная задача: болезнь у одного из тысячи, тест находит всех больных, но даёт 5 % ложных срабатываний у здоровых. Вероятность болезни при положительном результате равна не 95 %, а около 2 %. Результат теста не читается без базовой частоты, а считать такие задачи проще в естественных частотах.
MIT 18.05, занятие 3 · Stat 110, лекции 3-4 · 45 мин · обновлено 01.10.2026
После урока вы сможете
- Различать P(A при условии B) и P(B при условии A) и показывать на числах, насколько они расходятся
- Считать байесовские задачи в естественных частотах, без формулы
- Объяснять, почему ценность теста зависит от базовой частоты в проверяемой группе
- Опознавать ошибку прокурора и игнорирование базовой частоты в готовых рассуждениях
Пример учебный, числа придуманы. Решить её стоит до того, как читать дальше. Болезнь встречается у одного человека из тысячи. Тест устроен так, что находит болезнь у всех больных, без единого пропуска. У здоровых он даёт положительный результат в 5 % случаев. Вам пришёл положительный результат. Какова вероятность, что вы больны?
В ответ обычно звучит 95 %, «около девяноста», «почти наверняка». Правильный ответ равен примерно 2 %. Это не парадокс и не подвох: ниже он получается пересчётом на пальцах, без единой формулы.
Расхождение между 95 % и 2 % не курьёз, а главная причина неверного чтения любых проверок: медицинских, охранных, антифродовых, алгоритмических. И держится оно на одной путанице, которую этот урок разбирает.
Условная вероятность: мир сузился
Условная вероятность P(A при условии B) это вероятность A в мире, где B уже произошло. Технически: выбрасываются все исходы, где B не случилось, и считается доля A среди оставшихся.
Проверим на костях, где все исходы можно пересчитать руками. Бросаем две кости: 36 равновероятных исходов. Сумма 11 или больше даёт три исхода, а именно (5,6), (6,5) и (6,6), то есть безусловная вероятность 3/36 = 1/12, около 0,083.
Теперь спросим иначе: какова вероятность, что сумма не меньше 11, если на первой кости шестёрка? Мир сузился до шести исходов, где на первой кости шестёрка. Из них подходят два: (6,5) и (6,6). Ответ равен 2/6, то есть 1/3.
И обратный вопрос: какова вероятность, что на первой кости шестёрка, если известно, что сумма не меньше 11? Теперь мир сузился до трёх исходов. Из них шестёрка на первой кости в двух. Ответ выходит 2/3.
Одна и та же пара событий, два вопроса, а ответы 1/3 и 2/3 расходятся вдвое. Никакой ошибки здесь нет: это разные вопросы, и знаменатели у них разные. В первом случае делили на шесть, во втором на три.
Отсюда правило, которое стоит держать наготове: у условной вероятности всегда есть знаменатель, и весь вопрос в том, какой. Перепутать P(A при условии B) с P(B при условии A) значит поделить на не то число.
Услышав вероятность, спросите: среди кого считается эта доля? «Девяносто пять процентов больных тест находит» говорит о доле среди больных. «Насколько вероятно, что я болен» спрашивает о доле среди получивших положительный результат. Это разные группы разного размера, и без второго размера первое число ответа не даёт.
Ошибка прокурора
У этой подмены есть имя, полученное по месту, где она обходится дороже всего, и это ошибка прокурора. Структура рассуждения такая: свидетельство встречается у невиновных крайне редко, следовательно обвиняемый почти наверняка виновен.
Разберём на числах. Пусть некоторый признак, например редкий след, совпадение по образцу или характерная деталь, встречается у одного человека из десяти тысяч. У обвиняемого он есть. Прокурор говорит: у невиновного такое совпадение имеет вероятность одна десятитысячная, то есть 0,0001, значит вероятность невиновности ничтожна.
Первое число верно, а вывод нет. Посчитаем вторую сторону. В городе живёт два миллиона взрослых. Признаком обладают примерно 200 из них. Если обвиняемого связывает с делом только этот признак, то он один из двухсот человек, у которых он тоже есть. Вероятность того, что виновен именно он, равна 1/200, то есть 0,005. Не одна десятитысячная в пользу вины, а 199 шансов из 200 в пользу невиновности.
Числа 0,0001 и 0,005 расходятся в пятьдесят раз, и расхождение получено исключительно из того, что во втором расчёте участвует размер группы, среди которой ищут. Прокурор считал долю среди невиновных, а отвечать надо было о доле среди обладателей признака.
То же самое устройство работает далеко за пределами суда. «Алгоритм ошибается в одном случае из тысячи». Доля среди чего? «Такое совпадение случайно бывает раз в миллион лет». При скольких попытках? Всякий раз, когда названа вероятность улики при невиновности, а вывод делается о вероятности невиновности при улике, произошла ровно эта подмена.
Сама по себе редкость признака при этом остаётся ценной: она сократила круг с двух миллионов до двухсот, и это огромное сокращение. Ошибка не в том, что признак учли, а в том, что на нём остановились и назвали результат доказательством. Правильная формулировка звучит скромнее и честнее: признак поднял вероятность вины с одной двухмиллионной до одной двухсотой, то есть в десять тысяч раз, но от единицы она по-прежнему далека, и решает дело то, что будет добавлено к нему.
Естественные частоты вместо формулы
Теперь вернёмся к тесту. Приём, которым мы его посчитаем, называется естественными частотами: вместо вероятностей берутся люди. В литературе по психологии суждения этот способ подачи связывают с работами Герда Гигеренцера, и суть его в том, что задача, нерешаемая большинством в процентах, решается тем же большинством в людях.
Возьмём 10 000 человек и проведём их через условие задачи по шагам.
Шаг первый. Болезнь у одного из тысячи, значит из 10 000 человек больны 10, здоровы 9 990.
Шаг второй. Тест находит болезнь у всех больных, значит все 10 больных получат положительный результат.
Шаг третий. Тест ошибается у 5 % здоровых, значит из 9 990 здоровых положительный результат получат примерно 500 человек.
Шаг четвёртый. Всего положительных результатов получается 10 + 500 = 510. Из них действительно больны 10.
Доля больных среди получивших положительный результат равна 10 / 510, это 0,0196, то есть примерно 2 %. Из каждых пятидесяти одного человека с тревожным результатом болен один.
Заметьте, что ни одна формула не понадобилась, а в расчёте участвовали всего три числа условия. И заметьте, где именно ломается интуиция: она берёт 5 % ложных срабатываний и вычитает из ста, получая 95 %. Но 5 % считаются от девяти тысяч здоровых, а 100 % от десяти больных. Пять процентов от большой группы дают в пятьдесят раз больше людей, чем сто процентов от маленькой.
Формально то же самое записывается теоремой Байеса: вероятность болезни после теста равна вероятности положительного результата у больных, умноженной на базовую частоту болезни и делённой на общую вероятность положительного результата. Словами короче: апостериорная вероятность пропорциональна правдоподобию, умноженному на априорную. Подсчёт по 10 000 человек это она и есть, только числитель и знаменатель выписаны людьми.
Реальные тесты пропускают часть больных, назначаются не случайным людям, а по симптомам, и почти никогда не применяются поодиночке. Задача нужна для арифметики, а не для решений о здоровье: тем и ценна, что показывает, чего не хватает в сообщении «тест точен на 95 процентов».
Тот же тест, другая группа
Самое важное следствие из этого счёта состоит не в числе 2 %, а в том, что оно вообще не является свойством теста.
Проведём тот же расчёт для группы, в которой болезнь встречается у одного из двадцати: так бывает, когда тестируют не всех подряд, а обратившихся с жалобами. Из 10 000 человек больны 500, здоровы 9 500. Все 500 больных получают положительный результат. Из 9 500 здоровых ложноположительный результат получают 5 %, то есть 475 человек. Всего положительных выходит 975, из них больны 500.
Доля больных среди положительных равна 500 / 975, это около 0,51, то есть примерно 51 %.
Полезно посмотреть и на вторую половину той же таблицы, о которой обычно забывают. В первом расчёте отрицательный результат получили 9 490 человек, и все они здоровы: тест не пропускает больных, значит отрицательный ответ снимает вопрос полностью. Один и тот же тест в одной и той же задаче оказывается почти неинформативным при срабатывании и исчерпывающим при молчании. Спрашивать «насколько точен тест» вообще неправильно поставленный вопрос: точность у положительного и отрицательного результата разная, и обсуждать их нужно порознь.
Один и тот же тест, одна и та же чувствительность, одна и та же доля ложных срабатываний. В одной группе положительный результат означает вероятность болезни 2 %, в другой 51 %. Разница в двадцать пять раз произведена целиком тем, кого решили проверять.
Это и есть рабочий вывод урока. Характеристики теста, чувствительность и доля ложных срабатываний, не отвечают на вопрос пациента. Они описывают поведение теста при известном диагнозе, то есть отвечают на вопрос «что покажет тест у больного». Вопрос «болен ли я, раз тест положителен» требует третьего числа, базовой частоты в той группе, к которой человек принадлежит, и без него не имеет ответа вообще.
Отсюда общее правило чтения любых проверок, от медицинских до антифродовых: чем реже событие, тем большую долю среди срабатываний составляют ложные. Скрининг редкого события даёт много ложных тревог не потому, что инструмент плох, а потому, что здоровых, честных, безопасных много, и малая доля от большой группы перевешивает большую долю от маленькой.
Систематическая ошибка суждения: человек оценивает вероятность по тому, насколько хорошо случай подходит под описание, и не спрашивает, сколько таких случаев вообще бывает. Описание «застенчив, аккуратен, любит порядок» кажется указывающим на редкую профессию сильнее, чем на частую, хотя частая профессия перевешивает описание одним своим размером.
Что делать с этим на практике
Три приёма, которые закрывают большую часть ошибок этого типа.
Первый: переводить проценты в людей. Любое условие про вероятности переписывается на 1 000 или 10 000 человек, и дальше задача решается счётом. Это не упрощение для непонимающих, а тот же расчёт с выписанным знаменателем.
Второй: всегда спрашивать про третье число. В сообщениях о точности почти всегда названы два числа из трёх: сколько больных тест находит и как часто ошибается у здоровых. Базовая частота отсутствует, потому что она не свойство прибора, а свойство группы. Без неё ни один вывод о конкретном человеке невозможен.
Третий: проверять направление условия. Записывать, что при чём: «доля среди больных» или «доля среди положительных». Ошибка прокурора и ошибка чтения теста сводятся к одному и тому же действию, выполненному в разных областях.
И последнее, что стоит унести из урока. Теорема Байеса здесь применена один раз, но её обычное употребление другое: она описывает обновление и говорит о том, как менялась бы оценка при поступлении новых свидетельств одно за другим. Второй тест после первого положительного считается той же процедурой, только базовой частотой для него служат уже полученные 2 %. Этому посвящён шестой модуль курса, и там же разбирается, что делать, когда априорная вероятность неизвестна.
Ключевые работы
| Orloff, Kamrin, MIT 18.05 «Introduction to Probability and Statistics» | 2022 | Конспект занятия 3: условная вероятность, независимость и теорема Байеса, а также разбор задач о ложных срабатываниях с формулой полной вероятности. |
| Blitzstein, Hwang, «Introduction to Probability», Chapman & Hall | 2014 | Учебник Stat 110, где условная вероятность подаётся как основное понятие курса, а задачи о ложноположительных результатах разбираются подробнее, чем в большинстве вводных программ. |
Что здесь путают
Пять процентов считаются среди здоровых, а вопрос задан о доле среди получивших положительный результат. При болезни у одного из тысячи из 10 000 человек больны 10 и все они дают положительный результат, а из 9 990 здоровых положительный результат получают около 500. Доля действительно больных равна 10 из 510, около 2 %. Число 95 % возникает от вычитания 5 из 100, то есть от подмены знаменателя: малая доля от большой группы даёт больше людей, чем полная доля от маленькой.
Это ошибка прокурора: первое число даёт долю среди невиновных, а второе требуется как доля среди обладателей признака. При частоте признака один на десять тысяч в городе с двумя миллионами взрослых им обладают около 200 человек, и обвиняемый оказывается одним из них. Если больше ничего его с делом не связывает, вероятность вины около 0,005, а не 0,9999. Расхождение в пятьдесят раз возникает от того, что в исходном рассуждении не участвует размер группы, среди которой искали.
Арифметически расширение проверяемой группы снижает базовую частоту, а вместе с ней и долю настоящих находок среди срабатываний. Тот же тест, что даёт 51 % при частоте болезни один из двадцати, даёт около 2 % при частоте один из тысячи. Из этого не следует, что широкие проверки не нужны: решение зависит от цены пропуска, цены ложной тревоги и того, что делают дальше с положительным результатом. Следует другое. Польза теста не является его собственным свойством и меняется вместе с тем, кого им проверяют.
Термины
- условная вероятностьconditional probability
- Вероятность события в мире, где известно, что произошло другое событие. Отличается от безусловной знаменателем.
- базовая частотаbase rate
- Доля, с которой событие встречается в рассматриваемой группе до всякой проверки. Третье число, без которого результат теста не читается.
- априорная вероятностьprior probability
- Оценка вероятности до получения свидетельства. В задаче о тесте роль априорной играет базовая частота болезни.
- апостериорная вероятностьposterior probability
- Оценка вероятности после учёта свидетельства. То, что требуется в вопросе «болен ли я при положительном тесте».
- правдоподобиеlikelihood
- Вероятность наблюдённых данных при условии, что верна конкретная гипотеза. Считается для каждой гипотезы отдельно.
- чувствительностьsensitivity
- Доля больных, у которых тест даёт положительный результат. В задаче урока она равна единице.
- специфичностьspecificity
- Доля здоровых, у которых тест даёт отрицательный результат. При 5 % ложных срабатываний она равна 0,95.
- ложноположительный результатfalse positive
- Срабатывание при отсутствии искомого: положительный тест у здорового или значимый результат при верной нулевой гипотезе. Доля таких результатов среди всех положительных зависит не от порога, а от того, насколько искомое редко.
- естественные частотыnatural frequencies
- Способ подачи вероятностной задачи в виде количества людей из фиксированной группы вместо процентов.
- ошибка прокурораprosecutor's fallacy
- Подмена вероятности свидетельства при невиновности на вероятность невиновности при свидетельстве.
Практикум · Пересчёт в людях
Работа со всеми числами задачи о тесте и с одним реальным сообщением. Понадобятся лист бумаги и калькулятор. Всё считается в целых людях, без формул.
- Постройте таблицу на 10 000 человек для условия урока: болезнь у одного из тысячи, тест находит всех больных, 5 % ложных срабатываний у здоровых. Выпишите четыре ячейки, где стоят больные с положительным и отрицательным результатом и здоровые с положительным и отрицательным, а потом проверьте, что сумма равна 10 000.
- Повторите ту же таблицу для базовой частоты один из двадцати и один из ста тысяч (для второго возьмите 1 000 000 человек, чтобы числа остались целыми). Выпишите три доли больных среди положительных: около 51 %, около 2 % и около 0,02 %.
- Расположите три полученные доли рядом с тремя базовыми частотами и сформулируйте одним предложением, как меняется ценность одного и того же теста при снижении базовой частоты в двадцать раз и в сто раз.
- Найдите реальное сообщение о точности чего угодно: медицинского теста, системы распознавания лиц, антифрод-фильтра, детектора текста. Выпишите, какие числа там названы, и проверьте, названа ли базовая частота. Обычно названы два числа из трёх.
- Перепишите это сообщение в естественных частотах: «Из 10 000 проверенных…», подставив базовую частоту, которую вы считаете правдоподобной, и оговорив её как своё допущение. Сравните, как читаются два варианта одного и того же утверждения.
Вопросы для самопроверки
Болезнь у одного из тысячи, тест находит всех больных, 5 % здоровых получают положительный результат. Какова доля больных среди получивших положительный результат?
- Около 95 %
- Около 2 %
- Около 50 %
- Около 5 %
Тот же тест применили в группе, где болезнь встречается у одного из двадцати. Доля больных среди положительных стала около 51 %. Что изменилось?
- Выросла чувствительность теста
- Тест стал точнее, потому что его применили правильнее
- Уменьшилась доля ложных срабатываний
- Ничего в тесте: изменилась базовая частота в проверяемой группе
«У случайного человека такое совпадение имеет вероятность одна на десять тысяч. Значит, обвиняемый почти наверняка виновен». Что не так?
- Ничего: при такой редкости совпадение объясняется только виной, ведь вероятность встретить признак у постороннего меньше вероятности судебной ошибки
- Вероятность одна десятитысячная недостаточно мала для обвинения: суду нужен порог не хуже одной миллионной
- Названа доля среди невиновных, а вывод делается о доле среди обладателей признака
- Вероятность посчитана неверно: без поправки на возраст и пол частота признака завышена вдвое
В рекламе алгоритма сказано: «Находит 99 % нарушений и ошибается только в 1 % случаев». Какого числа не хватает, чтобы понять, что означает срабатывание?
- Доли нарушений среди всех проверяемых
- Общего числа проверок за период
- Доли нарушений, которые алгоритм пропускает
- Стоимости одной проверки
Почему после положительного результата имеет смысл повторить проверку другим тестом?
- Потому что вероятность ошибиться дважды равна произведению вероятностей в любом случае: ошибки разных тестов независимы по построению
- Потому что два одинаковых результата исключают ошибку
- Для второго теста базовой частотой служит уже пересчитанная вероятность, и она много выше исходной
- Потому что первый тест всегда менее надёжен, чем второй
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- MIT 18.05, конспект занятия 3: Условная вероятность, формула полной вероятности и теорема Байеса с решёнными задачами о тестах.
- Blitzstein, Hwang, «Introduction to Probability», probabilitybook.net: Главы 2-3: условная вероятность как основное понятие и задачи о ложноположительных результатах. Лекции 3 и 4 курса Stat 110 покрывают тот же материал устно.