К содержанию
Фонтум Критическое мышление Урок 15 / 24 Все уроки

Главная · Курсы · Критическое мышление · Программа курса · Модуль V. Байесовское мышление · урок 15 из 24

Калибровка уверенности

Уверенность как ставка: интервалы, счёт и практика суперпрогнозистов

Калибровкой называют совпадение заявленной уверенности с долей сбывшегося: у калиброванного прогнозиста «70 %» сбывается примерно в семи случаях из десяти. По одному случаю она не проверяется вовсе, только серией прогнозов. Типичным сбоем оказывается сверхточность: у Альперта и Райффы за границы интервалов, в которых слушатели были уверены на 98 %, вылетало 34 % истинных значений вместо обещанных двух процентов.

Модуль V. Байесовское мышление · навыки Д3 · 23 мин · обновлено 12.09.2026

После урока вы сможете

  • Говорить «70 %» и оказываться правым примерно в 70 % случаев. Интервалы вместо точечных догадок.

Синоптик сказал: «Вероятность дождя завтра 70%». Назавтра сухо. Синоптик ошибся?

Неизвестно. Один сухой день совместим с честными «70%», ведь тридцать раз из ста при такой вероятности дождя не будет. Проверить синоптика можно только серией: собери все дни, когда он говорил «70%», и посчитай. Если дождь шёл примерно в 7 из 10 таких дней, прогнозист калиброван: его проценты значат ровно то, что говорят. Если в 4 из 10, то его «70%» на самом деле сорок, и это надо знать всем, кто планирует по его прогнозам.

Калибровка идёт последним навыком модуля и самым личным: сегодня проверим твои проценты.

Уверенность это прибор, и он бывает сбит

Смотри, что даёт калибровка. Уверенность работает каналом информации: слыша от человека «я почти уверен», ты решаешь, перепроверять ли за ним. Если его «почти уверен» сбывается в 95%, можно строить планы. Если в 60%, то его «почти уверен» стоит немного. А человек, у которого всё «стопроцентно», и есть сломанный прибор: стрелка прибита к максимуму, показания не значат ничего, и каждый его промах под «сто процентов» стоит кому-то денег.

Из модуля 3 ты уже знаешь диагноз по умолчанию: сверхточность. Вот как её мерили. Альперт и Райффа давали слушателям Гарвардской школы бизнеса, знакомым с анализом решений, вопросы с числовым ответом. Просили очертить интервал, в котором испытуемый уверен на 98 %. За границы этих интервалов вылетало 34 % истинных значений вместо обещанных двух процентов.

Солл и Клейман в 2004 году мерили то же на 80-процентных интервалах: верный ответ попадал внутрь в 48 % случаев. Ширина субъективных интервалов местами составляла лишь 40 % от той, что нужна для честной калибровки. Про 90-процентные интервалы курс числа не приводит: расхожую цифру «попадают 40-60 %» проверить по первоисточнику не удалось, а придумывать замену мы не станем. Направление у всех замеров одно, и вы его только что видели дважды: интервалы выходят слишком узкими.

Хорошая новость там же. У Альперта и Райффы после обучения с обратной связью промахи упали с 34 % до 19 %. Это всё ещё в девять раз больше обещанного и вдвое меньше прежнего. Калибровка, в отличие от многих искажений, действительно тренируется.

И поправка, чтобы не выйти отсюда с лозунгом «человек всегда самоуверен». По сводке Лихтенштейн, Фишхоффа и Филлипса картина зависит от трудности задания. На трудных сверхуверенность выражена сильно, а на лёгких знающие люди, наоборот, недоуверенны и занижают свои шансы. Там же есть цифры для крайних ставок: утверждения, которым приписывали шансы тысяча к одному, оказывались верны в 81-88 % случаев, а при шансах миллион к одному в 90-96 %.

Как это меряют: интервалы и серии

Инструмент номер один это интервалы 90%. На вопрос «какова длина экватора?» ты не обязан знать ответ, но обязан честно очертить своё незнание: «где-то от X до Y, и я готов поставить 9 против 1, что попал». Секрет, который все узнают на первой же серии: честный 90%-интервал шире, чем комфортно. Хочется сузить и выглядеть знающим, а правильно расширить и быть точным. Узкий интервал мимо ответа это не «почти угадал», это промах уверенности.

Сегодня в практике тебя ждёт вторая серия из десяти таких вопросов, с подсчётом попаданий и сравнением с первой, из урока 9. Правила честной игры простые: не гуглить, интервалы записывать до проверки, расширять до лёгкого дискомфорта. Сколько попаданий считать типичным, курс не обещает: разброс между сериями большой, а число, которое обычно называют, мы проверить не смогли. Мерить надо своё, и важно тут не абсолютное количество, а сдвиг между первой серией и второй.

Суперпрогнозисты: калибровка как спорт

Что бывает, когда навык доводят до предела, показал многолетний турнир прогнозов, устроенный американским агентством IARPA. Тысячи добровольцев предсказывали мировые события, с процентами и проверкой каждого прогноза. Команду-победителя собрал Филип Тетлок.

Числа стоит привести, потому что дальше речь пойдёт об их отсутствии. В первый год участвовали 2246 человек, во второй 1648, а в подсчёт вошли 199 геополитических исходов. По итогам первого года шестьдесят лучших, то есть верхние два процента, собрали в пять команд по двенадцать человек. Их и назвали суперпрогнозистами.

На старте второго года оценка Брайера у них была 0,25 против 0,38-0,46 у остальных групп, а к концу того же года 0,07 против 0,16-0,26, и чем меньше, тем лучше. Ожидаемой регрессии к среднему у них не случилось, а у всех прочих групп она была. По трём турнирам разрешающая способность суперпрогнозистов равна 0,40 против 0,32 у остальных, а площадь под кривой 96 против 75.

Их секреты скучны и потому воспроизводимы. Дробные проценты: не «наверное, да», а «63%», и готовность двинуть до 60 или 67 по новому свидетельству. Смешное на вид различие 60/65 на длинной серии превращается в реальное преимущество. Много маленьких обновлений вместо редких разворотов, та самая походка из урока 14. Взгляд снаружи первым: прежде чем нырять в детали («какой харизматичный кандидат!»), спроси базовую частоту («как часто в принципе побеждают такие?»), и узнаёшь линейку модуля 3 и базу модуля 5, работающие вместе. И главное тут счёт: каждый прогноз записан и проверен, а без записи память переписывает историю в жанре «я так и знал».

И ещё одно, самое скучное из всего: они просто больше работали. Суперпрогнозисты отвечали в среднем на 95 вопросов против 61 у обычных команд и делали по 7,8 прогноза на вопрос против 1,6. Часть их преимущества это не дар, а объём.

Самая громкая фраза про суперпрогнозистов и почему её здесь больше нет

Теперь неприятная часть, ради которой стоит держать этот урок открытым до конца.

Про суперпрогнозистов чаще всего пересказывают одно: обычные люди без допусков и погон системно обгоняли профессиональных аналитиков разведки, читавших закрытые данные, причём процентов на тридцать. Эта фраза стояла и в нашем уроке. Мы её убрали. Вот почему.

Рецензируемого источника у неё нет. Обе главные работы группы Меллерс, 2014 и 2015 годов, прочитаны целиком: сравнения с разведаналитиками в них нет вовсе. Ни одной статьи с таким сравнением найти не удалось.

Откуда цифра. Из газетной колонки: Дэвид Игнатиус, The Washington Post, 1 ноября 2013 года. Он написал, что лучшие прогнозисты выступили «примерно на 30 процентов лучше» аналитиков разведсообщества, со ссылкой на анонимные засекреченные источники.

Сам Тетлок подтверждает, что это и есть его источник, и говорит прямо: «Я могу об этом говорить только потому, что он об этом написал». То есть данные закрыты, обсуждать их он не вправе, а цифра живёт в пересказе журналиста.

Организация Good Judgment формулирует ещё жёстче: «У нас нет никакого представления о том, что показали Игнатиусу». Своими данными они подтверждают другое. Методы проекта оказались на 34,7 % точнее рынка предсказаний внутри разведсообщества на 139 вопросах третьего года. Но это, во-первых, смешанная группа, а не одни суперпрогнозисты. Во-вторых, сравнение с рынком, то есть с агрегатом мнений, а не с отдельными аналитиками.

Оставь этот случай в памяти как эмблему всего курса. Самая цитируемая цифра целой области восходит к одной газетной колонке со ссылкой на секретные данные, которых не видел никто. Проверяемое утверждение отличается от непроверяемого не громкостью, а тем, можно ли до него дойти. Дойти сюда нельзя, и мы говорим это вслух, вместо того чтобы тихо переставить сноску.

Что возражают суперпрогнозистам

Спор на этом не кончается, и знать его полезно вдвойне: заодно увидишь, как выглядит научное возражение по существу, не «они жулики», а «вы померили не то».

Переанализ 2025 года. Хауэнстайн с соавторами пересчитали те же данные турнира через теорию ответов на задания и учли посторонние переменные. Эффекты обучения и работы в командах после этого, по их формулировке, существенно исчезали, уменьшались, а местами менялись на противоположные. Статья вышла в том же журнале, что и оригинал.

Отбор или вмешательство. «Суперпрогнозист» это одновременно отбор лучших и воздействие на них: элитная команда, обучение, статусный ярлык. Разделить «они были лучше» и «их сделали лучше» турнирный дизайн не позволяет, и авторы работы 2015 года это признают сами.

Устойчивость статуса. Обычно называют цифру: около 70 % сохраняли статус год к году, корреляция 0,65. Она напечатана в популярной книге Тетлока и Гарднера, а в рецензируемых статьях её нет. И читать её надо в обе стороны: 0,65 это много для прогнозов, но около 30 % суперпрогнозистов теряли статус каждый год.

Возражение Талеба. Оно не про честность данных, а про метрику. Шкала Брайера бинарна: она меряет попадание в «да/нет», а последствия в жизни непрерывны. Успех по такой шкале не переносится на решения с крупными ставками, а при толстых хвостах может оказаться даже обратным индикатором. Любопытно, что у Талеба и Тетлока есть совместная работа, где математическое ядро этого довода они формулируют вместе. Спорят они о выводах, а не о фактах.

Что из всего этого следует для тебя? Ровно то, с чего урок начался. Калибровка остаётся навыком, она тренируется и проверяется счётом. А вот «стать суперпрогнозистом» не цель, а ярлык турнира, и половина громких историй про него не проверяется.

Артефакт модуля: правила калиброванного

1. Говори процентами, а не «наверное», ведь проценты можно проверить и подвинуть. 2. Интервалы делай шире, чем комфортно: честный 90% неприятно широк. 3. Сначала базовая частота, потом детали истории. 4. Много маленьких шагов по весу свидетельства, где вес = «насколько трудно подделать». 5. Веди счёт: записанный прогноз и есть единственный честный свидетель. И нулевое правило, поверх всех: «50 на 50» при полном незнании и «не знаю, надо посчитать» дают ответы сильного, а не слабого, а притворная точность остаётся худшей из неточностей.

Впереди практика: вторая калибровочная серия, те же десять интервалов, что и в уроке 9, и сравнение двух замеров. А модуль 6 выведет нас из внутренней кухни вероятностей обратно в шумный мир: заголовки, источники, фактчекинг и приёмы, которыми информационная среда играет на всех струнах, натянутых в модулях 1-5.

Конспект

Калиброванность: «70%» сбывается в ~7 из 10 и проверяется только серией, не одним случаем. Уверенность работает прибором: «всегда 100%» = сломанная стрелка. Дефолтный сбой тут сверхточность: заявленные 98-процентные интервалы промахивались в 34 % случаев у Альперта и Райффы, заявленные 80 % ловили ответ в 48 % у Солла и Клеймана, а для 90 % проверенного числа нет. Обучение с обратной связью снижало промахи с 34 % до 19 %. Трудность задания переворачивает знак: на лёгких знающие люди недоуверенны. Турнир IARPA: 2246 и 1648 участников, 199 исходов, верхние 2 % в пять команд по 12, Брайер 0,25 на старте второго года и 0,07 к его концу против 0,38-0,46 и 0,16-0,26, регрессии к среднему у них нет. Приёмы: дробные проценты, много маленьких обновлений, база первой, обязательный счёт плюс банальный объём работы (95 вопросов против 61). Чего в уроке больше нет: «обгоняли аналитиков с закрытыми данными», рецензируемого источника нет, цифра из газетной колонки со ссылкой на секретные источники. Возражения: переанализ 2025 года, неразделимость отбора и вмешательства, устойчивость статуса только из книги, бинарность шкалы Брайера у Талеба. Тренажёр: Д3.

тренажёр урока 15

Десять интервалов

Для каждого вопроса задайте интервал, в котором уверены на 90 %. Не угадывайте точное число, задавайте границы. Если калибровка хорошая, попаданий будет около девяти.

Открыть тренажёр

Ключевые работы

Alpert & Raiffa1982Слушатели Гарвардской школы бизнеса, знакомые с анализом решений: за границы заявленных 98-процентных интервалов попадало 34 % истинных значений вместо ожидаемых 2 %, а после обучения с обратной связью 19 %.
Lichtenstein, Fischhoff & Phillips1982Сводка литературы по калибровке: утверждения, которым приписывали шансы 1000:1, оказывались верны в 81-88 % случаев, а при шансах миллион к одному в 90-96 %. Сверхуверенность сильнее всего на трудных заданиях, а на лёгких знающие люди недоуверенны.
Soll & Klayman2004Заявленные 80-процентные интервалы содержали правильный ответ в 48 % случаев. Ширина субъективных интервалов местами составляла лишь 40 % от необходимой для честной калибровки.
Mellers и др.2014Турнир прогнозов IARPA: 2246 участников в первый год и 1648 во второй, 199 исходов. Отобранные по итогам первого года лучшие 2 % и сведённые в пять команд по 12 человек дали счёт Брайера 0,25 на старте второго года и 0,07 к его концу против 0,38-0,46 и 0,16-0,26 у остальных групп, без ожидаемой регрессии к среднему.
Mellers и др.2015Три турнира по девять месяцев, от 2200 до 3900 прогнозистов в год: у суперпрогнозистов разрешающая способность 0,40 против 0,32 у остальных и площадь под кривой 96 против 75. Статус удерживался два года подряд вопреки ожидаемой регрессии.
Taleb2020Между бинарными предсказаниями и реальными выплатами есть систематические статистические различия. Успех по шкале Брайера не переносится на решения с непрерывными последствиями, а при толстых хвостах может быть обратным индикатором.
Hauenstein и др.2025Переанализ данных того же турнира через теорию ответов на задания: после учёта посторонних переменных эффекты обучения и работы в командах ослабевали, исчезали, а в отдельных случаях менялись на противоположные.

Разбор

источника нетСуперпрогнозисты системно обгоняли профессиональных аналитиков, имевших доступ к закрытым данным.

Рецензируемой работы с таким сравнением не существует. Обе основные статьи группы Меллерс (2014, 2015) прочитаны целиком и сравнения с разведаналитиками не содержат. Цифра «примерно на 30 % лучше» происходит из колонки Дэвида Игнатиуса в The Washington Post от 1 ноября 2013 года со ссылкой на анонимные засекреченные источники. Тетлок говорит об этом прямо: «Я могу об этом говорить только потому, что он об этом написал». Организация Good Judgment: «У нас нет никакого представления о том, что показали Игнатиусу». Подтверждается другое: методы проекта были на 34,7 % точнее рынка предсказаний внутри разведсообщества на 139 вопросах третьего года, но это смешанная группа и агрегат, а не суперпрогнозисты против отдельных аналитиков.

источника нетЗаявленные 90-процентные интервалы ловят верный ответ в 40-60 % случаев.

Число ходит по популярным пересказам и приписывается управленческой литературе начала девяностых, но по первоисточнику не находится: полного текста нет ни в одном открытом хранилище. Курс его не печатает. Подтверждено соседнее и более сильное: у Альперта и Райффы заявленные 98 % ловили около двух третей значений, у Солла и Клеймана заявленные 80 % давали 48 %. Направление то же, а числа настоящие, и этого для урока достаточно.

спор открытОбучение и работа в командах повышали точность прогнозов в турнире.

В исходных работах эффект есть: у команд счёт Брайера лучше, чем у одиночек, а вероятностное обучение добавляло к этому ещё немного. Хауэнстайн с соавторами (2025) пересчитали те же данные через теорию ответов на задания и получили, что учёт посторонних переменных эффекты обучения и командной работы существенно уменьшал, устранял, а местами разворачивал. Переанализ опубликован в том же журнале, что и оригинал, и ответом авторов пока не закрыт.

Термины

Калибровкаcalibration
Совпадение заявленной уверенности с долей сбывшегося: у калиброванного прогнозиста «70 %» сбывается примерно в семи случаях из десяти. Проверяется только серией прогнозов, по одному случаю не проверяется вовсе.
Сверхточностьoverprecision
Уверенность, что твоё знание точнее, чем оно есть. Проявляется в слишком узких интервалах: заявленные 98 % ловят правильный ответ примерно в двух третях случаев.
Субъективный интервалsubjective confidence interval
Диапазон, который человек называет сам, приписывая ему степень уверенности («уверен на 90 %»). Служит прямым и быстрым измерением сверхточности: достаточно посчитать попадания.
Оценка БрайераBrier score
Мера качества вероятностных прогнозов: средний квадрат расхождения между объявленной вероятностью и тем, что случилось. Ноль означает идеал, два худший результат. Шкала бинарна по построению, и в этом её слабое место.
Разрешающая способностьresolution
Насколько прогнозист умеет разводить события, которые сбудутся, и события, которые не сбудутся. Отличается от калибровки: можно быть безупречно калиброванным, называя всему подряд среднюю по больнице частоту, и не сообщать этим ничего.
Эффект трудности заданияhard-easy effect
На трудных вопросах уверенность систематически завышена, а на лёгких занижена. Из-за него утверждение «люди всегда самоуверенны» неверно: знак смещения зависит от того, какие задания вы взяли.
Валидность метрикиconstruct validity
Вопрос о том, меряет ли показатель то, ради чего его завели. Возражение Талеба к турнирам прогнозов именно об этом: бинарная шкала может быть безупречно посчитана и всё равно не отвечать за последствия решений.
Суперпрогнозистsuperforecaster
Участник турнира IARPA, попавший по итогам первого сезона в верхние два процента и переведённый в отдельную команду. Ярлык обозначает отбор и последующее вмешательство сразу, и турнирный дизайн их не разделяет.
Журнал прогнозовforecast log
Список собственных прогнозов с процентами и датой проверки, записанный заранее. Единственный способ узнать свою калибровку: без записи память перепишет историю в жанре «я так и знал».

Практикум · Вторая калибровочная серия

Сравнение с серией из урока 9 остаётся единственным способом увидеть, что калибровка тренируется.

  1. Проведите новую серию из десяти интервалов на 90 %, на вопросах из другой области.
  2. Посчитайте попадания и сравните с результатом урока 9.
  3. Сделайте пять прогнозов о ближайшем месяце с процентами: «вероятность, что проект сдвинется, 60 %».
  4. Запишите дату проверки прямо в календарь.
  5. Заведите правило на месяц: заменять «наверное» и «скорее всего» конкретным числом. Через месяц проверьте счёт.

Вопросы для самопроверки

Вопрос 1

Какая практика быстрее всего улучшает калибровку?

  • Больше читать новостей и аналитики: чем шире картина, тем точнее прогноз
  • Избегать прогнозов там, где не уверен
  • Записывать прогнозы с процентами уверенности и потом сверять с фактами
  • Спрашивать мнение большинства и усреднять
Вопрос 2

Менеджер за год ровно сто раз говорил: «эта сделка закроется с вероятностью 60%». Закрылись 57 из них. Что это говорит о его прогнозах?

  • Ничего: исход отдельной сделки предсказать в принципе невозможно никому
  • Он ошибся 43 раза, такие прогнозы ненадёжны
  • Он хорошо калиброван: «60%» сбывается примерно в 6 случаях из 10
  • Он перестраховщик: по-настоящему точный прогнозист говорил бы ровно «57%»
Вопрос 3

Ты дал 10 интервалов, в которых «уверен на 90%» (население стран, длины рек). Попал в 5 из 10. Что это значит и что делать?

  • Интервалы надо сужать: они и так слишком широкие, оттого и промахи
  • Сверхуверенность: интервалы надо делать заметно шире
  • Вопросы были нечестные: таких вещей никто не знает наизусть
  • Отличный результат: половина попаданий это очень много
Вопрос 4

Коллега на любой вопрос отвечает «сто процентов!». Иногда он прав. В чём практическая проблема его прогнозов?

  • Он говорит слишком громко и уверенно
  • Он слишком оптимистичен в своих оценках
  • Проблемы нет: уверенность заразительна и помогает команде действовать
  • Его «100%» ничего не сообщает: непонятно, когда ему верить
Вопрос 5

На бинарный вопрос, в котором у тебя нет никаких данных, ты отвечаешь «50 на 50». Это слабость?

  • Да: монетку подбрасывают те, кто не хочет думать
  • Да: своё мнение нужно иметь по любому вопросу
  • Нет, но только в споре: в решениях так нельзя
  • Нет: 50% при полном незнании и есть самая честная оценка

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Mellers и др., «Psychological Strategies for Winning a Geopolitical Forecasting Tournament», Psychological Science, 2014: Первоисточник про суперпрогнозистов. Полезно открыть таблицу 1 и увидеть все группы разом: разрыв большой, но и у обычных команд счёт к концу года заметно улучшался.
  • Hauenstein и др., «Rethinking the Role of Teams and Training in Geopolitical Forecasting», Psychological Science, 2025: Переанализ тех же данных, напечатанный в том же журнале. Хороший образец того, как выглядит возражение по существу: спор идёт о статистической модели, а не о добросовестности.
  • Тетлок и Гарднер, «Superforecasting» (2015): Книга, с которой сюжет пошёл в мир. Читать с карандашом: часть самых ярких её утверждений, включая долю удержавших статус и сравнение с разведкой, в рецензируемых статьях не встречается.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Критическое мышление»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?