Калибровка уверенности
Уверенность как ставка: интервалы, счёт и практика суперпрогнозистов
Калибровкой называют совпадение заявленной уверенности с долей сбывшегося: у калиброванного прогнозиста «70 %» сбывается примерно в семи случаях из десяти. По одному случаю она не проверяется вовсе, только серией прогнозов. Типичным сбоем оказывается сверхточность: у Альперта и Райффы за границы интервалов, в которых слушатели были уверены на 98 %, вылетало 34 % истинных значений вместо обещанных двух процентов.
Модуль V. Байесовское мышление · навыки Д3 · 23 мин · обновлено 12.09.2026
После урока вы сможете
- Говорить «70 %» и оказываться правым примерно в 70 % случаев. Интервалы вместо точечных догадок.
Синоптик сказал: «Вероятность дождя завтра 70%». Назавтра сухо. Синоптик ошибся?
Неизвестно. Один сухой день совместим с честными «70%», ведь тридцать раз из ста при такой вероятности дождя не будет. Проверить синоптика можно только серией: собери все дни, когда он говорил «70%», и посчитай. Если дождь шёл примерно в 7 из 10 таких дней, прогнозист калиброван: его проценты значат ровно то, что говорят. Если в 4 из 10, то его «70%» на самом деле сорок, и это надо знать всем, кто планирует по его прогнозам.
Калибровка идёт последним навыком модуля и самым личным: сегодня проверим твои проценты.
Уверенность это прибор, и он бывает сбит
Смотри, что даёт калибровка. Уверенность работает каналом информации: слыша от человека «я почти уверен», ты решаешь, перепроверять ли за ним. Если его «почти уверен» сбывается в 95%, можно строить планы. Если в 60%, то его «почти уверен» стоит немного. А человек, у которого всё «стопроцентно», и есть сломанный прибор: стрелка прибита к максимуму, показания не значат ничего, и каждый его промах под «сто процентов» стоит кому-то денег.
Из модуля 3 ты уже знаешь диагноз по умолчанию: сверхточность. Вот как её мерили. Альперт и Райффа давали слушателям Гарвардской школы бизнеса, знакомым с анализом решений, вопросы с числовым ответом. Просили очертить интервал, в котором испытуемый уверен на 98 %. За границы этих интервалов вылетало 34 % истинных значений вместо обещанных двух процентов.
Солл и Клейман в 2004 году мерили то же на 80-процентных интервалах: верный ответ попадал внутрь в 48 % случаев. Ширина субъективных интервалов местами составляла лишь 40 % от той, что нужна для честной калибровки. Про 90-процентные интервалы курс числа не приводит: расхожую цифру «попадают 40-60 %» проверить по первоисточнику не удалось, а придумывать замену мы не станем. Направление у всех замеров одно, и вы его только что видели дважды: интервалы выходят слишком узкими.
Хорошая новость там же. У Альперта и Райффы после обучения с обратной связью промахи упали с 34 % до 19 %. Это всё ещё в девять раз больше обещанного и вдвое меньше прежнего. Калибровка, в отличие от многих искажений, действительно тренируется.
И поправка, чтобы не выйти отсюда с лозунгом «человек всегда самоуверен». По сводке Лихтенштейн, Фишхоффа и Филлипса картина зависит от трудности задания. На трудных сверхуверенность выражена сильно, а на лёгких знающие люди, наоборот, недоуверенны и занижают свои шансы. Там же есть цифры для крайних ставок: утверждения, которым приписывали шансы тысяча к одному, оказывались верны в 81-88 % случаев, а при шансах миллион к одному в 90-96 %.
Как это меряют: интервалы и серии
Инструмент номер один это интервалы 90%. На вопрос «какова длина экватора?» ты не обязан знать ответ, но обязан честно очертить своё незнание: «где-то от X до Y, и я готов поставить 9 против 1, что попал». Секрет, который все узнают на первой же серии: честный 90%-интервал шире, чем комфортно. Хочется сузить и выглядеть знающим, а правильно расширить и быть точным. Узкий интервал мимо ответа это не «почти угадал», это промах уверенности.
Сегодня в практике тебя ждёт вторая серия из десяти таких вопросов, с подсчётом попаданий и сравнением с первой, из урока 9. Правила честной игры простые: не гуглить, интервалы записывать до проверки, расширять до лёгкого дискомфорта. Сколько попаданий считать типичным, курс не обещает: разброс между сериями большой, а число, которое обычно называют, мы проверить не смогли. Мерить надо своё, и важно тут не абсолютное количество, а сдвиг между первой серией и второй.
Суперпрогнозисты: калибровка как спорт
Что бывает, когда навык доводят до предела, показал многолетний турнир прогнозов, устроенный американским агентством IARPA. Тысячи добровольцев предсказывали мировые события, с процентами и проверкой каждого прогноза. Команду-победителя собрал Филип Тетлок.
Числа стоит привести, потому что дальше речь пойдёт об их отсутствии. В первый год участвовали 2246 человек, во второй 1648, а в подсчёт вошли 199 геополитических исходов. По итогам первого года шестьдесят лучших, то есть верхние два процента, собрали в пять команд по двенадцать человек. Их и назвали суперпрогнозистами.
На старте второго года оценка Брайера у них была 0,25 против 0,38-0,46 у остальных групп, а к концу того же года 0,07 против 0,16-0,26, и чем меньше, тем лучше. Ожидаемой регрессии к среднему у них не случилось, а у всех прочих групп она была. По трём турнирам разрешающая способность суперпрогнозистов равна 0,40 против 0,32 у остальных, а площадь под кривой 96 против 75.
Их секреты скучны и потому воспроизводимы. Дробные проценты: не «наверное, да», а «63%», и готовность двинуть до 60 или 67 по новому свидетельству. Смешное на вид различие 60/65 на длинной серии превращается в реальное преимущество. Много маленьких обновлений вместо редких разворотов, та самая походка из урока 14. Взгляд снаружи первым: прежде чем нырять в детали («какой харизматичный кандидат!»), спроси базовую частоту («как часто в принципе побеждают такие?»), и узнаёшь линейку модуля 3 и базу модуля 5, работающие вместе. И главное тут счёт: каждый прогноз записан и проверен, а без записи память переписывает историю в жанре «я так и знал».
И ещё одно, самое скучное из всего: они просто больше работали. Суперпрогнозисты отвечали в среднем на 95 вопросов против 61 у обычных команд и делали по 7,8 прогноза на вопрос против 1,6. Часть их преимущества это не дар, а объём.
Самая громкая фраза про суперпрогнозистов и почему её здесь больше нет
Теперь неприятная часть, ради которой стоит держать этот урок открытым до конца.
Про суперпрогнозистов чаще всего пересказывают одно: обычные люди без допусков и погон системно обгоняли профессиональных аналитиков разведки, читавших закрытые данные, причём процентов на тридцать. Эта фраза стояла и в нашем уроке. Мы её убрали. Вот почему.
Рецензируемого источника у неё нет. Обе главные работы группы Меллерс, 2014 и 2015 годов, прочитаны целиком: сравнения с разведаналитиками в них нет вовсе. Ни одной статьи с таким сравнением найти не удалось.
Откуда цифра. Из газетной колонки: Дэвид Игнатиус, The Washington Post, 1 ноября 2013 года. Он написал, что лучшие прогнозисты выступили «примерно на 30 процентов лучше» аналитиков разведсообщества, со ссылкой на анонимные засекреченные источники.
Сам Тетлок подтверждает, что это и есть его источник, и говорит прямо: «Я могу об этом говорить только потому, что он об этом написал». То есть данные закрыты, обсуждать их он не вправе, а цифра живёт в пересказе журналиста.
Организация Good Judgment формулирует ещё жёстче: «У нас нет никакого представления о том, что показали Игнатиусу». Своими данными они подтверждают другое. Методы проекта оказались на 34,7 % точнее рынка предсказаний внутри разведсообщества на 139 вопросах третьего года. Но это, во-первых, смешанная группа, а не одни суперпрогнозисты. Во-вторых, сравнение с рынком, то есть с агрегатом мнений, а не с отдельными аналитиками.
Оставь этот случай в памяти как эмблему всего курса. Самая цитируемая цифра целой области восходит к одной газетной колонке со ссылкой на секретные данные, которых не видел никто. Проверяемое утверждение отличается от непроверяемого не громкостью, а тем, можно ли до него дойти. Дойти сюда нельзя, и мы говорим это вслух, вместо того чтобы тихо переставить сноску.
Что возражают суперпрогнозистам
Спор на этом не кончается, и знать его полезно вдвойне: заодно увидишь, как выглядит научное возражение по существу, не «они жулики», а «вы померили не то».
Переанализ 2025 года. Хауэнстайн с соавторами пересчитали те же данные турнира через теорию ответов на задания и учли посторонние переменные. Эффекты обучения и работы в командах после этого, по их формулировке, существенно исчезали, уменьшались, а местами менялись на противоположные. Статья вышла в том же журнале, что и оригинал.
Отбор или вмешательство. «Суперпрогнозист» это одновременно отбор лучших и воздействие на них: элитная команда, обучение, статусный ярлык. Разделить «они были лучше» и «их сделали лучше» турнирный дизайн не позволяет, и авторы работы 2015 года это признают сами.
Устойчивость статуса. Обычно называют цифру: около 70 % сохраняли статус год к году, корреляция 0,65. Она напечатана в популярной книге Тетлока и Гарднера, а в рецензируемых статьях её нет. И читать её надо в обе стороны: 0,65 это много для прогнозов, но около 30 % суперпрогнозистов теряли статус каждый год.
Возражение Талеба. Оно не про честность данных, а про метрику. Шкала Брайера бинарна: она меряет попадание в «да/нет», а последствия в жизни непрерывны. Успех по такой шкале не переносится на решения с крупными ставками, а при толстых хвостах может оказаться даже обратным индикатором. Любопытно, что у Талеба и Тетлока есть совместная работа, где математическое ядро этого довода они формулируют вместе. Спорят они о выводах, а не о фактах.
Что из всего этого следует для тебя? Ровно то, с чего урок начался. Калибровка остаётся навыком, она тренируется и проверяется счётом. А вот «стать суперпрогнозистом» не цель, а ярлык турнира, и половина громких историй про него не проверяется.
Артефакт модуля: правила калиброванного
1. Говори процентами, а не «наверное», ведь проценты можно проверить и подвинуть. 2. Интервалы делай шире, чем комфортно: честный 90% неприятно широк. 3. Сначала базовая частота, потом детали истории. 4. Много маленьких шагов по весу свидетельства, где вес = «насколько трудно подделать». 5. Веди счёт: записанный прогноз и есть единственный честный свидетель. И нулевое правило, поверх всех: «50 на 50» при полном незнании и «не знаю, надо посчитать» дают ответы сильного, а не слабого, а притворная точность остаётся худшей из неточностей.
Впереди практика: вторая калибровочная серия, те же десять интервалов, что и в уроке 9, и сравнение двух замеров. А модуль 6 выведет нас из внутренней кухни вероятностей обратно в шумный мир: заголовки, источники, фактчекинг и приёмы, которыми информационная среда играет на всех струнах, натянутых в модулях 1-5.
Конспект
Калиброванность: «70%» сбывается в ~7 из 10 и проверяется только серией, не одним случаем. Уверенность работает прибором: «всегда 100%» = сломанная стрелка. Дефолтный сбой тут сверхточность: заявленные 98-процентные интервалы промахивались в 34 % случаев у Альперта и Райффы, заявленные 80 % ловили ответ в 48 % у Солла и Клеймана, а для 90 % проверенного числа нет. Обучение с обратной связью снижало промахи с 34 % до 19 %. Трудность задания переворачивает знак: на лёгких знающие люди недоуверенны. Турнир IARPA: 2246 и 1648 участников, 199 исходов, верхние 2 % в пять команд по 12, Брайер 0,25 на старте второго года и 0,07 к его концу против 0,38-0,46 и 0,16-0,26, регрессии к среднему у них нет. Приёмы: дробные проценты, много маленьких обновлений, база первой, обязательный счёт плюс банальный объём работы (95 вопросов против 61). Чего в уроке больше нет: «обгоняли аналитиков с закрытыми данными», рецензируемого источника нет, цифра из газетной колонки со ссылкой на секретные источники. Возражения: переанализ 2025 года, неразделимость отбора и вмешательства, устойчивость статуса только из книги, бинарность шкалы Брайера у Талеба. Тренажёр: Д3.
Десять интервалов
Для каждого вопроса задайте интервал, в котором уверены на 90 %. Не угадывайте точное число, задавайте границы. Если калибровка хорошая, попаданий будет около девяти.
Ключевые работы
| Alpert & Raiffa | 1982 | Слушатели Гарвардской школы бизнеса, знакомые с анализом решений: за границы заявленных 98-процентных интервалов попадало 34 % истинных значений вместо ожидаемых 2 %, а после обучения с обратной связью 19 %. |
| Lichtenstein, Fischhoff & Phillips | 1982 | Сводка литературы по калибровке: утверждения, которым приписывали шансы 1000:1, оказывались верны в 81-88 % случаев, а при шансах миллион к одному в 90-96 %. Сверхуверенность сильнее всего на трудных заданиях, а на лёгких знающие люди недоуверенны. |
| Soll & Klayman | 2004 | Заявленные 80-процентные интервалы содержали правильный ответ в 48 % случаев. Ширина субъективных интервалов местами составляла лишь 40 % от необходимой для честной калибровки. |
| Mellers и др. | 2014 | Турнир прогнозов IARPA: 2246 участников в первый год и 1648 во второй, 199 исходов. Отобранные по итогам первого года лучшие 2 % и сведённые в пять команд по 12 человек дали счёт Брайера 0,25 на старте второго года и 0,07 к его концу против 0,38-0,46 и 0,16-0,26 у остальных групп, без ожидаемой регрессии к среднему. |
| Mellers и др. | 2015 | Три турнира по девять месяцев, от 2200 до 3900 прогнозистов в год: у суперпрогнозистов разрешающая способность 0,40 против 0,32 у остальных и площадь под кривой 96 против 75. Статус удерживался два года подряд вопреки ожидаемой регрессии. |
| Taleb | 2020 | Между бинарными предсказаниями и реальными выплатами есть систематические статистические различия. Успех по шкале Брайера не переносится на решения с непрерывными последствиями, а при толстых хвостах может быть обратным индикатором. |
| Hauenstein и др. | 2025 | Переанализ данных того же турнира через теорию ответов на задания: после учёта посторонних переменных эффекты обучения и работы в командах ослабевали, исчезали, а в отдельных случаях менялись на противоположные. |
Разбор
Рецензируемой работы с таким сравнением не существует. Обе основные статьи группы Меллерс (2014, 2015) прочитаны целиком и сравнения с разведаналитиками не содержат. Цифра «примерно на 30 % лучше» происходит из колонки Дэвида Игнатиуса в The Washington Post от 1 ноября 2013 года со ссылкой на анонимные засекреченные источники. Тетлок говорит об этом прямо: «Я могу об этом говорить только потому, что он об этом написал». Организация Good Judgment: «У нас нет никакого представления о том, что показали Игнатиусу». Подтверждается другое: методы проекта были на 34,7 % точнее рынка предсказаний внутри разведсообщества на 139 вопросах третьего года, но это смешанная группа и агрегат, а не суперпрогнозисты против отдельных аналитиков.
Число ходит по популярным пересказам и приписывается управленческой литературе начала девяностых, но по первоисточнику не находится: полного текста нет ни в одном открытом хранилище. Курс его не печатает. Подтверждено соседнее и более сильное: у Альперта и Райффы заявленные 98 % ловили около двух третей значений, у Солла и Клеймана заявленные 80 % давали 48 %. Направление то же, а числа настоящие, и этого для урока достаточно.
В исходных работах эффект есть: у команд счёт Брайера лучше, чем у одиночек, а вероятностное обучение добавляло к этому ещё немного. Хауэнстайн с соавторами (2025) пересчитали те же данные через теорию ответов на задания и получили, что учёт посторонних переменных эффекты обучения и командной работы существенно уменьшал, устранял, а местами разворачивал. Переанализ опубликован в том же журнале, что и оригинал, и ответом авторов пока не закрыт.
Термины
- Калибровкаcalibration
- Совпадение заявленной уверенности с долей сбывшегося: у калиброванного прогнозиста «70 %» сбывается примерно в семи случаях из десяти. Проверяется только серией прогнозов, по одному случаю не проверяется вовсе.
- Сверхточностьoverprecision
- Уверенность, что твоё знание точнее, чем оно есть. Проявляется в слишком узких интервалах: заявленные 98 % ловят правильный ответ примерно в двух третях случаев.
- Субъективный интервалsubjective confidence interval
- Диапазон, который человек называет сам, приписывая ему степень уверенности («уверен на 90 %»). Служит прямым и быстрым измерением сверхточности: достаточно посчитать попадания.
- Оценка БрайераBrier score
- Мера качества вероятностных прогнозов: средний квадрат расхождения между объявленной вероятностью и тем, что случилось. Ноль означает идеал, два худший результат. Шкала бинарна по построению, и в этом её слабое место.
- Разрешающая способностьresolution
- Насколько прогнозист умеет разводить события, которые сбудутся, и события, которые не сбудутся. Отличается от калибровки: можно быть безупречно калиброванным, называя всему подряд среднюю по больнице частоту, и не сообщать этим ничего.
- Эффект трудности заданияhard-easy effect
- На трудных вопросах уверенность систематически завышена, а на лёгких занижена. Из-за него утверждение «люди всегда самоуверенны» неверно: знак смещения зависит от того, какие задания вы взяли.
- Валидность метрикиconstruct validity
- Вопрос о том, меряет ли показатель то, ради чего его завели. Возражение Талеба к турнирам прогнозов именно об этом: бинарная шкала может быть безупречно посчитана и всё равно не отвечать за последствия решений.
- Суперпрогнозистsuperforecaster
- Участник турнира IARPA, попавший по итогам первого сезона в верхние два процента и переведённый в отдельную команду. Ярлык обозначает отбор и последующее вмешательство сразу, и турнирный дизайн их не разделяет.
- Журнал прогнозовforecast log
- Список собственных прогнозов с процентами и датой проверки, записанный заранее. Единственный способ узнать свою калибровку: без записи память перепишет историю в жанре «я так и знал».
Практикум · Вторая калибровочная серия
Сравнение с серией из урока 9 остаётся единственным способом увидеть, что калибровка тренируется.
- Проведите новую серию из десяти интервалов на 90 %, на вопросах из другой области.
- Посчитайте попадания и сравните с результатом урока 9.
- Сделайте пять прогнозов о ближайшем месяце с процентами: «вероятность, что проект сдвинется, 60 %».
- Запишите дату проверки прямо в календарь.
- Заведите правило на месяц: заменять «наверное» и «скорее всего» конкретным числом. Через месяц проверьте счёт.
Вопросы для самопроверки
Какая практика быстрее всего улучшает калибровку?
- Больше читать новостей и аналитики: чем шире картина, тем точнее прогноз
- Избегать прогнозов там, где не уверен
- Записывать прогнозы с процентами уверенности и потом сверять с фактами
- Спрашивать мнение большинства и усреднять
Менеджер за год ровно сто раз говорил: «эта сделка закроется с вероятностью 60%». Закрылись 57 из них. Что это говорит о его прогнозах?
- Ничего: исход отдельной сделки предсказать в принципе невозможно никому
- Он ошибся 43 раза, такие прогнозы ненадёжны
- Он хорошо калиброван: «60%» сбывается примерно в 6 случаях из 10
- Он перестраховщик: по-настоящему точный прогнозист говорил бы ровно «57%»
Ты дал 10 интервалов, в которых «уверен на 90%» (население стран, длины рек). Попал в 5 из 10. Что это значит и что делать?
- Интервалы надо сужать: они и так слишком широкие, оттого и промахи
- Сверхуверенность: интервалы надо делать заметно шире
- Вопросы были нечестные: таких вещей никто не знает наизусть
- Отличный результат: половина попаданий это очень много
Коллега на любой вопрос отвечает «сто процентов!». Иногда он прав. В чём практическая проблема его прогнозов?
- Он говорит слишком громко и уверенно
- Он слишком оптимистичен в своих оценках
- Проблемы нет: уверенность заразительна и помогает команде действовать
- Его «100%» ничего не сообщает: непонятно, когда ему верить
На бинарный вопрос, в котором у тебя нет никаких данных, ты отвечаешь «50 на 50». Это слабость?
- Да: монетку подбрасывают те, кто не хочет думать
- Да: своё мнение нужно иметь по любому вопросу
- Нет, но только в споре: в решениях так нельзя
- Нет: 50% при полном незнании и есть самая честная оценка
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Mellers и др., «Psychological Strategies for Winning a Geopolitical Forecasting Tournament», Psychological Science, 2014: Первоисточник про суперпрогнозистов. Полезно открыть таблицу 1 и увидеть все группы разом: разрыв большой, но и у обычных команд счёт к концу года заметно улучшался.
- Hauenstein и др., «Rethinking the Role of Teams and Training in Geopolitical Forecasting», Psychological Science, 2025: Переанализ тех же данных, напечатанный в том же журнале. Хороший образец того, как выглядит возражение по существу: спор идёт о статистической модели, а не о добросовестности.
- Тетлок и Гарднер, «Superforecasting» (2015): Книга, с которой сюжет пошёл в мир. Читать с карандашом: часть самых ярких её утверждений, включая долю удержавших статус и сравнение с разведкой, в рецензируемых статьях не встречается.