Достоверная угроза в теории игр и репутация
Почему пустая угроза не действует и зачем связывать себе руки
Достоверная угроза в теории игр это угроза, исполнение которой выгодно исполнителю в тот момент, когда до неё дойдёт дело, и проверяют её сравнением выплат в нужном узле дерева, а не убедительностью заявления. Старожилу ценовая война обходится в 30 миллионов, поэтому сеть приходит. Публичное обязательство вернуть разницу покупателям отнимает у него возможность уступить и поднимает выплату с 40 до 100 миллионов.
Yale ECON 159, лекции с 14 по 17 · McKelvey, Palfrey, 1992 · 45 мин · обновлено 12.09.2026
После урока вы сможете
- Проходить дерево игры обратной индукцией и получать ответ в каждом узле
- Отличать достоверную угрозу от пустой по тому, выгодно ли её исполнять, когда до неё дойдёт дело
- Объяснять, каким образом сокращение собственных возможностей увеличивает выплату
- Называть, что из обратной индукции проверялось на людях и с каким результатом
В городке один магазин стройматериалов. Хозяин узнаёт, что сеть присматривает место под свой, и передаёт через знакомых: «Если придут, устрою ценовую войну, разоримся оба».
Считать будем в миллионах рублей за год. Если сеть не приходит, у неё ноль, у старожила 100. Если приходит, ход за старожилом. Уступить, то есть поделить рынок и держать прежнюю цену, даёт сети 20, старожилу 40. Воевать ценой даёт сети −10, старожилу 10.
Угроза выглядит внушительно: −10 сети явно хуже нуля, значит, приходить не стоит. Тем не менее сеть приходит, старожил не воюет, и оба это понимали заранее.
Разобрать, почему, можно ровно одним приёмом, и в этом уроке он главный: игры, где ходят по очереди, читаются с конца.
Дерево игры и обратная индукция
Когда игроки ходят по очереди и каждый видит, что было раньше, игру рисуют не таблицей, а деревом. Узлы обозначают моменты, где кто-то выбирает. Ветви показывают варианты. В концах ветвей стоят выплаты всем игрокам.
У дерева есть свойство, которого нет у таблицы: последний узел решается сам собой. В нём никто больше не ходит, будущего нет, и выбирающему остаётся сравнить готовые числа. Поэтому дерево проходят с конца к началу, заменяя каждый узел на выплату, которая в нём получится. Это и есть обратная индукция.
Пройдём наше дерево. В последнем узле выбирает старожил после прихода сети. Уступить даёт ему 40, воевать даёт 10. Сорок больше десяти, значит в этом узле он уступит, и узел стоит для сети 20, а для него 40.
В первом узле решает сеть. Не приходить даёт ноль. Прийти ведёт в узел, который, как подсчитано, стоит 20. Двадцать больше нуля, значит сеть приходит. Ответ: сеть входит, старожил уступает, выплаты 20 и 40.
Обратите внимание, что угроза в расчёт не вошла ни разу. Она не появляется в дереве, потому что дерево составлено из того, что игроки могут сделать, а не из того, что сказали.
Не спрашивайте, страшна ли угроза и убедительно ли она произнесена. Спросите: если дело дойдёт до исполнения, выгодно ли будет исполнить? Посчитайте обе выплаты в том узле, где придётся выбирать. Если исполнение хуже неисполнения, угроза не влияет на решение противника, как бы она ни звучала.
Почему пустая угроза не работает
Числа показывают, где в угрозе дыра. Если сеть уже пришла, война обходится старожилу в 30 миллионов: 10 вместо 40. Разорять конкурента ценой значит тратить свои деньги на то, чтобы конкуренту стало плохо, и в момент выбора старожилу это невыгодно. Сеть, считая назад, видит то же самое.
Угрозу, которую невыгодно исполнять в тот момент, когда дойдёт до дела, называют недостоверной. Она может быть искренней в момент произнесения. Вопрос не в искренности, а в том, что будет выгодно потом.
Отсюда несимметричное следствие, полезное в переговорах. Слова меняют ожидания, только если за ними стоит изменение выплат. Заявление «я не уступлю ни рубля» ничего не меняет, если уступить рубль будет выгодно. А заявление «я не могу уступить, у меня договор с неустойкой» меняет всё: оно описывает не намерение, а ограничение.
Стоит оговорить, что и это модель: живые люди невыгодные угрозы всё же исполняют. Насколько часто они так поступают, разбирается в конце урока.
Обязательство: сила от сокращения возможностей
Если недостоверность угрозы состоит в том, что исполнять невыгодно, то усилить позицию можно только одним способом: сделать так, чтобы стало выгодно. Причём заранее, до того, как противник примет решение, и так, чтобы противник это видел.
Пусть старожил задолго до прихода сети объявляет и печатает в договоре одно условие. Если у любого магазина в городе окажется дешевле, он вернёт разницу всем, кто покупал у него в этом сезоне. Обязательство публичное и одностороннее. Расторгнуть его нельзя.
Пересчитаем последний узел. Пока конкурента нет, обязательство не стоит ничего: возвращать нечего. Но если сеть придёт и старожил не снизит цену, придётся вернуть разницу прежним покупателям. По условию задачи это 35 миллионов. Значит «уступить» даёт теперь 40 − 35 = 5, а «воевать» по-прежнему 10.
Десять больше пяти. В последнем узле старожил воюет, и это уже не заявление, а результат сравнения. Идём к первому узлу: прийти означает получить −10, не приходить оставляет ноль. Сеть не приходит. Старожил получает 100 вместо прежних 40.
Теперь посмотрите, что именно произошло. Старожил не приобрёл ни одной новой возможности. Он отнял у себя возможность спокойно ужиться с конкурентом, и от этого выиграл 60 миллионов. В задаче с одним человеком такого не бывает никогда: лишний вариант в наихудшем случае просто не используется. В игре бывает, потому что чужое решение зависит не от ваших намерений, а от того, что вы можете сделать.
У работающего обязательства два обязательных признака, и без любого из них оно превращается обратно в слова. Оно должно быть наблюдаемым, то есть противник должен убедиться, что оно есть, а также необратимым, так что от него нельзя тихо отказаться в последний момент. Отсюда обычные их формы: публичность, письменный договор с неустойкой, невозвратные вложения, передача решения третьему лицу.
Договор о возврате разницы взят как самая короткая иллюстрация обязательства и посчитан на условных числах. В реальной практике такие условия изучаются отдельно и оцениваются по-разному, в том числе с точки зрения права о конкуренции. Здесь из примера следует только устройство приёма, а не рекомендация его применять.
«Многоножка»: дерево, доведённое до конца
Обратную индукцию удобно проверить на игре, ради которой её и придумали проверять. Устройство: на столе две стопки денег, 0,40 и 0,10 доллара. Игрок либо берёт большую стопку, либо пасует. Если берёт, игра кончается и второму достаётся меньшая. Если пасует, обе стопки удваиваются, а ход переходит к другому. Ходов четыре, и это всем известно заранее.
Выплаты по узлам, первое число первому игроку. Взять на первом ходу даёт (0,40 и 0,10), на втором (0,20 и 0,80), на третьем (1,60 и 0,40), на четвёртом (0,80 и 3,20). Если пас случился все четыре раза, выходит (6,40 и 1,60).
Считаем с конца. Четвёртый узел, ходит второй: взять даёт 3,20, пас даёт 1,60. Берёт. Третий узел, ходит первый: взять даёт 1,60, пас ведёт в четвёртый узел, где второй берёт, и первому останется 0,80. Берёт. Второй узел, ходит второй: взять даёт 0,80, пас ведёт в третий узел, где первый берёт, и второму останется 0,40. Берёт. Первый узел, ходит первый: взять даёт 0,40, пас ведёт во второй узел, где второй берёт, и первому останется 0,20. Берёт.
Вывод модели однозначен: первый игрок забирает 0,40 на первом же ходу. Заметьте цену этого вывода. Если бы оба пасовали все четыре раза, первый получил бы 6,40, то есть в шестнадцать раз больше. Ни одно равновесие Нэша этой игры не допускает другого исхода, так что сослаться на выбор «неудачного» равновесия здесь нельзя.
Теперь измерение. Ричард Мак-Келви и Томас Палфри провели эту игру в лаборатории Калифорнийского технологического института: семь сессий, 662 партии (Econometrica, 1992). Первым ходом игра кончилась в 37 партиях из 662, около 5,6 %. Ещё 23 партии прошли до конца с пасом на каждом ходу. Остальные распределились между промежуточными узлами.
Это один из самых чистых провалов теоретического предсказания в экономике: предсказан один исход, наблюдался он в одном случае из восемнадцати. Тренажёр к уроку даёт пройти то же дерево и поменять в нём одно число.
Репутация: зачем пасовать
Прежде чем говорить о репутации, стоит закрыть счётом то, что обещано в девятом и десятом уроках. Там сговор разваливался потому, что расширение выгоднее и при соблюдающем сопернике, и при нарушающем: 2000 против 1800 сегодня. Посчитаем ту же задачу как повторяющуюся. Нарушение даёт разовую прибавку 200. Если в ответ соперник расширяется навсегда, то со следующего периода вместо 1800 будет 1600, по 200 потери в каждом периоде. Пусть следующий период весит в δ раз меньше нынешнего, где δ между нулём и единицей. Эту величину называют весом будущего, или дисконтом. Поток потерь стоит сегодня 200 × (δ + δ² + δ³ + …) = 200δ / (1 − δ).
Нарушать невыгодно, когда эта величина больше разовой прибавки: 200δ / (1 − δ) > 200, то есть при δ больше одной второй. Вот и весь механизм, называвшийся раньше словами «будущее ценится достаточно высоко»: у него есть порог, и порог считается. В счёте нет ни доверия, ни порядочности, ни договора, а есть три числа: вес будущего, размер соблазна и величина наказания. И δ бывает меньше единицы не только от нетерпения: если игра может оборваться после любого периода, вероятность продолжения входит в δ тем же множителем.
Объяснение, которое предложили сами авторы опыта, репутационное. Допустим, каждый игрок допускает, что среди партнёров есть небольшая доля тех, кому небезразличен чужой выигрыш и кто пасует безусловно. Тогда и вполне корыстному игроку выгодно какое-то время изображать такого: пас стоит недорого, а если партнёр поверит и тоже спасует, стопки удвоятся. Подгонка их модели даёт долю таких игроков порядка 5 % выборки.
Общий результат этого рода получен раньше и в чистом виде. Дэвид Крепс, Пол Милгром, Джон Робертс и Роберт Уилсон показали в 1982 году: достаточно малой вероятности того, что партнёр безусловно играет «око за око». Тогда в конечно повторяемой дилемме заключённого сотрудничество рационально почти до самого конца.
Отсюда рабочее определение. Репутация это не черта характера, а вложение: игрок несёт издержки сейчас, чтобы изменить чужие ожидания о своём будущем поведении. Работает оно ровно при двух условиях: игра не последняя и поведение наблюдаемо. Уберите любое из них, и механизм исчезает, сколько бы честным ни был человек.
Самую известную проверку того, какое поведение выживает при повторении, дали турниры Роберта Аксельрода. В первом участвовали 14 присланных программ, каждая пара играла по 200 партий, весь турнир прогонялся пять раз. Победила «око за око» Анатоля Рапопорта: сотрудничать первым ходом, дальше повторять предыдущий ход партнёра. Во втором турнире было 62 программы от участников, знавших результаты первого, и «око за око» победила снова.
Вывод из этого сделали чрезмерно широкий, и его пришлось сузить. В 2015 году Анатоль Рапопорт, Даррил Сил и Эндрю Колман пересчитали первый турнир при другом, двухэтапном формате. Там «око за око» побеждает лишь в 11 % смоделированных турниров против 30 % у программы T&C, а среди «добрых» стратегий оказывается последней. Корреляция между суммой очков и числом личных побед отрицательна. Иначе говоря, победа зависит от устройства турнира, критерия успеха и чисел в таблице выплат. От того самого, от чего и должен зависеть модельный результат, в отличие от закона природы.
Вычисление верное, а предсказание нет
Обратная индукция это теорема о модели: при заданном дереве и заданных выплатах последовательность выборов вычисляется однозначно. Спорить с ней бессмысленно, как с таблицей умножения. Спорно совсем другое утверждение, что живые люди так играют.
Оно проверялось, и результаты сходятся. «Многоножка»: 37 партий из 662. Игра «ультиматум»: первый предлагает делёж суммы, второй может отвергнуть и оставить обоих ни с чем. Обратная индукция велит предлагать минимум и принимать любое предложение. По сводке Колина Камерера модальные и медианные предложения приходятся на интервал от 40 до 50 % суммы, а предложение в 20 % отвергается примерно в половине случаев.
Есть и открытый спор о том, помогает ли стратегическая обученность. Игнасио Паласиос-Уэрта и Оскар Волий нашли, что сильные шахматисты останавливают «многоножку» немедленно в 69 % случаев, а гроссмейстеры в 100 %. Стивен Левитт, Джон Лист и Салли Садофф на шахматистах мирового уровня получили обратное. Равновесие обратной индукции те «почти никогда» не играют, хотя многие безошибочно считают назад в чистых задачах на обратную индукцию. Связи между этими двумя умениями у одних и тех же людей не обнаружилось. Согласия нет до сих пор.
Что из урока переносится в жизнь несмотря на всё это? Не предсказание, а вопрос. Услышав угрозу или обещание, посчитайте, что будет выгодно тому, кто их произнёс, в тот момент, когда придётся исполнять. Услышав, что кто-то добровольно сузил себе выбор (подписал договор с неустойкой, публично объявил условие, потратил невозвратные деньги), не считайте это неосмотрительностью: посмотрите, чьё чужое решение это меняет.
И последнее, общее для всего модуля. Теория игр не описывает людей. Она описывает следствия из чисел и задаёт разметку, на которой видно, где именно наблюдение расходится с ожиданием. Расхождение в 37 партиях из 662 это результат, а не просто неудача: без модели о нём нечего было бы сказать.
Пройти с конца
Четырёхходовая «многоножка» из опыта Мак-Келви и Палфри. Меняйте выплаты и смотрите, как пересчитываются все четыре узла и что происходит с первым ходом. Задача урока найти изменение одного числа, после которого на первом узле выгоден «пас».
Ключевые работы
| McKelvey, Palfrey, «An Experimental Study of the Centipede Game», Econometrica 60(4) | 1992 | 662 партии «многоножки»: предсказанный обратной индукцией исход наблюдался в 37 случаях, ещё 23 партии дошли до конца с пасом на каждом ходу. |
| Kreps, Milgrom, Roberts, Wilson, «Rational Cooperation in the Finitely Repeated Prisoners' Dilemma», Journal of Economic Theory 27(2) | 1982 | Модельный результат: малой вероятности того, что партнёр безусловно играет «око за око», достаточно, чтобы сотрудничество стало рациональным почти до конца конечно повторяемой игры. |
| Rapoport, Seale, Colman, «Is Tit-for-Tat the Answer? On the Conclusions Drawn from Axelrod's Tournaments», PLOS ONE 10(7) | 2015 | Пересчёт турнира Аксельрода при двухэтапном формате: «око за око» побеждает в 11 % смоделированных турниров против 30 % у другой программы. Успех зависит от устройства турнира и критерия. |
| Levitt, List, Sadoff, «Checkmate: Exploring Backward Induction among Chess Players», American Economic Review 101(2) | 2011 | Шахматисты мирового уровня почти никогда не играют равновесие обратной индукции в «многоножке», хотя многие безошибочно считают назад в чистых задачах на обратную индукцию. |
Что подтвердилось, а что нет
В модели угроза входит в расчёт только через тот узел, где её придётся исполнять: если исполнение хуже неисполнения, противник, считая назад, её игнорирует. В разобранном примере война обходится старожилу в 30 миллионов, поэтому сеть приходит несмотря на заявление. Работает не громкость угрозы, а изменение собственных выплат, то есть обязательство, которое наблюдаемо и необратимо. Оговорка: живые люди невыгодные угрозы иногда исполняют, поэтому модель даёт критерий для вопроса, а не готовое предсказание.
Это верно для задачи одного лица: лишняя возможность в худшем случае просто не используется. В игре неверно, и экономическая теория этого не утверждает. Наоборот, устройство обязательства состоит именно в отказе от вариантов. В примере с магазином публичное обязательство вернуть разницу убирает возможность мирно ужиться с конкурентом и поднимает выплату с 40 до 100 миллионов, потому что меняет расчёт не своего, а чужого решения.
Паласиос-Уэрта и Волий (2009) нашли на сильных шахматистах 69 % немедленных остановок в «многоножке» и 100 % у гроссмейстеров. Левитт, Лист и Садофф (2011) на шахматистах мирового уровня получили противоположное: равновесие обратной индукции те «почти никогда» не играют, а связи между поведением в «многоножке» и успехом в чистых задачах на обратную индукцию у одних и тех же людей не обнаружено. Расхождение касается отбора участников и обстановки эксперимента. Согласия нет.
Термины
- последовательная играsequential game
- Игра, в которой игроки ходят по очереди и ходивший позже видит, что было раньше. Задаётся деревом, а не таблицей.
- дерево игрыgame tree
- Изображение последовательной игры: узлы отмечают моменты выбора с указанием, чей ход, ветви соответствуют вариантам, а на концах ветвей записаны выплаты всем игрокам.
- обратная индукцияbackward induction
- Прохождение дерева с конца к началу: каждый узел заменяется выплатой, которую даст выбор в нём. Даёт однозначный ответ при заданных выплатах.
- достоверная угрозаcredible threat
- Угроза, исполнение которой выгодно исполнителю в тот момент, когда до него дойдёт дело. Проверяется сравнением выплат в соответствующем узле, а не убедительностью заявления.
- обязательствоcommitment
- Заранее принятое ограничение собственного выбора, наблюдаемое противником и необратимое. Повышает выплату тем, что меняет расчёт чужого решения.
- невозвратные вложения как обязательствоsunk investment as commitment
- Уже потраченные и не подлежащие возврату средства, само существование которых делает выгодным поведение, невыгодное без них.
- повторяющаяся играrepeated game
- Одна и та же игра, разыгрываемая теми же участниками много раз подряд. Позволяет наказывать за прошлое и потому меняет набор равновесий.
- репутацияreputation
- Вложение в чужие ожидания о своём будущем поведении: издержки несутся сейчас ради изменения того, чего от вас ждут. Работает, только если игра не последняя и поведение наблюдаемо.
- «око за око»tit for tat
- Стратегия повторяющейся игры: сотрудничать первым ходом, дальше повторять предыдущий ход партнёра. Победила в обоих турнирах Аксельрода.
- вес будущегоdiscount factor
- Во сколько раз следующий период ценится меньше нынешнего. Учитывает и нетерпение, и вероятность того, что игра прервётся. От него зависит, окупается ли наказание за нарушение договорённости.
Практикум · Дерево, угроза и обязательство
Задача состоит в том, чтобы пройти дерево обратной индукцией самостоятельно, увидеть, от какого именно числа зависит ответ, и приложить критерий достоверности к настоящей угрозе. Около сорока минут, первые три шага с числами.
- Нарисуйте четырёхходовую «многоножку» с выплатами опыта: взять на первом ходу даёт (0,40 и 0,10), на втором (0,20 и 0,80), на третьем (1,60 и 0,40), на четвёртом (0,80 и 3,20), пас во всех четырёх (6,40 и 1,60). Пройдите её с конца, выписывая для каждого узла оба сравниваемых числа и выбор.
- Посчитайте, что получает каждый игрок при исходе обратной индукции и при всеобщем пасе. Выпишите разницу отдельно для первого и для второго игрока. Они разные, и это важно для следующего шага.
- Измените ровно одно число в дереве так, чтобы обратная индукция дала на первом узле «пас». Проверьте пересчётом всех четырёх узлов. Запишите, какое число вы изменили и почему сработало именно оно.
- Найдите за последнюю неделю в новостях, рабочей переписке или разговоре угрозу либо обещание с условием. Выпишите, что произойдёт с тем, кто его произнёс, если придётся исполнить: выиграет он или проиграет по сравнению с неисполнением. Ответ должен быть в единицах (в деньгах, времени, потерянных клиентах), а не в словах «ему будет неприятно».
- Для той же угрозы придумайте одно обязательство, после которого исполнение стало бы выгоднее неисполнения. Проверьте его по двум признакам: видит ли его противник и можно ли от него тихо отказаться. Если обязательство добавляет обещание, а не убирает возможность, оно не годится. Переделайте.
Вопросы для самопроверки
Сеть решает, входить ли на рынок. Если входит, старожил выбирает из двух ответов. Когда он уступает, у сети 20, у него 40. Когда воюет, у сети −10, у него 10. Не входить даёт сети ноль. Чем кончится игра?
- Сеть входит, старожил уступает
- Сеть не входит, потому что боится войны
- Сеть входит, старожил воюет
- Ответ зависит от того, насколько убедительно старожил пригрозил
Старожил заранее и публично обязуется вернуть разницу всем покупателям, если у конкурента окажется дешевле. При появлении конкурента это обойдётся в 35, если он не снизит цену. Почему его положение улучшается?
- Потому что обязательство даёт ему новый вариант действий
- Потому что покупатели станут лояльнее и выручка вырастет
- Потому что уступка теперь даёт 5 против 10 у войны, и война становится выгодной
- Потому что сеть не сможет проверить, есть ли такое обязательство
В четырёхходовой «многоножке» с выплатами (0,40 и 0,10), (0,20 и 0,80), (1,60 и 0,40), (0,80 и 3,20), а также (6,40 и 1,60) первым ходом игра кончилась в 37 партиях из 662. Что отсюда следует?
- Что предсказание модели о поведении не подтвердилось, тогда как сам расчёт по дереву верен
- Что участники не поняли правил
- Что обратная индукция как приём вычисления содержит ошибку: раз предсказание не сбылось, неверен и сам счёт
- Что игроки выбрали другое равновесие Нэша: их в этой игре несколько, и участники сошлись не на том, которое даёт обратная индукция
Что означает утверждение, что репутация работает только при двух условиях?
- Что честные люди ведут себя одинаково в любой обстановке, и репутация просто показывает, кто честен
- Что репутация возникает лишь при большом числе участников: пока наблюдателей мало, беречь её незачем
- Что репутацию нельзя приобрести быстро: на неё нужны годы поведения, которое все видят
- Что механизм требует, чтобы игра не была последней и чтобы поведение было наблюдаемо
Паласиос-Уэрта и Волий сообщают, что сильные шахматисты останавливают «многоножку» немедленно в 69 % случаев. Левитт, Лист и Садофф на шахматистах мирового уровня находят, что равновесие обратной индукции те почти никогда не играют. Как правильно передать состояние вопроса?
- Обученность помогает: результат подтверждён на шахматистах, и вторая работа этого не опровергает
- Согласия нет, а расхождение касается отбора участников и обстановки эксперимента
- Обученность не помогает: результат опровергнут работой на шахматистах мирового уровня
- Обе работы измеряли разные величины, поэтому спора нет: одна говорит о доле немедленных остановок, другая о доле партий, сыгранных по обратной индукции
Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.
Что читать
- Yale ECON 159 «Game Theory», Бен Полак, лекции с 14 по 17 (Open Yale Courses): Обязательства и первый ход, достоверность угроз, репутация и дуэли, ультиматум и переговоры, именно об этом идут четыре лекции подряд.
- McKelvey, Palfrey, «An Experimental Study of the Centipede Game», Econometrica, 1992: Первоисточник опыта с «многоножкой» вместе с репутационным объяснением, которое авторы подгоняли к собственным данным.
- Robert Axelrod, «The Evolution of Cooperation», Basic Books, 1984: Турниры повторяющейся дилеммы из первых рук. Читать вместе с разбором Рапопорта, Сила и Колмана (PLOS ONE, 2015), где выводы книги существенно сужены.