К содержанию
Фонтум Экономика Урок 10 / 24 Все уроки

Главная · Курсы · Экономика · Программа курса · Модуль IV. Стратегическое взаимодействие · урок 10 из 24

Теория игр и дилемма заключённого

Как разумные решения поодиночке дают исход, худший для всех

Дилемма заключённого это устройство выплат, при котором у каждого есть строго доминирующая стратегия, а исход, к которому она ведёт, хуже для всех, чем взаимное согласие. Две обувные лавки получают по 90 тысяч без распродажи и по 60 тысяч, когда её объявляют обе, но объявить распродажу одной выгодно при любом решении соседа. Эгоизм тут задан числами: при весе чужой прибыли 0,6 дилемма исчезает.

Yale ECON 159, лекции с 1 по 3 · Mengel, 2018 · 45 мин · обновлено 12.09.2026

После урока вы сможете

  • Раскладывать ситуацию на три составные части игры: игроки, стратегии, выплаты
  • Находить строго доминируемую стратегию и объяснять, почему её отбрасывают без всяких допущений о партнёре
  • Доводить до конца разбор платёжной матрицы дилеммы заключённого
  • Отличать утверждение модели от измеренной частоты сотрудничества

На одной улице две обувные лавки. Перед началом сезона каждая решает, объявлять ли распродажу. Решают порознь и одновременно: узнать о чужом решении раньше своего нельзя.

Считать умеют обе. Если распродажу не объявляет никто, каждая заработает за сезон 90 тысяч рублей. Если объявляют обе, покупателей столько же, а цены ниже: по 60 тысяч. Если объявляет одна, она перетягивает часть чужого потока и получает 100 тысяч, соседу остаётся 40.

Хозяева не враждуют. Оба предпочли бы спокойный сезон по 90 тысяч. Тем не менее задача кончается распродажей у обоих и прибылью по 60 тысяч, и получается это не из жадности, не из недоверия и не из ошибки в расчётах.

Разбор того, из-за чего именно, занимает остаток урока. Он же служит входом в теорию игр: почти всё, что дальше, устроено так же.

Из чего сделана игра

Игра задаётся тремя вещами, и ничем больше: кто игроки, какие у каждого стратегии, какая выплата достаётся каждому при каждом сочетании стратегий.

Игроком называют того, кто выбирает. Не всякий участник ситуации игрок: погода влияет на выручку лавки, но ничего не выбирает. Стратегия это полное описание того, что игрок делает. У наших лавок их по две, но бывает и бесконечно много, если выбирается, скажем, цена.

Выплата остаётся самой важной и самой недопонятой частью. Число в таблице не обязано быть деньгами. Это мера того, насколько исход хорош для игрока, со всем, что игроку небезразлично, уже внутри. Если хозяину лавки важно, чтобы соседу тоже жилось неплохо, это входит в его выплату, а не остаётся снаружи как «моральное соображение поверх экономики».

Отсюда правило чтения, которое пригодится до конца модуля. Возражение «а вдруг человек думает не только о деньгах» спорит не с теорией игр. Спорит оно о том, какие числа стоят в таблице. Мы вернёмся к нему ниже, и не в качестве оговорки: на нём держится главная путаница вокруг сегодняшнего примера.

И сразу о статусе всего дальнейшего. Теория игр целиком и есть модель. Она не утверждает ничего о том, каковы выплаты у настоящих хозяев лавок и как эти хозяева поступят. Она говорит: если выплаты такие, то следует то-то. Проверять приходится отдельно и то и другое.

методТри вопроса к любой ситуации

Кто здесь выбирает? Из чего выбирает каждый? Чем для каждого кончается каждое сочетание выборов? Пока на все три нет ответа, говорить о «стратегии» рано: в обиходе слово означает намерение, а в разборе им называют строку таблицы, которая должна быть заполнена.

Строго доминируемая стратегия

Стратегия строго доминируется, если есть другая, которая даёт строго больше при каждом возможном выборе остальных игроков. Не в среднем, не обычно, а при каждом, отдельно проверенном.

Проверим на числах, для левой лавки.

Сосед держит обычную цену: распродажа даёт левой лавке 100, а обычная цена 90. Разница 10 в пользу распродажи. Сосед объявляет распродажу: распродажа даёт 60, а обычная цена 40. Разница 20 в пользу распродажи.

Оба сравнения указывают в одну сторону, значит «обычная цена» у левой лавки строго доминируется распродажей.

Теперь главное отличие этого рассуждения от всех прочих. Чтобы отбросить строго доминируемую стратегию, не нужно знать о партнёре ничего. Не нужно считать его расчётливым, не нужно ему доверять, не нужно приписывать вероятности его действиям. Оба варианта соседа уже перебраны, и в обоих ответ один. Это делает доминирование самым скромным инструментом теории игр и одновременно самым надёжным: он опирается на минимум допущений из всех, которые дальше появятся.

Оговорка про слабое доминирование. Если при одном из выборов соседа две стратегии дают ровно поровну, а при остальных одна лучше, доминирование называют слабым, и отбрасывать такую стратегию уже не столь безобидно: она может оказаться нужной, если сосед ошибается или колеблется.

Платёжная матрица двух лавокПравая лавкаобычная ценараспродажаобычная ценараспродажаЛевая лавка90 · 9040 · 100100 · 4060 · 60В паре слева прибыль левой лавки, справа правой, тысячи рублей за сезон.Внизу справа клетка, куда приходит игра. Вверху слева клетка, которуюобе лавки предпочли бы, но удержаться в ней поодиночке невыгодно.
Платёжная матрица двух лавок: у каждой «обычная цена» строго доминируется

Дилемма, доведённая до конца

Задача симметрична, поэтому у правой лавки счёт тот же: 100 против 90 и 60 против 40, оба раза в пользу распродажи. Обе лавки отбрасывают обычную цену, обе объявляют распродажу, обе получают по 60 тысяч.

Сравним с клеткой, где распродажи нет ни у кого: там у каждой 90. Разница составляет 30 тысяч на лавку, 60 тысяч на двоих. Никто этого исхода не хотел, никто не ошибся в счёте, и тем не менее обе оказались там, где хуже обеим.

Почему хорошая клетка не удерживается, видно из тех же чисел. Пусть обе держат обычную цену и получают по 90. Левой лавке достаточно объявить распродажу одной, и она получит 100 вместо 90. То же верно для правой. Клетка, лучшая для обоих, разваливается от одностороннего выигрыша в 10 тысяч.

Такое устройство таблицы и называется дилеммой заключённого. В общем виде: предательство в одиночку выгоднее взаимного согласия (100 против 90), взаимное согласие выгоднее взаимного предательства (90 против 60), взаимное предательство выгоднее, чем оказаться преданным в одиночку (60 против 40). Плюс условие, без которого нет и дилеммы: сумма при взаимном согласии больше, чем при одностороннем предательстве (180 против 140).

Обратите внимание, что здесь разобрана не «ситуация вообще», а конкретный набор из четырёх пар чисел. Поменяйте их, и выводы поменяются. Именно на это опирается следующий раздел.

Позиция реестра: это не про эгоизм

Дилемму заключённого чаще всего пересказывают так: она показывает, что люди эгоистичны и потому не могут договориться. Это прочтение неверно, и опровергается оно тем же способом, каким всё в этом уроке, то есть прямым счётом.

Допустим, хозяева друг другу не безразличны. Каждый готов расстаться с шестью тысячами собственной прибыли ради десяти тысяч прибыли соседа. Тогда его выплата это своя прибыль плюс 0,6 чужой. Пересчитаем все четыре клетки для левой лавки.

Обе держат цену: 90 + 0,6 × 90 = 144. Левая на распродаже, правая нет: 100 + 0,6 × 40 = 124. Левая держит цену, правая на распродаже: 40 + 0,6 × 100 = 100. Обе на распродаже: 60 + 0,6 × 60 = 96.

Сравниваем заново. Сосед держит цену: держать 144 против распродажи 124, держать лучше на 20. Сосед на распродаже: держать 100 против распродажи 96, держать лучше на 4. Доминирование сменило направление: теперь строго доминируется распродажа. Обе лавки держат цену, обе получают по 90 тысяч настоящей прибыли. Дилеммы нет.

Но и обратное неверно, будто достаточно капли взаимной приязни. Возьмём вес не 0,6, а 0,1. Обе держат: 90 + 9 = 99. Левая на распродаже: 100 + 4 = 104. Левая держит, правая на распродаже: 40 + 10 = 50. Обе на распродаже: 60 + 6 = 66. Если сосед держит цену, распродажа лучше на 5. Если сосед на распродаже, распродажа лучше на 16. Дилемма на месте.

Вывод из двух пересчётов один: дилемма заключённого оказывается свойством таблицы выплат, а не свойством людей. Вопрос не в том, эгоистичен человек или нет, а в том, насколько именно небезразличен ему чужой результат по сравнению с размером искушения. Это количественный вопрос, и ответ на него в каждой ситуации свой.

Дилемма действительно показывает вещь более узкую и более неприятную: индивидуально безупречные решения могут складываться в коллективно худший исход. Не из-за глупости и не из-за злого умысла, а из-за устройства выплат. Если это устройство хочется изменить, менять надо выплаты договором, законом, повторяемостью отношений, а не призывать участников быть сознательнее.

миф«Дилемма доказывает, что люди эгоистичны»

Эгоизм здесь не вывод, а входное условие: он заложен выбором чисел в таблице. Утверждение, которое доказывается, обратно по направлению. При таких-то выплатах разумность каждого приводит всех к худшему. Из вывода нельзя извлечь посылку и объявить её открытием.

Провал как предсказание, удача как язык

Всё до этого места укладывается в модель, в следствия из чисел, которые мы сами и назначили. Спрашивать, «правда ли это», бессмысленно. Спрашивать надо, что из этого проверялось и с каким результатом.

Проверялось. Мета-исследование Фридерике Менгель (The Economic Journal, 2018) сводит 96 работ по дилемме заключённого: более 3500 участников, шесть стран. Доля сотрудничества по отдельным работам колеблется от 0,04 до 0,84 при среднем около 0,35. В одноразовых играх среднее 0,37.

Первый вывод очевиден: как предсказание поведения модель провалилась. Она велит не сотрудничать никогда, а сотрудничает примерно каждый третий.

Второй вывод интереснее, и он про то, чем объясняется разброс от 4 до 84 %. Не страной, не полом и не эпохой. Лучше всего его объясняет индекс риска, который показывает, насколько много теряет тот, кто пошёл навстречу в одиночку. Оценка коэффициента при нём от −0,197 до −0,290 и устойчиво значима. Индекс соблазна, то есть выигрыш от предательства против сотрудничающего, значимого вклада в одноразовых играх не даёт вовсе.

Иначе говоря, числа в таблице действительно управляют поведением, ровно так, как утверждает устройство модели, хотя точечное предсказание модель даёт неверное. Это типичная для экономики картина, и к ней стоит привыкнуть заранее: модель бывает плоха как пророчество и хороша как язык, на котором задают вопрос данным.

И полезная привычка на будущее. Услышав «теория игр доказывает, что…», спрашивайте, что именно доказано: следствие из чисел или наблюдение о людях. Первое доказывается на бумаге и переносится куда угодно вместе с числами. Второе требует эксперимента и переносится ровно настолько, насколько похожи обстоятельства.

Куда это ведёт дальше

Доминирование решает мало игр. В нашей таблице оно сработало, потому что у каждой лавки нашёлся ответ, хороший при любом поведении соседа. В большинстве интересных задач такого ответа нет: лучшее действие зависит от чужого, и тогда нужен другой инструмент. Им будет равновесие Нэша в следующем уроке, вместе с честным разбором того, чего оно не даёт.

Третий урок модуля посвящён играм, где ходят по очереди, а не одновременно: там появляются угрозы, обещания и репутация, и выясняется, что связывать себе руки бывает выгодно.

Тренажёр к этому уроку даёт сыграть в дилемму много раз подряд против разных стратегий партнёра. Повторение меняет задачу принципиально. В двенадцатом уроке разобрано, как именно. Пока достаточно увидеть своими глазами, что при одних и тех же четырёх числах в таблице повторяемая игра ведёт себя иначе, чем однократная.

тренажёр урока 10

Повторяющаяся игра

Двадцать раундов против выбранного соперника. В каждом раунде вы либо сотрудничаете, либо предаёте. Выплаты в таблице ниже, они и определяют всё.

Открыть тренажёр

Ключевые работы

Friederike Mengel, «Risk and Temptation: A Meta-study on Prisoner's Dilemma Games», The Economic Journal 128(616)2018Сводка 96 работ, более 3500 участников: доля сотрудничества от 0,04 до 0,84 при среднем около 0,35, и разброс объясняется индексом риска, то есть числами в таблице выплат, а не характеристиками участников.

Что подтвердилось, а что нет

мифДилемма заключённого доказывает, что люди эгоистичны.

Эгоизм в этом примере не вывод, а входное условие: он задан выбором чисел. Прямой пересчёт показывает, как это работает. Если каждый готов отдать шесть тысяч своей прибыли за десять тысяч чужой, доминирование меняет направление и дилемма исчезает. При весе в одну десятую она остаётся. Значит, дилемма это свойство таблицы выплат и соотношения величин в ней, а не свойство человеческой природы. Теория игр вообще не делает утверждений о том, каковы выплаты у живых людей: это предмет измерения, а не вывода.

отвергнутоТеория предсказывает, что в одноразовой дилемме заключённого сотрудничать не будет никто.

Как описание поведения предсказание не выдержало проверки. По сводке 96 экспериментальных работ (Mengel, 2018) доля сотрудничества в одноразовых играх составляет в среднем 0,37 при разбросе по работам от 0,04 до 0,84. При этом сама модель не опровергнута целиком: разброс частот лучше всего объясняется индексом риска, то есть величиной потери сотрудничавшего в одиночку. Значит, выплаты действительно управляют поведением, но не так резко, как в предельном варианте модели.

отвергнутоЧтобы отбросить строго доминируемую стратегию, нужно предполагать, что партнёр рационален.

Не нужно. В определении строгого доминирования перебраны все возможные действия партнёра, и при каждом ответ один и тот же. Поэтому вывод не зависит ни от способностей партнёра, ни от доверия к нему, ни от вероятностей, которые ему приписывают. Допущение о разумности партнёра требуется на следующем шаге, при повторном исключении, когда игрок отбрасывает свою стратегию, потому что рассчитывает, что партнёр уже отбросил свою. Смешение этих двух шагов служит обычным источником претензий к теории игр, адресованных не туда.

выдержалоДоля сотрудничества в дилемме заключённого управляется числами в таблице выплат, а не свойствами участников.

Проверено сводкой, а не одним опытом: Mengel (2018) собрала 96 работ по дилемме заключённого, а в них более 3500 участников и шесть стран. Доля сотрудничества по отдельным работам идёт от 0,04 до 0,84 при среднем около 0,35, и объясняет этот разброс не страна, не пол и не эпоха, а индекс риска, то есть величина потери у того, кто пошёл навстречу в одиночку. Оценка коэффициента при нём от −0,197 до −0,290 и устойчиво значима. Устояло устройство модели: числа в таблице действительно управляют поведением. Точечное предсказание из той же модели не устояло и стоит в этом уроке отвергнутым, ведь сотрудничает примерно каждый третий, а не никто. Индекс соблазна значимого вклада в одноразовых играх не даёт вовсе: подтвердилась конкретная часть теории, а не «теория игр» целиком.

Термины

играgame
Ситуация, заданная тремя вещами: набором игроков, набором стратегий у каждого и выплатой каждому при каждом сочетании стратегий.
стратегияstrategy
Полное описание того, что игрок делает. В одновременной игре достаточно одного действия, в последовательной нужен план на каждый случай, где придётся ходить.
выплатаpayoff
Мера того, насколько исход хорош для игрока. Включает всё, что игроку небезразлично, а не только деньги. Величину выплат измеряют, а не выводят из теории.
платёжная матрицаpayoff matrix
Таблица, в клетках которой стоят выплаты всем игрокам при соответствующем сочетании стратегий. Полное задание игры двух игроков с конечным числом стратегий.
строго доминируемая стратегияstrictly dominated strategy
Стратегия, для которой есть другая, дающая строго больше при каждом возможном выборе остальных игроков. Отбрасывается без всяких допущений о партнёре.
доминирующая стратегияdominant strategy
Стратегия, дающая не меньше любой другой при каждом возможном выборе остальных. Если неравенство строгое, её называют строго доминирующей.
повторное исключение доминируемых стратегийiterated deletion of dominated strategies
Приём: отбросить доминируемые стратегии, затем в оставшейся игре снова, и так далее. В отличие от одного шага требует допущения, что партнёр тоже так рассуждает.
дилемма заключённогоprisoner's dilemma
Устройство выплат, при котором у каждого есть строго доминирующая стратегия, а исход, к которому она приводит, хуже для всех, чем достижимый при взаимном согласии.
Парето-улучшениеPareto improvement
Переход к исходу, при котором никому не стало хуже, а кому-то стало лучше. В дилемме заключённого такой переход существует, но ни один игрок не может совершить его в одиночку.

Практикум · Своя платёжная матрица

Задача состоит в том, чтобы научиться превращать живую ситуацию в три составные части игры и проверять доминирование счётом, а не на глаз. Работа занимает около получаса и делается на собственном материале.

  1. Вспомните ситуацию последних двух недель, где ваш результат зависел от решения ещё одного человека, а сговориться заранее было нельзя или не получилось. Годится что угодно: кто уступит на переговорах, кто первым напишет, кто возьмёт на себя общую часть работы.
  2. Выпишите двух игроков и по две стратегии у каждого. Стратегия это то, что человек делает, а не то, чего он хочет. Если стратегий получается больше двух, оставьте две самые вероятные.
  3. Заполните все четыре клетки своими выплатами по шкале от 0 до 100, оценивая, насколько хорош для вас каждый исход. Все четыре обязательно, включая те, которые кажутся невероятными: именно они решают, есть ли доминирование.
  4. Заполните те же четыре клетки за второго игрока так, как оценил бы он, а не как удобно вам. Если его чисел вы не знаете, сделайте две версии таблицы при двух разных допущениях и держите обе.
  5. Проверьте каждую свою стратегию на доминирование: сравните её с другой отдельно при каждом выборе партнёра. Запишите ответ на два вопроса: есть ли у вас доминирующая стратегия и существует ли клетка, лучшая для обоих, чем та, куда игра приходит. Если да, назовите, какое одностороннее отклонение её разрушает и на сколько.

Вопросы для самопроверки

Вопрос 1

Что означает, что стратегия строго доминируется?

  • Она даёт меньше в среднем по всем возможным действиям партнёра, взятым с равными вероятностями
  • Она даёт меньше, если партнёр действует разумно, то есть выбирает свой наилучший ответ
  • Есть другая стратегия, дающая строго больше при каждом возможном действии партнёра
  • Она приводит к худшему для обоих исходу, как взаимное признание в дилемме заключённого
Вопрос 2

В таблице лавок: если обе держат обычную цену, каждая получает 90, а односторонняя распродажа даёт 100 отступнику и 40 соседу. Почему исход «обе держат цену» не удерживается?

  • Потому что каждой в одиночку выгодно уйти на распродажу и получить 100 вместо 90
  • Потому что суммарная прибыль там меньше, чем при распродаже у обеих
  • Потому что хозяева не доверяют друг другу
  • Потому что этот исход не является Парето-улучшением
Вопрос 3

Хозяева лавок дорожат друг другом настолько, что каждый готов отдать шесть тысяч своей прибыли ради десяти тысяч прибыли соседа, то есть выплата равна своей прибыли плюс 0,6 чужой. Что происходит с задачей?

  • Ничего: доминирование определяется структурой, а не величиной выплат
  • Дилемма сохраняется, но проигрыш становится меньше: приязнь смягчает исход, не отменяя его
  • Задача перестаёт иметь решение: с оглядкой на чужую прибыль выплаты становятся неопределёнными
  • Доминирование меняет направление, и обеим выгодно держать цену
Вопрос 4

Мета-исследование 96 работ по дилемме заключённого даёт среднюю долю сотрудничества 0,37 в одноразовых играх при разбросе по работам от 0,04 до 0,84, и лучше всего этот разброс объясняется индексом риска, то есть потерей того, кто пошёл навстречу в одиночку. Какой вывод отсюда следует?

  • Что теория игр как таковая опровергнута данными
  • Что предсказание нулевого сотрудничества не подтвердилось, но зависимость поведения от чисел таблицы подтвердилась
  • Что участники экспериментов не поняли правил
  • Что в разных странах люди сотрудничают по-разному и что именно страновые различия объясняют разброс долей от 0,04 до 0,84 между работами
Вопрос 5

Читатель говорит: «Ваш разбор ничего не стоит, потому что настоящие хозяева лавок думают не только о деньгах». Что это за возражение?

  • Возражение против самого понятия доминирования
  • Возражение против того, что игроки ходят одновременно
  • Возражение не к модели, а к числам, которые в неё подставлены
  • Возражение, показывающее, что таблицу выплат составить нельзя

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Yale ECON 159 «Game Theory», Бен Полак, лекции с 1 по 3 (Open Yale Courses): Видео и полные транскрипты открыты. Лекция 1 вводит доминирование на игре со студенческими оценками, а повторное исключение разобрано в лекции 3.
  • Friederike Mengel, «Risk and Temptation: A Meta-study on Prisoner's Dilemma Games», The Economic Journal, 2018: Что именно измерено в сотнях экспериментов с дилеммой и почему разброс результатов объясняется числами выплат.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Экономика»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?