АНАЛИТИКА

Случайные награды меняют классическую теорию игр

Модель 2026 года показала: даже слабый шум в наградах меняет стратегии в дилемме заключённого, chicken и камень-ножницы-бумага.

✍️ Редакция iTech News | 12.09.2026 | ⏱ 4 мин | Источник: Ars Technica
📋

Теория игр получила полезную поправку к реальности: если награды в классических моделях случайно меняются от раунда к раунду, устойчивые стратегии могут стать совсем другими. Для IT-команд, которые строят экономические симуляции, аукционы, маркетплейсы, игровые механики и модели поведения пользователей, это неприятное напоминание: «идеальная» стратегия в статичной среде часто ломается от небольшого шума.

Исследователи построили математическую модель для нескольких известных игровых сценариев с эволюцией стратегий и случайно меняющимися выплатами, сообщает Ars Technica. Работа опубликована в Physical Review Letters в 2026 году; в источнике указан DOI: 10.1103/3yby-qq2n. Главный результат простой и довольно едкий: даже малые колебания награды способны породить новые устойчивые состояния там, где классическая модель видела один предсказуемый финал.

Базовый пример — дилемма заключённого. В привычной версии два игрока выбирают между сотрудничеством и предательством, а выплаты за каждый исход фиксированы. При определённых настройках игра быстро сходится к мрачному равновесию: все предают всех, и коллективный результат оказывается хуже, чем мог бы быть при сотрудничестве. Новая модель добавляет то, чего в жизни обычно слишком много: внешние обстоятельства, которые игроки не контролируют. Награда за тот же самый выбор в разных раундах немного меняется.

И этого хватает, чтобы картина изменилась. В статичной дилемме заключённого модель имеет одну устойчивую точку, где доминирует стратегия предательства. При небольшом шуме появляется вторая устойчивая точка: в популяции могут сосуществовать и кооператоры, и те, кто выбирает предательство. При более сильных колебаниях прежняя точка, где побеждают предатели, становится неустойчивой, и в модели остаются только кооператоры. Для классического учебного примера это почти дерзость: сотрудничество перестаёт быть наивной ошибкой не из-за морали, а из-за математики среды.

В игре chicken, где два участника движутся навстречу друг другу и решают, кто первым свернёт, шум даёт менее уютный результат. Без вариативности выплат устойчивым оказывается сценарий, где все сворачивают и выживают. Стоит добавить небольшое случайное изменение наград, и появляется популяция игроков, которые не сворачивают. При ещё большем шуме система становится бистабильной: она может переключаться между безопасным поведением и катастрофическим столкновением. Для тех, кто проектирует механики конкуренции, лимиты риска или автоматические стратегии торгов, это хороший повод не путать «равновесие в модели» с «безопасностью в продакшене».

Третий пример — камень, ножницы, бумага. В классической версии стратегия не замирает в одной точке: игроки циклически переходят между вариантами. Если выплаты начинают случайно меняться, появляются новые устойчивые и неустойчивые состояния. В некоторых режимах система быстрее приходит к циклическому поведению, в других возникают предельные циклы. Особенно интересно, что такие циклы появляются при неравных выплатах: например, если победа камня над ножницами даёт больше, чем победа бумаги над камнем. Тогда доли игроков, выбирающих камень, ножницы или бумагу, начинают меняться предсказуемо и устойчиво во времени.

Практический вывод не в том, что старые модели бесполезны. Они полезны как лабораторные стенды: убирают лишнее и показывают механику выбора. Но новая работа подчёркивает ограничение, о котором в продуктовой аналитике и экономическом моделировании часто вспоминают слишком поздно. Пользователь, продавец на маркетплейсе, разработчик в open source, участник рекламного аукциона или команда в корпоративной политике не играют на неподвижной доске. Меняются цены, санкции, бонусы, дедлайны, репутационные риски, доступность ресурсов и поведение внешних игроков.

Для русскоязычной IT-аудитории здесь есть вполне прикладной урок. Если команда моделирует стимулы — от реферальной программы до распределения задач между подрядчиками, — одной таблицы фиксированных выплат мало. Нужны сценарии с шумом, стресс-тесты и чувствительность к изменению параметров. Иначе можно получить красивую модель, которая уверенно советует стратегию, работающую только в вакууме, где никто не меняет правила, рынок не проседает, серверы не падают, а конкуренты ведут себя как аккуратные персонажи из учебника.

Теория игр давно помогает объяснять, почему рациональные участники приходят к не лучшим коллективным результатам. Новая модель добавляет к этому более реалистичную мысль: иногда исход меняет не характер игроков, а дрожание самой системы вознаграждений. Следующий вопрос для бизнеса и разработчиков уже не философский, а инженерный: сколько случайности нужно заложить в симуляцию, чтобы она перестала быть школьной задачей и начала напоминать рынок, команду или живой продукт.

Поделиться: Telegram X LinkedIn