AI И НЕЙРОСЕТИ

ИИ Ataraxos обыграл сильнейшего игрока в Stratego

15 побед против 1: Ataraxos обыграл Пима Нимейера в Stratego и показал, как ИИ работает с длинной скрытой информацией.

✍️ Редакция iTech News | 02.10.2026 | ⏱ 4 мин | Источник: Ars Technica
💡

ИИ для Stratego наконец прошел рубеж, который долго оставался неприятной занозой для исследователей: система Ataraxos обыграла Пима Нимейера, одного из сильнейших игроков в истории Stratego, со счетом 15 побед, 1 поражение и 4 ничьи. Для IT-аудитории здесь важен не сам факт победы машины в настолке, а метод: модель научили принимать решения при огромном объеме скрытой информации, не сжигая на это промышленный бюджет.

Ataraxos разработали исследователи из Carnegie Mellon University, MIT, New York University и Stanford University, сообщает Ars Technica. Система использовала 16 GPU и, по описанию авторов, обошлась в несколько тысяч долларов на обучение. На фоне проектов, где успех часто измеряется числом ускорителей и терпением финансового директора, это звучит почти вызывающе скромно.

Stratego выглядит простой военной настольной игрой: у каждого игрока по 40 фигур, среди них ранги, бомбы и флаг. Побеждает тот, кто захватывает флаг соперника. Проблема для ИИ в том, что противник видит позиции фигур, но не знает их идентичность. Кто перед ним - маршал, разведчик, бомба или приманка - выясняется только при столкновении. В шахматах все фигуры открыты. В покере скрытой информации немного: например, в техасском холдеме у игрока две закрытые карты. В Stratego скрыта почти вся армия, и эта неопределенность тянется десятки и сотни ходов.

Именно поэтому Stratego долго оставалась неудобной задачей для ИИ. Deep Blue обыграл Гарри Каспарова в шахматы еще в 1997 году, AlphaGo победил Ли Седоля в го в 2016-м, покерные боты давно научились давить профессионалов. Но игры с большой, долгоживущей и стратегически важной скрытой информацией плохо укладывались в привычные схемы. Предыдущая система DeepMind, DeepNash, показывала сильный уровень, но не стала машиной, которая надежно обыгрывает лучших людей.

Ключевой ход Ataraxos - не одна большая нейросеть, которая героически угадывает все подряд, а связка из стратегической модели и отдельной belief-модели. Первая учится играть через self-play reinforcement learning, то есть многократно играет сама с собой и вырабатывает базовую стратегию. Вторая оценивает, какие именно скрытые фигуры могут стоять у соперника, судя по их движению и истории партии. Это не магия чтения мыслей, а вероятностная модель: вместо перебора всех возможных миров система выбирает правдоподобные варианты и проверяет ходы уже на них.

Важная деталь - Ataraxos не просто исполняет заранее выученный план. Перед ходом система использует decision-time planning: уточняет оценку конкретной позиции, прогоняет возможные продолжения и выбирает действие. Для игр с полной информацией такой подход давно стал нормой, но в Stratego он упирался в слишком большое пространство вариантов. Belief-модель сузила это пространство до размеров, с которыми можно работать.

Матч с Нимейером длился три недели и состоял из 20 онлайн-партий. Человек знал, что система не будет специально адаптироваться под него по ходу серии, так что у него была возможность искать слабые места. Нашел только одну победу. Исследователи не называют это доказательством уязвимости: в Stratego даже идеальная стратегия иногда проигрывает из-за начальной расстановки и вероятностной природы игры. Звучит как удобная отговорка, но в играх со скрытой информацией это обычная математика, а не послематчевый пиар.

На чемпионате мира по Stratego 2025 года результаты тоже были жесткими: против сильных игроков Ataraxos показал счет 38 побед в 40 партиях, а по данным MIT News - 39 побед при 2 поражениях против топовых людей в рамках чемпионского тестирования. Разница в формулировках, похоже, связана с тем, какие именно серии включать в подсчет, но общий вывод не меняется: система играла не на уровне хорошего бота, а выше человеческой элиты.

Любопытнее всего, что Ataraxos не просто выигрывал, а менял представления игроков о нормальной стратегии. Например, бот часто прятал флаг в углу всего за двумя бомбами - расстановка, которую люди использовали редко. Это знакомый эффект сильных игровых ИИ: они не обязаны объяснять, почему привычная человеческая эвристика переоценена. Они просто стабильно наказывают за нее, пока мета не перестроится.

Для разработчиков и продуктовых команд история важна не из-за Stratego как таковой. Реальные задачи бизнеса почти всегда похожи на игры с неполной информацией: переговоры, кибербезопасность, финансовые рынки, логистика, конкурентная разведка, найм. Участники видят часть сигналов, часть намеренно скрыта, часть искажена. Подход Ataraxos показывает, что практичный ИИ для Stratego и похожих задач может строиться не только через лобовое масштабирование, но и через архитектуру, где отдельная модель оценивает скрытое состояние мира.

Есть и трезвое ограничение. Настольная игра имеет четкие правила, фиксированное поле и понятный критерий победы. Бизнес-переговоры или расследование инцидента в SOC устроены грязнее: правила меняются, участники врут, данные неполные, а цена ошибки выше проигранной партии. Поэтому переносить Ataraxos в реальный контур управления без интерпретируемости и аудита решений было бы слишком бодро даже для индустрии, которая любит бодрость.

Следующий вопрос уже не в том, смогут ли модели играть при скрытой информации. Смогут. Вопрос в другом: научимся ли мы превращать такие системы из черного ящика для победы в инструмент, который объясняет свои ставки, показывает допущения и дает человеку достаточно причин, чтобы согласиться с машиной или вовремя сказать ей нет.

Поделиться: Telegram X LinkedIn