Скрытые армии
В Stratego каждый игрок получает 40 фигур, представляющих военные звания — от фельдмаршала до шпиона, плюс бомбы и флаг. Побеждает тот, кто захватит флаг противника. Соперник знает, где находятся твои фигуры, но не знает, какие они. Идентичность раскрывается только при столкновении двух фигур в боевом сражении — слабая удаляется, а тождество победителя открывается. Это делает Stratego игрой с неполной информацией, как и покер, который компьютеры взломали много лет назад. «В Stratego есть что-то очень особенное — это огромное количество скрытой информации, которая раскрывается очень медленно», — объясняет Eugene Vinitsky, исследователь из NYU и соавтор исследования.
В некоторых вариантах покера скрытая информация минимальна. В Texas Hold'em «у тебя только две скрытые карты», — рассказывает Gabriele Farina, компьютерный учёный из MIT и соавтор. Это оставляет всего 1326 возможных комбинаций — достаточно, чтобы машина могла их все взвесить. «В Stratego на доске 40 фигур, которые могут находиться в любом порядке», — продолжает Farina. Это более дециллиона возможных расстановок. И это ещё не учитывая длину игры.
«В шахматах игра обычно длится 40 ходов, а в Stratego игра может легко продлиться 2000 ходов», — отмечает Farina. Кроме того, Stratego — это игра на блеф. Иногда ты двигаешь слабую фигуру так, как если бы это был фельдмаршал, просто чтобы напугать противника. Когда игроки блефуют слишком часто, их угрозы теряют смысл; когда никогда не блефуют, становятся предсказуемы. Это балансирование, объясняет команда, и было тем, что ставило в тупик более ранние ИИ, такие как DeepNash от DeepMind, представленный в 2022 году.
Учимся угадывать
Как и DeepNash, Ataraxos учился, играя против самого себя — всего 163 миллиона партий. В этих сеансах самоигры ходы, приводящие к победам, усиливались и воспроизводились чаще в будущих матчах, а ходы, приводящие к поражениям, воспроизводились реже. Это была одна и та же простая идея обучения. Разница была в том, насколько сильно Ataraxos менял стратегию после каждой игры — скрытая информация обычно отправляет алгоритмы самообучения в замкнутый круг. Команда решила это, внося большие, смелые изменения в стратегию в начале обучения и малые, осторожные — в конце.
Ещё большее новшество — это то, чего у DeepNash никогда не было: предварительный поиск перед каждым ходом. Такие ИИ, как AlphaGo, уточняют свою общую стратегию поиском непосредственно перед ходом. DeepMind не смог добиться этого в Stratego, потому что пространство поиска было слишком велико, оставляя открытым вопрос, стоит ли вообще это пытаться.
«Это одна из вещей, которую мы действительно смогли сделать», — говорит Farina. Решением стала вторая нейронная сеть — модель веры, обученная угадывать скрытые фигуры противника на основе его ходов. Таким образом, вместо перебора всех возможных расстановок Ataraxos берёт образцы правдоподобных вариантов, проигрывает кандидатские ходы в каждом и выбирает на основе результатов.
Спокойствие и невозмутимость
Имя Ataraxos происходит от древнегреческого слова, обозначающего состояние спокойствия. «Это значит кто-то спокойный и невозмутимый», — объясняет Farina. По его мнению, структура ИИ и отсутствие человеческих эмоций гарантируют, что он не реагирует импульсивно, «даже в ситуациях, где человек потерял бы голову». Если человек может рискнуть крупной ставкой, чтобы вернуться из значительного проигрыша, Ataraxos методично и неторопливо отыгрывается.
Разработанная им стратегия также избегает привлечения внимания к любым проблемам, с которыми он сталкивается. Когда Ataraxos оценивает, что противник не имеет причин подозревать слабое место, он оставляет это место в покое, даже если для того, кто видит оба борта доски, это может выглядеть как неминуемая катастрофа.
«Для людей очень сложно, когда вы знаете секрет, принимать решения, игнорируя тот факт, что вы это знаете», — рассказывает Farina. «Для машин это легко». Это, по мнению команды, приводит к тому, что машины делают ходы, которые человек предпринял бы только при блефе, и намного лучше их реализуют. «Мы наблюдали, как бот "блефит" свой путь назад из примерно двухпроцентной вероятности победы, очень, очень спокойно», — добавляет Vinitsky.
Niemeijer, противник-человек, против которого Ataraxos выполнил эти чудесные возвраты, имеет четыре мировых чемпионата и более 600 недель звания топ-рейтингового игрока мира.
Матч
Три недели Niemeijer играл против Ataraxos в 20 онлайн-партиях, зарабатывая по $100 за каждую победу. Он знал, что ИИ не будет адаптироваться к нему, что давало ему время для поиска слабостей. Он выиграл всего один раз.
По утверждению исследователей, то поражение не было реальным недостатком. Хорошо играть в Stratego — значит рандомизировать расстановку фигур, так что везение всегда играет роль. «Даже идеальная стратегия иногда просто проигрывает», — говорит Farina.
Человеческий чемпион, видимо, был удачлив, но везение было взаимным. «Иногда нам везло», — признаёт Vinitsky.
На чемпионате мира по Stratego 2025 года участники, бросившие вызов Ataraxos, показали ещё хуже. ИИ выиграл 38 из 40 партий. В процессе он также изменил то, как люди играют. «Думаю, этот бот немного сдвинул метагейм», — говорит Farina.
Игроки были удивлены, например, тем, как часто он прячет флаг в углу позади всего двух бомб — редко используемая расстановка.
Цена вопроса
DeepNash обучался два-три месяца на 1024 специализированных чипах Google, обучение которых команда Ataraxos оценивает в $3–4,5 млн по ценам 2025 года. Ataraxos, напротив, требовал 16 GPU неделю, плюс ещё 4 GPU четыре дня для обучения модели веры.
Farina и ведущий автор Samuel Sokota добились этой эффективности, написав симулятор, который работает с миллионами ходов в секунду на графических процессорах. «В масштабе, в котором мы работаем в академии, у нас нет доступа к целому полю GPU», — рассказывает Farina.
Алгоритм также учился намного быстрее — он сыграл примерно в 34 раза меньше игр, чем DeepNash, но всё равно оказался намного сильнее.
Архитектура Ataraxos также хорошо зарекомендовала себя при обучении другим играм. Тот же подход победил трёх чемпионов мира в Barrage Stratego, быстром восьмифигурном варианте Stratego, освоил кооперативную карточную игру Hanabi и победил лучших ботов в китайской карточной игре dou dizhu. Но команда нацелена на сценарии, намного более сложные, чем настольные или карточные игры.
За пределами доски
Настольные игры имеют фиксированные правила и чётких победителей, тогда как реальные проблемы — переговоры, финансовые рынки или военные конфликты — обычно нет. Но команда Ataraxos утверждает, что разрыв меньше, чем кажется, потому что работа с любой реальной проблемой начинается с построения упрощённой модели.
«Военные игры — это распространённое дело», — говорит Vinitsky. «Вы можете использовать методы, полученные здесь, чтобы разыграть сценарий и увидеть, как сильный противник может ответить на ваши действия».
Farina и его коллеги теперь заинтересованы в том, чтобы сделать свой ИИ более понятным, поскольку Ataraxos в его нынешнем состоянии не может объяснить, почему он делает те или иные ходы. «Мы работаем над машинами, которые создают сильные, но также интерпретируемые и объяснимые стратегии. Думаю, мы ещё не совсем там», — заключает Farina.
Nature, 2026. DOI: 10.1038/s41586-026-11036-y