Ключевые выводы

  • Ни одна из моделей не играла выше уровня новичка.
  • Codex Astra — безусловный лидер, последовательно побеждающий всех остальных.
  • Grok-модели ещё недостаточно умны для игры в Brood War.
  • Старые модели часто играли RTS как пошаговую игру, что приводило к разгрому в процессе размышления. Новые модели иногда попадали в тот же капкан, но в целом лучше понимали стоимость времени на обдумывание.

При поддержке Freestyle

Таблица лидеров

Место Система Побед Поражений APM Стоимость/игра Процент побед
🥇 Codex Astra / xhigh 18 0 12.6 $10.54 100.0%
🥈 Codex Astra / medium 16 2 17.2 $15.11 88.9%
🥉 Claude Fable 15 3 12.6 $12.24 83.3%
4 Codex Astra / low 14 4 25.7 $21.07 77.8%
5 Codex 5.6 Sol / medium 13 5 10.1 $5.12 72.2%
6 Codex 5.6 Sol / low 12 6 18.1 $9.23 66.7%
7 Claude Opus 5 12 6 10.5 $20.78 66.7%
8 Codex 5.6 Sol / xhigh 11 7 8.0 $3.23 61.1%
9 Codex 5.6 Luna / low 9 9 23.8 $0.42 50.0%
10 Codex 5.6 Terra / xhigh 9 9 15.8 $2.10 50.0%
11 Codex 5.6 Terra / medium 8 10 10.5 $3.15 44.4%
12 Codex 5.6 Terra / low 8 10 48.3 $4.65 44.4%
13 Codex 5.6 Luna / xhigh 7 11 5.2 $0.16 38.9%
14 Claude Sonnet 7 11 6.2 $8.98 38.9%
15 Codex 5.6 Luna / medium 6 12 14.8 $0.30 33.3%
16 Grok 4.6 / xhigh 2 15 2.8 $0.66 11.1%
17 Grok 4.6 / medium 1 16 3.2 $0.79 5.6%
18 Claude Haiku 0 16 0.3 $0.34 0.0%
19 Grok 4.6 / low 0 16 4.2 $1.26 0.0%

Brood War Bench родился из эксперимента: было создано издание Brood War, в которое можно было играть только через агентов. Друзья автора, почти не игравшие в StarCraft, сыграли неожиданно хорошо. Когда он спросил почему, они ответили, что особо ничего не делали — просто попросили агента атаковать, а тот построил армию и выполнил атаку. Это привело к вопросу: насколько далеко смогут зайти модели сами по себе.

Что наблюдалось

Codex нашла приём раньше, чем развитие экономики

Самая сильная тактика Codex — это дезорганизация противника. В играх за Протоссов модель часто отправляла Зонда на другой конец карты атаковать рабочих или здания. Это работало неожиданно хорошо: противники тратили десятки секунд на размышления, вместо того чтобы что-то делать.

А вот постоянное производство было намного слабже. Модель откладывала улучшения, тонким потоком отправляла единицы в защищённые базы, отправляла рабочих в последние стойки.

Заметно было, что Codex часто создавала отдельные под-агенты для управления экономикой, производством армии и боевым контролем. Они мало взаимодействовали друг с другом, поэтому боевой агент часто отправлял каждый новый юнит прямо в атаку, не зная о больших силах, которые другие агенты готовили.

Это классическая ошибка новичка: отправлять юниты по одному вместо того, чтобы ждать критической массы и спланированного момента атаки. В играх, где автор помогал направлять Codex, она была намного лучше на планирование и заставляла под-агентов работать вместе.

Упорство было реальным. В игре G009, после потери армии и основной базы, Codex 5.6 Terra / medium поднял последний Command Center в воздух и переместил его на противоположный угол карты. Модель выжила ещё шесть минут.

Grok потратила игру на размышления

Grok 4.6 часто производила длинные цепочки рассуждений и очень мало боевых команд. В игре G043 конфигурация xhigh произвела 11 138 токенов рассуждения, но выдала только шесть групп команд за 43 минуты и так и не построила ни одного боевого юнита.

Действия, которые модель всё же предпринимала, редко развивались в рабочий цикл управления. В игре G003 Grok / xhigh создала трёх Морпехов и никогда не добралась до базы противника. В игре G002 Grok / medium создала двух Зелотов и тоже не пересекла карту. Это выглядело не как плохая стратегия, а как отказ продолжать наблюдать и действовать.

Fable честно пыталась играть

Автор ловил себя на том, что болел за Claude Fable в нескольких играх. Fable обычно старалась построить экономику и подняться по дереву технологий, вместо того чтобы остановиться на первом доступном юните. Она казалась более заинтересованной в самой игре, чем другие модели.

В игре G007 она дошла до Логова, Шпиля и Мутальисков и выиграла. В игре G027 построила Робо-объект, Цитадель Адуна, Обсерваторию и Архивы Тамплиеров перед победой. Амбиция не гарантировала выполнение: в игре G036 Fable дошла до Фабрики и Академии, но Opus 5 её раздавила.

Ни один агент не играл выше новичка

Даже Astra и Fable не смогли построить сложные армии, защитить от простых атак или реализовать конкретные стратегии. Новичок, который знает «фотонный рейд», выиграл бы у всех этих агентов в каждой игре.

Но смотреть, как агенты играют, вызывало больше возбуждения, чем раньше. Этот бенчмарк далеко не исчерпан. Агентам есть чему учиться, и бенчмарку есть чего попросить. Не терпится смотреть, как они будут совершенствоваться.

Как развивались игры

Технологические инвестиции: завершённые исследования и уровни улучшений

  • Codex Astra: 0.3
  • Claude Fable: 0.2
  • Grok 4.6: 0

Рабочие: завершённые рабочие в живых

  • Codex Astra: 14.7
  • Claude Fable: 16.7
  • Grok 4.6: 7.4

Размер армии: завершённые армейские и поддерживающие юниты

  • Codex Astra: 8.3
  • Claude Fable: 7.6
  • Grok 4.6: 2

Сооружения: завершённые здания, включая дополнения

  • Codex Astra: 6.2
  • Claude Fable: 7.4
  • Grok 4.6: 4.5

Минералы в банке: неиспользованные минералы, не доход

  • Codex Astra: 240.6
  • Claude Fable: 248.6
  • Grok 4.6: 536.6

Газ в банке: неиспользованный газ, не доход

  • Codex Astra: 151
  • Claude Fable: 326.9
  • Grok 4.6: 244.5

Использованное снабжение: включает производство в процессе

  • Codex Astra: 26.5
  • Claude Fable: 26.6
  • Grok 4.6: 11.3

Временные графики показывают средние значения записанных прогонов игроков в каждый момент времени. Завершённые игры исключены; отсутствующие образцы не заполняются. Модели объединяют настройки усилия. Единицы и здания считаются только после завершения; армия исключает рабочих, Оверлордов, яйца, личинок и боеприпасы.

Процент побед против стоимости

Средняя стоимость за игру с использованием тех же цен, что и в таблице лидеров. Стоимости Codex и Sonnet — оценки на основе токенов.

Как работал бенчмарк

Была построена круговая матрица конфигураций моделей и усилия, и каждая конфигурация играла с каждой другой. Тестовая среда запускала эти матчи параллельно на виртуальных машинах Freestyle, сохраняя данные игрового движка и логи обеих сторон для каждого матча.

Матрица «один на один»

Читайте строку. W — победа, L — поражение, T — матч, достигший временного лимита бенчмарка.