ARC-AGI-3
ARC-AGI-3 — бенчмарк для изучения агентного интеллекта через новые, абстрактные, пошаговые окружения. Агентам приходится исследовать пространство, выводить цели и строить внутренние модели окружений, чтобы эффективно планировать действия без явных инструкций. Попробовать ARC-AGI-3 можно самостоятельно на сайте организаторов.
Эти окружения содержат только базовые «предзнания» (core knowledge priors) и откалиброваны по сложности через контролируемое тестирование с участием людей. Люди решают 100% таких окружений.
Цель серии ARC-AGI — измерить «остаточный разрыв» между текущим искусственным интеллектом и AGI. AGI определяется как способность системы освоить любой навык, доступный человеку, так же эффективно, как это делает человек.
ARC-AGI-3 — третье поколение серии бенчмарков ARC-AGI. Оно тестирует агентные способности за пределами возможностей ARC-AGI-1 и ARC-AGI-2. Каждое следующее поколение расширяет предыдущее — по мере роста возможностей передовых ИИ-моделей бенчмарки должны развиваться вместе с ними.
ARC-AGI-3 проверяет четыре компонента агентного интеллекта:
- Исследование: в реальных условиях информация редко предоставляется пассивно. Агентам приходится добывать её самостоятельно, взаимодействуя с окружением.
- Моделирование: агентам нужно превращать сырые наблюдения в обобщаемую модель, способную предсказывать будущие состояния и результаты.
- Постановка целей: агентам приходится определять целевые будущие состояния при скудном вознаграждении.
- Планирование и исполнение: агентам нужно проложить путь от текущего состояния к цели, корректируя курс по мере поступления новой информации.
Результаты Astra

В стандартном режиме тестирования (Standard harness), который позволяет модели переносить с собой заметки по своему выбору на протяжении всего окружения, Astra (max) от OpenAI набирает 62,7% на ARC-AGI-3 Semi-Private за $26 тыс. В режиме Provider Adapter, который сохраняет непрозрачное состояние рассуждений между запросами и использует сжатие для более длинных диалогов, позволяя модели повторно использовать проделанную работу, Astra (high) набирает 99,9% за $19 тыс. Оба результата — рекордные для бенчмарка.
| Уровень рассуждений | Standard harness | Provider Adapter harness |
|---|---|---|
| max | 62,7%, $26 098 | 98,6%, $17 332 |
| xhigh | 59,3%, $37 317 | 98,4%, $18 147 |
| high | 54,8%, $40 705 | 99,9%, $18 817 |
| medium | 38,6%, $48 090 | 98,4%, $19 285 |
| low | 17,5%, $38 166 | 98,0%, $21 298 |
| none | 35,2%, $49 791 | 96,7%, $23 457 |
Для сравнения расходов: в ходе контролируемого тестирования людям платили $115 за 90-минутную сессию плюс $5 за каждую пройденную игру. Участники в среднем пытались пройти около девяти игр за сессию, что составляет примерно $12,78 за попытку прохождения игры без учёта бонусов.
Большая часть этой оплаты покрывает время участника и его готовность проходить тест, а не энергию, затраченную мозгом (что было бы более близким аналогом для сравнения с ИИ). Если учитывать только энергию мозга и оценивать её по цене электричества, оценка падает примерно до 0,6 цента за сессию, или 0,067 цента за попытку прохождения игры.
Анализ
Помимо самих оценок, записи прохождения Astra показывают, как модель превращает незнакомые игровые механики в рабочие модели. Выделяются три наблюдения: компактная алгебраическая нотация, которую она разрабатывает, эффективность действий в сравнении с людьми и собственные инструменты, которые она создаёт.
Собственная алгебраическая нотация
При прохождении ARC-AGI-3 Astra сама выбирает, какие стратегические заметки переносить с собой дальше. Модель отслеживала объекты, координаты, правила и незавершённые планы, используя при этом собственную нотацию предметно-ориентированного языка, сгенерированную для конкретных окружений.
Похожее поведение наблюдалось и у других моделей, но заметки Astra выделялись точностью и информационной плотностью. Модель сжимала сцену в компактную кодоподобную символьную модель: где находятся объекты, как они взаимодействуют и в каком порядке нужно выполнить действия. Это скорее алгебраическая стенография на лету, чем полноценный язык программирования. Например:
- Состояние игры: запись вида
L8: hub q2 (8↓). Lengths: 14=1…фиксирует уровень, локальный индекс поворота и длины механизмов. - Многошаговые планы: запись
extend8 to3; retract10 to2; shorten8 to1фиксирует упорядоченную последовательность изменений для механизмов цвета 8 и цвета 10. - Управление и координаты: запись
9−=(39,4), rotate=(49,18), 14+=(59,11)сопоставляет операции с координатами элементов управления, которые их выполняют. - Время и позиция: запись
Turn 5: P=(24,20), empty, facing westобъединяет счётчик ходов с местоположением игрока, переносимым состоянием и ориентацией.

s5i5, используя собственную алгебраическую стенографию на лету для отслеживания состояния и планирования действий.Эффективность действий в сравнении с людьми
Перед запуском ARC-AGI-3 около 500 представителей широкой публики протестировали для установления человеческого базового уровня эффективности действий — иначе говоря, насколько быстро люди решали каждое окружение. Участники не отбирались по опыту или способности решать головоломки.
Для каждого уровня «человеческий базовый уровень» определялся через медианное число действий среди игроков, прошедших его. Это даёт точку отсчёта для сравнения производительности человека и ИИ. ИИ, которому требуется больше действий, менее эффективен в действиях, а тому, кому требуется меньше — более эффективен.
В режиме Provider Adapter Astra (max) использовала меньше действий, чем человеческий базовый уровень, на 96,0% уровней, и в среднем на 51,7% меньше действий на уровень. Это значимая веха: по метрике эффективности действий ARC-AGI-3 Astra сравнялась с человеком и превзошла его.
Любопытно, что до запуска ARC-AGI-3 предполагалось, что эффективность действий останется разделительной линией между людьми и ИИ. Ожидалось, что даже когда ИИ решает окружение, ему может потребоваться существенно больше исследования (действий), чем человеку. Это по-прежнему верно для подходов методом грубой силы, но передовые модели демонстрируют более бинарную картину. Как только передовой ИИ «понимает» механику, он, как правило, действует в пределах человеческой эффективности.
Эффективность действий Astra в сравнении с людьми

Каждая точка представляет один уровень, пройденный Astra (max). Точки ниже сплошной линии означают меньшее число действий, чем человеческий базовый уровень.
График выше сравнивает число действий, потребовавшихся Astra для прохождения каждого уровня, с человеческим базовым уровнем. Это подтверждает, зачем ARC-AGI-3 измеряет эффективность действий, а не только сам факт прохождения. Оценка только по факту прохождения показала бы, что Astra завершила окружение, но не то, насколько эффективно она научилась его решать.
Большинство бенчмарков измеряют только эффективность по затратам — вычислительные ресурсы, но эффективность по действиям измеряет, сколько опыта взаимодействия с окружением потребовалось.
Результаты Astra показывают, что ей потребовалось меньше взаимодействий, чем человеческому базовому уровню, для выполнения решения.
Собственные инструменты в агентной среде
Astra также оценивалась в среде PRO-LONG — раннем партнёре по red-teaming для ARC-AGI-3. В этой продвинутой конфигурации у Astra был доступ к песочнице, где она могла выполнять произвольный код. Попыток вырваться из песочницы не наблюдалось.
Astra создавала собственный набор инструментов для каждой игры: парсеры игрового поля, модели состояния игры, поисковые алгоритмы, планировщики и постоянные заметки. В более сложных прогонах Astra даже создавала небольшие программные библиотеки под конкретную игру.
Например, в игре tu93 — лабиринтоподобной игре с охранниками и движущимися патрулями — Astra начала с навигации и написала maze_solver.py. Затем добавила правила боя в combat_solver.py, смоделировала движущиеся патрули в patrol_solver.py и использовала sync_state.py для сверки предсказаний с наблюдениями.
Изучение результатов Astra в PRO-LONG полезно, поскольку показывает, на что модель способна с внешними инструментами. Однако это иные условия оценки по сравнению с контролируемым тестированием людей: у участников не было интерпретатора кода, блокнота для заметок и тому подобного, поэтому результаты PRO-LONG стоит воспринимать как совокупную производительность модели и её инструментов.

tu93 в среде PRO-LONG.Два режима тестирования, два вопроса
Стандартный режим тестирования ARC-AGI-3 отвечает на вопрос, как модели сравниваются при одинаковом минимальном, нейтральном к провайдеру интерфейсе. Он предоставляет всю информацию, необходимую для решения каждой игры, но оставляет за моделью решение о том, что сохранять в видимых заметках. Считается, что будущий AGI должен уметь решать ARC-AGI-3 именно в таких условиях. Общий интерфейс также даёт возможность честного сравнения между разными провайдерами.
Есть и другой вопрос: насколько хорошо модель работает, если ей доступны средства управления контекстом, разработанные конкретным провайдером специально для неё? Для Astra это означает сохранение непрозрачного состояния рассуждений (которое не видно наблюдателю) между запросами и использование сжатия для более длинных диалогов.
В режиме Provider Adapter лучший наблюдаемый результат Astra на ARC-AGI-3 Semi-Private вырос с 62,7% до 99,9%. Если смотреть по всем наборам Public и Semi-Private и всем уровням рассуждений, прогоны в режиме Provider Adapter были примерно в 3,66 раза быстрее по суммарному зафиксированному времени и использовали на 49% меньше токенов в целом по 167 парам «игра — уровень рассуждений», решённым в обоих режимах.
В дальнейшем на таблице лидеров ARC-AGI будут указываться результаты как для Standard, так и для Provider Adapter режимов, с чёткой пометкой условий оценки. Оба подхода описаны в открытом репозитории для тестирования и в документе с политикой тестирования.
Серия ARC-AGI
ARC-AGI-3 остаётся полезной площадкой для исследователей и агентов, где можно исследовать незнакомые окружения, открывать правила и учиться через взаимодействие. Результаты Astra — важная веха, достойная внимания. Astra представляет собой заметный скачок в возможностях передовых моделей.
При запуске ARC-AGI-3 было прямо заявлено, что насыщение бенчмарка не будет означать «доказательство достижения AGI». Поэтому, хотя результаты Astra представляют собой значимый прогресс в направлении обобщения, они не являются заявлением о достижении AGI.
Серия бенчмарков ARC-AGI создана так, чтобы развиваться вместе с передовым ИИ. Это создаёт петлю обратной связи между новыми исследовательскими вопросами и прогрессом в возможностях ИИ. ARC-AGI-3 стал первым интерактивным бенчмарком, требующим от ИИ эффективно синтезировать причинно-следственные модели мира и достигать целей без явных инструкций. Astra преодолевает эту планку. При этом ARC-AGI-3 имеет строго ограниченный масштаб и формат, а его окружения обладают детерминированной, замкнутой механикой и целями — бенчмарк не отражает сложность и открытость реального мира.
Сейчас идёт работа над вопросами, которые должны определить следующее поколение бенчмарков, включая то, как оценивать рекурсивное самосовершенствование и открытые инновации. Прогресс Astra помогает прояснить, какие возможности ИИ пока недостижимы, а какие вопросы остаются открытыми.