Выпуск Artificial Analysis Intelligence Index v4.2

Artificial Analysis ускоряет разработку версии v5, выпустив промежуточное обновление индекса. Index v4.2 содержит более сложные и реалистичные задачи, а также расширенный набор приватных тестовых данных для предотвращения оптимизации под метрики.

Что изменилось в Index v4.2

+ AA-Briefcase — внутренняя оценка агентских способностей с приватным набором задач.

+ GDP.pdf от Surge — тестирование рассуждений на документах длиной 4592 страницы.

− GPQA Diamond — оценка научных рассуждений, которая исчерпана и не различает современные модели.

Также увеличена доля приватных тестовых наборов при расчёте итогового рейтинга и улучшена инфраструктура оценки для повышения надёжности.

Обновление приближает индекс к реальным сценариям использования с более сложными и разнообразными задачами, а приватные тесты препятствуют оптимизации под известные бенчмарки. Элементы версии v5 разрабатывались на протяжении восьми месяцев со времени запуска v4 в январе. Разработчики сознательно отложили обновления, чтобы сохранить стабильность индекса во время выходов крупных моделей. Однако с быстрым движением границы возможностей в последние недели они решили выпустить срочное обновление.

Команда продолжает работу над v5. В ближайшее время планируются дополнительные промежуточные релизы.

Детали изменений Index v4.2

➤ AA-Briefcase — это внутренняя оценка с приватным набором тестовых задач. Оценивает модели на реалистичных задачах агентского анализа и работы с информацией в сложных проектах, созданных экспертами отрасли. Модели тестируются на многонедельных проектах аналитической работы с множеством связанных задач и тысячами входных файлов. Система использует рубрику и парные сравнения для оценки успешности задач, качества анализа и представления результатов, давая полное представление об агентских способностях модели в работе с информацией.

➤ GDP.pdf создана компанией Surge AI и оценивает профессиональное рассуждение над документами в одного оборота. Тест включает 100 PDF-документов из десяти различных областей. Модели должны синтезировать информацию, распределённую по 4592 страницам, включая текст, таблицы, диаграммы, сноски и исключения. Ответы оцениваются по 1275 критериям, созданным экспертами; итоговая метрика требует полного соответствия всем критериям для успеха.

➤ Взвешивание для измерения реальной полезности — 40% весов индекса теперь приходятся на приватные, скрытые набор данных (вдвое больше, чем в v4.1). Это включает AA-Briefcase, AA-Omniscience и задачи CritPt. Такой подход затрудняет оптимизацию результатов под известные тесты. В v5 доля приватных данных будет ещё выше.

➤ Улучшения в инфраструктуре оценки — для AA-LCR v1.1 добавлена системная инструкция для оценки и исправлены ошибки в ключах ответов. Для GDP.pdf v2 и AA-Briefcase переанкорена шкала Elo для большей стабильности при добавлении новых моделей. Для SciCode улучшена надёжность песочницы для оценки, чтобы медленный, но корректный код не считался ошибкой.

Ключевые результаты

➤ Лидируют Anthropic и OpenAI — Claude Fable 5.1 от Anthropic занимает первое место, за ней следует GPT-6 Astra от OpenAI с приростом в 4 балла над GPT-5.6 Sol. Meta занимает третье место, далее SpaceXAI, Moonshot/Kimi, Z.AI и Google.

➤ Граница эффективности затрат — Anthropic, OpenAI, Meta и Z.AI поделили фронтир по соотношению стоимости к производительности.

➤ GPT-6 Astra лидирует по экономии токенов — модель более эффективна по выходным токенам, чем почти все конкуренты на границе возможностей. Claude Fable 5.1, Grok 4.5 и Gemini 3.5 Flash-Lite находятся на концах кривой (исключены модели ниже 25 баллов в индексе).

Граница по эффективности выходных токенов

Результаты AA-Briefcase

Claude Fable 5.1 и Opus 5 от Anthropic лидируют в AA-Briefcase, за ними следуют GPT-6 Astra и Muse Spark 1.3. GPT-6 Astra показывает значительный прирост примерно в 85 баллов Elo над GPT-5.6 Sol.

Результаты GDP.pdf

OpenAI лидирует в GDP.pdf: GPT-6 Astra показал 33.2%, GPT-5.6 Sol — 28.2%, Claude Fable 5.1 — 26.2%.

Граница стоимость-производительность

Подробные результаты по моделям

Дополнительная таблица результатов

Подробнее об Artificial Analysis Intelligence Index v4.2 можно прочитать на странице методологии бенчмаркинга.