Artificial Analysis обновила данные независимых оценок языковых моделей, и по итогам пересчёта Agentic Index новым лидером стала модель Qwen3.8 Max от Alibaba. Индекс измеряет производительность моделей именно в агентных сценариях — то есть там, где система должна не просто ответить на вопрос, а самостоятельно планировать действия, вызывать инструменты и доводить многошаговую задачу до результата.
Agentic Index входит в число Capability Indices — специализированных рейтингов Artificial Analysis, которые отдельно измеряют производительность моделей в конкретных прикладных областях: финансах и бухгалтерии, юриспруденции, медицине, инженерии, экономике и стратегическом планировании. В отличие от общего Intelligence Index, который агрегирует девять разноплановых бенчмарков (включая GDPval-AA v2, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond и другие), Agentic Index сфокусирован конкретно на поведении моделей в задачах, требующих автономности: использовании инструментов, построении планов и решении сложных многоступенчатых проблем.
На момент обновления в Agentic Index участвуют 24 модели. Помимо Qwen3.8 Max, в общем срезе присутствуют модели от Anthropic, OpenAI, Google, DeepSeek, Meta, MiniMax, Kimi, Z AI, Mistral, Xiaomi и других разработчиков — вся расстановка сил в рейтинге доступна на странице индекса и обновляется по мере появления новых оценок.
Помимо Agentic Index, на сайте Artificial Analysis обновлена и версия основного Intelligence Index — до v4.1.1. В обновлённой методологии модель τ³-Banking переведена на версию v1.0.1, а в качестве проверяющего (grader) для бенчмарков Humanity's Last Exam, AA-LCR и AA-Omniscience теперь используется GPT-5.6 Luna (medium-режим).
Среди других недавних событий в списке оцениваемых моделей — публикация результатов Ling 3.0 Tiny, Ling-3.0-flash и Muse Spark 1.2 (включая xhigh-версию от Meta), а также запуск отдельного Endpoint Accuracy Index, измеряющего, насколько ответы конкретного провайдерского API-эндпоинта соответствуют по качеству эталонной версии модели.
Artificial Analysis также отмечает обновление методологии расчёта стоимости выполнения задач (Cost per Task): пересчёт привёл к небольшому росту абсолютных оценок стоимости моделей, но относительное положение моделей друг относительно друга в рейтинге изменилось незначительно.
Composite average pass@1 across DeepSWE, Terminal-Bench v2, and SWE-Atlas-QnA · Higher is better
Помимо Agentic Index, на сайте продолжают обновляться и другие профильные рейтинги: индекс для агентов написания кода (Coding Agent Index), объединяющий результаты на DeepSWE, Terminal-Bench v2 и SWE-Atlas-QnA, индекс открытости моделей (Openness Index), а также отдельные лидерборды по генерации изображений, видео и синтезу речи.