Grok 4.6 набрал 61 балл в Artificial Analysis Intelligence Index — на 5 пунктов больше, чем Grok 4.5, всего через месяц после его выхода, и на 23 пункта выше показателя Grok 4.3. Это возвращает SpaceXAI на передовую линию рейтинга рядом с OpenAI, уступая только Anthropic.

Основные выводы:

➤ Grok 4.6 выходит на уровень лидеров Artificial Analysis Intelligence Index: 61 балл — на уровне GPT-5.6 Sol (max), позади Claude Opus 5 (max, 63) и Claude Fable 5 (max с fallback, 62), но чуть впереди Kimi K3

➤ Сильные результаты в агентных задачах: Grok 4.6 показывает Elo 1753 на GDPval-AA v2 — уступая только Claude Opus 5, при этом доверительные интервалы пересекаются с Claude Fable 5 и Qwen3.8 Max. На 𝜏³-Banking модель набирает 50,7% — второй результат после Qwen3.8 Max (51,3%), а на Terminal-Bench v2.1 показывает 88,4%, на уровне ведущих моделей

➤ Интеллект уровня фронтира при более низкой цене: базовая цена не изменилась по сравнению с Grok 4.5 — $2/$6 за 1M входных/выходных токенов, что более чем на 60% ниже, чем у Claude Opus 5 ($5/$25) и GPT-5.6 Sol ($5/$30). Стоимость выполнения одной задачи составила $0,84 — столько же, сколько у Kimi K3, при чуть более высоком уровне интеллекта, что помещает модель на границу Парето по соотношению интеллекта и стоимости за задачу

➤ На AA-Briefcase — приватном бенчмарке долгих агентных задач в сфере интеллектуального труда — Grok 4.6 демонстрирует уровень Fable 5 с Elo 1577, уступая семейству Claude Opus 5. При этом модель заметно эффективнее по числу шагов: в среднем около 53 шагов и ~0,5 млрд входных токенов против ~103 шагов и ~2,0 млрд входных токенов у Claude Opus 5 (max)

Прочие детали модели:

➤ Контекстное окно в 500 тысяч токенов (без изменений по сравнению с Grok 4.5)

➤ Цена $2/$6 за 1M входных/выходных токенов; попадания в кэш оплачиваются по сниженной ставке $0,5 за 1M токенов — рост по сравнению с $0,3 за 1M токенов у Grok 4.5

Агентная производительность

Сильнейшие результаты Grok 4.6 относятся не к статическому рассуждению, а к агентной работе. На GDPval-AA v2 — ведущей метрике реальных агентных задач интеллектуального труда — модель набирает Elo 1753, уступая только Claude Opus 5, и статистически неотличима от Claude Fable 5 и Qwen3.8 Max с учётом пересекающихся доверительных интервалов.

Эта закономерность прослеживается и в других типах задач. 𝜏³-Banking (50,7%) проверяет многоходовое обслуживание клиентов с использованием инструментов и ставит Grok 4.6 в число двух лучших моделей, а Terminal-Bench v2.1 (88,4%) выводит её на уровень лидеров по задачам, связанным с работой в терминале. Немногие модели одновременно конкурентоспособны в интеллектуальном труде, обслуживании клиентов и работе с терминалом; в сочетании с ценой это ставит Grok 4.6 на границу Парето по соотношению цены и производительности практически во всех агентных оценках Intelligence Index.

Стоимость

Сохранение базовой цены неизменной между поколениями моделей — редкость для передовых разработок, где рост интеллекта обычно сопровождается ростом цены. Grok 4.6 даёт прирост в 5 баллов Intelligence Index при неизменной цене $2/$6, а измеренная стоимость выполнения задачи в $0,84 отражает как эту цену, так и разумную эффективность использования токенов.

Важное для покупателей сравнение — с моделями, набравшими баллы в пределах двух пунктов: Claude Opus 5 по цене $5/$25 и GPT-5.6 Sol по цене $5/$30. Grok 4.6 предлагает фактически тот же результат Intelligence Index, что и GPT-5.6 Sol, но за небольшую долю цены выходных токенов — параметра, который в задачах с интенсивным рассуждением определяет основную часть расходов.

Долгосрочная интеллектуальная работа

Grok 4.6 дебютирует в AA-Briefcase — приватном бенчмарке долгих агентных задач интеллектуального труда — с Elo 1577. Это ставит модель на уровень Fable 5, позади семейства Claude Opus 5, при стабильно высоких показателях по критериям оценки, качеству презентации и аналитическому качеству, а не за счёт компенсации слабости в одном измерении силой в другом.

Профиль эффективности не менее примечателен, чем сам результат. Grok 4.6 решает задачи в среднем за ~53 шага и ~0,5 млрд входных токенов, против ~103 шагов и ~2,0 млрд входных токенов у Claude Opus 5 (max). Долгие агентные задачи быстро накапливают контекст, поэтому модель, достигающая сопоставимого результата за вдвое меньшее число шагов и при вчетверо меньшем объёме входных токенов, получает ценовое преимущество, выходящее далеко за рамки простой разницы в цене за токен.

Полные результаты

Полная разбивка по отдельным оценкам, входящим в Artificial Analysis Intelligence Index:

Подробные результаты и бенчмарки Grok 4.6 доступны на сайте Artificial Analysis: artificialanalysis.ai/models/grok-4-6