xAI выпустила Grok 4.6 — модель, развивающую Grok 4.5 с особым вниманием к долгоживущим агентам и более амбициозной интерактивной и визуальной работе. Модель способна удерживать контекст сложной задачи на протяжении множества шагов — будь то исследование темы, анализ данных, работа с кодовой базой целиком или превращение идеи в готовое приложение или артефакт.

Grok 4.6 показывает результаты на уровне лучших моделей по нескольким бенчмаркам агентного кодинга и работы со знаниями. По составному индексу Artificial Analysis Intelligence Index, объединяющему девять бенчмарков, модель сравнялась с GPT-5.6 Sol.

Данные конкурентов взяты из опубликованных системных карточек разработчиков или таблиц лидеров бенчмарков.

Сравнение Grok 4.6 с другими ведущими моделями по бенчмаркам AA Intelligence, GDPVal-AA, DeepSWE 1.1, CursorBench 3.2 и FrontierCode 1.1.

Grok 4.6 уже доступна в Cursor и Grok Build. В первую неделю после релиза в обоих продуктах предоставляется двойной лимит включённого использования — для тех, кто хочет опробовать новую версию сразу.

Обучение Grok 4.6

Grok 4.6 прошла более продолжительный дополнительный этап обучения, чем Grok 4.5: с использованием отобранных данных, сгенерированных моделью для рассуждений и продвинутых технических концепций, качественных инженерных данных, а также улучшенного оптимизатора и рецепта обучения. Это дало более прочную основу для последующих этапов SFT и RL.

Далее с помощью Grok 4.5 были перегенерированы траектории SFT для разных уровней рассуждения, агентных обвязок и доменов — STEM, разработка ПО, работа со знаниями, а проблемные траектории отфильтрованы с помощью проверок на основе модели. Полученный чекпоинт SFT показывает высокую производительность и улучшенное поведение.

Grok 4.6 обучена на широком спектре агентных RL-задач, включая работу со знаниями, общий кодинг и специализированные среды — оптимизацию ядер, веб-разработку, автоматизированное проектирование (CAD) и другие направления.

От амбициозных идей к работающим проектам

Grok 4.6 тестировали на проектах, специально рассчитанных на то, чтобы проверить диапазон возможностей модели и её способность удерживать работу на протяжении многих шагов. Модель особенно хорошо справляется с превращением широкой продуктовой идеи в работающую первую версию: способна исследовать незнакомую предметную область, структурировать приложение, реализовать базовые взаимодействия и продолжать доработку результата через несколько раундов обратной связи.

На длинных траекториях работы также стало заметно больше самопроверки — модель тестирует собственную работу, прежде чем двигаться дальше.

Grok 4.6 выдаёт более сильные первые версии визуальных и интерактивных проектов по сравнению с тем, что обычно демонстрировала Grok 4.5. При наличии конкретной продуктовой идеи модель способна с первого прохода задать структуру и визуальный язык приложения. Это делает её особенно полезной для проектов, где быстрее всего добиться хорошего результата, начав с чего-то основательного и затем итерируя в цикле.

Безопасность и возможности

Механизмы защиты Grok 4.6 были улучшены и откалиброваны в соответствии с возможностями модели.

Система безопасности xAI спроектирована так, чтобы максимизировать полезность и защищённость в легитимных сценариях использования, позволяя Grok 4.6 быть полезной и безопасной в таких областях, как устранение уязвимостей, ускорение цикла инженерного проектирования и поддержка исследований в области ИИ.

Работа по оценке защитных механизмов отражает расширенные возможности Grok 4.6: применён самый широкий на данный момент набор тестов до релиза для проверки возможностей и калибровки защитных мер, а также проведено масштабное тестирование после релиза и тестирование сторонними организациями.

Результаты бенчмарков

БенчмаркGrok 4.6 (High)Grok 4.5 (High)GPT-5.6 Sol (Max)Fable 5 (Max)
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269,9%66,7%67,2%70,5%
DeepSWE v1.165,9%54%73%70%
FrontierCode v1.1 (Extended)61,3%56,6%60,6%63,6%
APEX-Agents57,5%47,1%56,7%59,2%
Terminal-Bench v3.026%15,7%34,6%34,1%
APEX-SWE56,4%53,6%58,8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15,8%12,9%2,5%11,3%
Лучший результат по каждому бенчмарку выделен жирным. Показатели сторонних моделей приведены по лучшим из самостоятельно заявленных или публично доступных результатов.

Начало работы с Grok 4.6

Grok 4.6 уже доступна в Cursor и Grok Build, а также через API и других партнёров — OpenRouter, Vercel и Cloudflare.

Цены начинаются от 2 долларов за миллион входных токенов и 6 долларов за миллион выходных. Также доступен быстрый вариант модели по цене вдвое выше.

В первую неделю после релиза Grok Build и Cursor предоставляют двойной лимит включённого использования — можно начать работу с 4.6 сразу.