xAI выпустила Grok 4.6 — модель, развивающую Grok 4.5 с особым вниманием к долгоживущим агентам и более амбициозной интерактивной и визуальной работе. Модель способна удерживать контекст сложной задачи на протяжении множества шагов — будь то исследование темы, анализ данных, работа с кодовой базой целиком или превращение идеи в готовое приложение или артефакт.
Grok 4.6 показывает результаты на уровне лучших моделей по нескольким бенчмаркам агентного кодинга и работы со знаниями. По составному индексу Artificial Analysis Intelligence Index, объединяющему девять бенчмарков, модель сравнялась с GPT-5.6 Sol.
Данные конкурентов взяты из опубликованных системных карточек разработчиков или таблиц лидеров бенчмарков.
Grok 4.6 уже доступна в Cursor и Grok Build. В первую неделю после релиза в обоих продуктах предоставляется двойной лимит включённого использования — для тех, кто хочет опробовать новую версию сразу.
Обучение Grok 4.6
Grok 4.6 прошла более продолжительный дополнительный этап обучения, чем Grok 4.5: с использованием отобранных данных, сгенерированных моделью для рассуждений и продвинутых технических концепций, качественных инженерных данных, а также улучшенного оптимизатора и рецепта обучения. Это дало более прочную основу для последующих этапов SFT и RL.
Далее с помощью Grok 4.5 были перегенерированы траектории SFT для разных уровней рассуждения, агентных обвязок и доменов — STEM, разработка ПО, работа со знаниями, а проблемные траектории отфильтрованы с помощью проверок на основе модели. Полученный чекпоинт SFT показывает высокую производительность и улучшенное поведение.
Grok 4.6 обучена на широком спектре агентных RL-задач, включая работу со знаниями, общий кодинг и специализированные среды — оптимизацию ядер, веб-разработку, автоматизированное проектирование (CAD) и другие направления.
От амбициозных идей к работающим проектам
Grok 4.6 тестировали на проектах, специально рассчитанных на то, чтобы проверить диапазон возможностей модели и её способность удерживать работу на протяжении многих шагов. Модель особенно хорошо справляется с превращением широкой продуктовой идеи в работающую первую версию: способна исследовать незнакомую предметную область, структурировать приложение, реализовать базовые взаимодействия и продолжать доработку результата через несколько раундов обратной связи.
На длинных траекториях работы также стало заметно больше самопроверки — модель тестирует собственную работу, прежде чем двигаться дальше.
Grok 4.6 выдаёт более сильные первые версии визуальных и интерактивных проектов по сравнению с тем, что обычно демонстрировала Grok 4.5. При наличии конкретной продуктовой идеи модель способна с первого прохода задать структуру и визуальный язык приложения. Это делает её особенно полезной для проектов, где быстрее всего добиться хорошего результата, начав с чего-то основательного и затем итерируя в цикле.
Безопасность и возможности
Механизмы защиты Grok 4.6 были улучшены и откалиброваны в соответствии с возможностями модели.
Система безопасности xAI спроектирована так, чтобы максимизировать полезность и защищённость в легитимных сценариях использования, позволяя Grok 4.6 быть полезной и безопасной в таких областях, как устранение уязвимостей, ускорение цикла инженерного проектирования и поддержка исследований в области ИИ.
Работа по оценке защитных механизмов отражает расширенные возможности Grok 4.6: применён самый широкий на данный момент набор тестов до релиза для проверки возможностей и калибровки защитных мер, а также проведено масштабное тестирование после релиза и тестирование сторонними организациями.
Результаты бенчмарков
| Бенчмарк | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol (Max) | Fable 5 (Max) |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| DeepSWE v1.1 | 65,9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61,3% | 56,6% | 60,6% | 63,6% |
| APEX-Agents | 57,5% | 47,1% | 56,7% | 59,2% |
| Terminal-Bench v3.0 | 26% | 15,7% | 34,6% | 34,1% |
| APEX-SWE | 56,4% | 53,6% | — | 58,8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15,8% | 12,9% | 2,5% | 11,3% |
Начало работы с Grok 4.6
Grok 4.6 уже доступна в Cursor и Grok Build, а также через API и других партнёров — OpenRouter, Vercel и Cloudflare.
Цены начинаются от 2 долларов за миллион входных токенов и 6 долларов за миллион выходных. Также доступен быстрый вариант модели по цене вдвое выше.
В первую неделю после релиза Grok Build и Cursor предоставляют двойной лимит включённого использования — можно начать работу с 4.6 сразу.