Стилизованная промо-графика блога с текстом "Gemini 4 Argon"

Представляем Gemini 4 Argon

Google анонсировала новую фундаментальную модель Gemini 4 Argon, которая уже поступает в руки доверенных киберзащитников через программу Fairwind Program. Построенная для глубокого рассуждения в рамках сложных, длительных рабочих процессов, модель фундаментально меняет подход Google к разработке и работе. Она демонстрирует фундаментальную производительность в сложных рабочих процессах: от реальной разработки ПО до корпоративной работы в области права и финансов, а также защиты от кибератак.

Безопасный выпуск возможностей такого уровня требует поэтапного подхода. Google активно участвует в добровольной программе правительства США по доступу к моделям до выпуска, постепенно расширяя доступ. По мере сбора обратной связи от первых тестировщиков и совершенствования защитных механизмов, компания планирует предоставить Argon разработчикам, предприятиям и потребителям как можно скорее.

Argon выходит на начальной цене $2 за миллион входных токенов и $10 за миллион выходных токенов, причем кэшированные входные токены оцениваются на 95% дешевле.

Изменение подхода Google к разработке и работе

Gemini 4 Argon уже используется во внутренних процессах Google — тысячи сотрудников отмечают сильные стороны модели в специализированных задачах кодирования, проведении глубоких исследований и написании качественного контента. Это помогает командам работать быстрее и расширять границы производительности разработки, ускоряя инновации:

  • Оптимизация квантовых алгоритмов: Argon помогает исследователям квантовых вычислений Google оптимизировать пространственно-временные ресурсы (кубиты × гейты) подпрограмм, создающих узкие места в важных приложениях. В одном примере модель превзошла опубликованный базовый результат на 40% за считанные минуты.
  • Эффективность памяти: Команда агентов Argon анализировала телеметрию профилирования по всему парку серверов, чтобы автономно выявлять и применять оптимизации памяти во всех центрах обработки данных Google, освободив более 300 TiB памяти после развертывания, с прогнозируемой общей экономией от 500 TiB до 1 PiB.
  • Масштабные миграции и оптимизация кодовой базы: Агенты Argon работают над миграцией кодовых баз C/C++ на Rust по всему Google — масштабируясь от десятков тысяч строк в основных библиотеках, таких как re2 и libgav1, до более чем 800K строк для ядра Zircon в операционной системе Fuchsia. Учитывая критичность многих из этих систем, такие масштабные переписания проходят строгое автоматизированное и ручное тестирование, эмуляцию и проверку перед развертыванием в production.

    Для libgav1 — программного обеспечения Google с открытым исходным кодом для декодирования видео — агенты Argon взяли существующий порт Rust и заменили 32K строк кода SIMD, проводя множество раундов экспериментов под управлением профилирования, изучая результаты компилятора и создавая безопасный код Rust, чтобы компилятор смог его автоматически векторизировать. Результат — декодер видео, безопасный с точки зрения памяти, работающий в 2,7 раза быстрее, чем Rust-порт, с идентичным выводом видео, приближаясь к оптимизированному C++.

Более глубокое решение сложных задач

Для поддержки возможностей Gemini 4 Argon в более длительных и сложных случаях использования, Google значительно расширила предельный размер выходных токенов модели до рекордного 1M токена, что в 15 раз больше предыдущих 64K токенов. Когда у модели есть пространство для глубокого рассуждения и генерации сотен тысяч токенов в одной траектории, это добавляет новый уровень глубины в рассуждения для решения сложных проблем в один раз.

Диаграмма бенчмарков, показывающая возможности Gemini 4 Argon

Включение рабочих процессов кодирования и корпоративной работы во всех областях

Возможности Gemini 4 Argon в кодировании, рассуждении, мультимодальности и способность поддерживать долгие многошаговые задачи позволяют ей превосходить в различных корпоративных рабочих процессах.

Инженеры Google использовали Argon в своих ежедневных задачах — от обычной отладки до масштабных миграций кодовой базы и разработки алгоритмов. Модель устанавливает новый уровень качества на DeepSWE v1.1 (77,9%) — бенчмарке, измеряющем производительность модели в реальных долгосрочных задачах разработки ПО.

Помимо кодирования, Argon занимает лидирующее место в Vals Index, который оценивает экономическое влияние во всех сферах финансов, кодирования, права и налогов, при этом каждый сектор взвешивается по его вкладу в ВВП США. Аналогичные лидирующие результаты видны в других специализированных оценках, таких как Vals Finance Agent v2 (многошаговые финансовые исследования) и Harvey's Legal Agent Benchmark (юридические исследования и подготовка документов). На AutomationBench — бенчмарке Zapier, измеряющем сквозное выполнение по ключевым бизнес-функциям, Argon занимает 1-е место с результатом 51,3%.

Argon также исключительно сильна, когда работа с данными требует визуального понимания. Она может проводить профессиональный анализ диаграмм, выявлять детали из длинных видео и предпринимать действия на основе серии документов. Например, на LVBench, который измеряет понимание длинных видео, Argon является лучшей в классе с результатом 91,7%.

Диаграмма оценки DeepSwe Диаграмма индекса Vals Диаграмма финансового бенчмарка Vals Диаграмма бенчмарка Harveys Диаграмма бенчмарка автоматизации

Лидерство в защите от кибератак

Чтобы лучше вооружить киберзащитников в новую эру кибератак, Google обучила Gemini 4 Argon быть исключительно способной в защите от кибератак. Argon может автономно находить, проверять и исправлять критические уязвимости программного обеспечения. Для доверенных защитников и собственных внутренних команд Google, выпуск Argon будет идти без киберзащиты, чтобы они могли использовать ее полные возможности защиты от кибератак на фундаментальном уровне.

Wiz уже использует Argon для защиты от кибератак через свою инициативу Scan for Good — программу, посвященную бесплатной защите критической общественной инфраструктуры путем выявления и устранения высокорисковых уязвимостей. В раннем демонстрационном примере влияния модели, она выявила критическую уязвимость, раскрывающую чувствительную личную информацию по всему программному обеспечению здравоохранения, используемому больницами по всему миру, выявив серьезный риск, который ранее пропустили более новые фундаментальные модели.

На CWE-bench v1, который оценивает способность модели исправлять уязвимости безопасности, Argon делит первое место с лучшим результатом 68%, развивая успех 3.8 Flash Cyber на CWE-bench v0.

Диаграмма бенчмарка CWE

Gemini 4 Argon демонстрирует впечатляющие скачки в обнаружении уязвимостей по сравнению с 3.8 Flash Cyber. Например:

  • На собственном комплексном бенчмарке уязвимостей Google, Argon выявила широкий спектр уязвимостей в сложных кодовых базах, охватывающих 20 языков программирования.
  • На собственном черном ящике бенчмарка тестирования на проникновение Wiz, который проверяет способность модели анализировать живые веб-системы без исходного кода, Argon превосходит 3.8 Flash Cyber в выявлении поверхности атаки, выявлении уязвимостей и создании доказательств концепции для их проверки.
Диаграмма уязвимостей безопасности

Усиление фундаментальной защиты перед широкой доступностью

Перед масштабным выпуском Gemini 4 Argon компания продолжает укреплять критическую защиту на фундаментальном уровне в четырех основных областях:

Защита от неправомерного использования: Чтобы предотвратить использование Argon злоумышленниками для кибератак или атак с использованием химического, биологического, радиологического и ядерного (CBRN) оружия, модель разработана так, чтобы отказывать вредоносные запросы, сохраняя при этом законные двойного назначения научные исследования, в соответствии с Frontier Safety Framework Google. Компания укрепляет надежность своих защитных механизмов для этого выпуска, включая совершенствование методов мониторинга внутренних активаций модели для выявления неправомерного использования. Эти защитные механизмы прошли тестирование надежности внутренними и внешними красными командами, используя комбинацию ручных и автоматизированных методов атаки.

Защита от атак путем инъекции подсказок: Argon также является самой устойчивой моделью Google к косвенным инъекциям подсказок, когда вредоносные инструкции или контекст используются для захвата поведения модели. Это сложные атаки, требующие постоянной бдительности и множественных уровней защиты. Благодаря автоматизированной красной команде и состязательному обучению Gemini 4 Argon лидирует в устойчивости к инъекциям подсказок на бенчмарке Gray Swan's Indirect Prompt Injection (IPI).

Оценка Gray Swan

Мониторинг расхождений: Для предотвращения выхода Argon за пределы допустимого при попытке выполнить задачу способом, выходящим за рамки намерений пользователя, компания развертывает смягчение расхождений, которое отслеживает цепь рассуждений и действия Argon и останавливает выполнение при необходимости.

Аналогичная система использовалась для мониторинга тренировочных запусков с отправкой оповещений выделенной команде реагирования на инциденты, принимая осторожные меры предосторожности против обратной передачи выводов в тренировку во избежание риска формирования рассуждений Argon для обхода мониторинга. Google настоятельно рекомендует остальной индустрии сохранять прозрачность рассуждений в эти поворотные моменты повышенных способностей, одновременно ориентируясь на риски выравнивания, так чтобы мысли модели оставались полезными в выявлении и диагностике расхождений.

Укрепление систем: Поскольку фундаментальные модели становятся все более способными, их безопасное тестирование требует защищенных сред, которые могут соответствовать самим системам. В соответствии с дорожной картой управления агентами Google, компания укрепляет свои изолированные среды, изолируя и запечатывая их перед началом высокорисковых тренировок или оценок. Компания обязана делиться этими лучшими практиками безопасности агентов с партнерами для улучшения безопасности во всей экосистеме.

Вскоре начнется развертывание

Google создала Gemini 4 Argon с фундаментальными возможностями в кодировании, работе с информацией, защите от кибератак и творческом письме, чтобы быть партнером для разработчиков, профессионалов и предприятий при решении наиболее сложных проблем. Компания благодарна первоначальной группе киберзащитников и доверенных тестировщиков, чьи реальные оценки и обратная связь помогут укрепить системы перед выпуском разработчикам, предприятиям и потребителям, начиная с платных клиентов API и подписчиков Google AI Ultra.