Более естественные и интеллектуальные диалоги

Представляются две новые модели, которые приносят продвижения в область ближайшего рвремени рассуждений, чтобы более эффективно обеспечить голосовых агентов и сделать разговор с ИИ более интуитивным и интеллектуальным:

  • Gemini 3.8 Live: предназначена для масштабирования и экономической эффективности, сочетая возможности диалога с текучестью общения и визуальным заземлением.
  • Gemini 3.8 Live Extended Thinking: предназначена для сложных задач, с повышенным интеллектом и многошаговым рассуждением.

Для разработчиков и предприятий эти модели предоставляют строительные блоки для надежных, готовых к производству голосовых агентов. Они также делают общение с Gemini в приложении Gemini, Google Workspace и Search более текучим и совместным, помогая вам решать сложные задачи, используя только голос.

Более плавные и интеллектуальные диалоги

Gemini 3.8 Live Extended Thinking обеспечивает завершение задач и интеллект корпоративного уровня, заняв первое место по рейтингу качества Speech to Speech от Artificial Analysis (82,6) и лидирует в завершении агентических задач с 68,6% на τ-Voice и 35,1% на эталоне τ-Voice-banking от Sierra. Она также обеспечивает сильные возможности рассуждения, набирая 97,7% на Big Bench Audio, при этом сохраняя высокую конкурентоспособность цены по сравнению с другими передовыми моделями.

Gemini 3.8 Live показала высокое предпочтение среди пользователей, заняв второе место в Speech Agent Arena. Помимо этого производства, она остается высокоэффективной — предоставляя разработчикам и предприятиям возможную и эффективную модель, созданную для масштабирования.

На EVA-Bench от ServiceNow, эталоне для оценки голосовых агентов, наши модели продвигают границу Парето для сложных рабочих процессов, успешно уравновешивая точность с качеством общения.

Примечание: это было запущено на Live API на платформе Gemini Enterprise Agent Platform.

Диаграмма EVA Bench Experience to Task Completion

Ближайшие характеристики в реальном времени

Gemini 3.8 Live обрабатывает визуальные входные данные практически в реальном времени, обогащая диалоги контекстом для более полезных ответов. Она автоматически определяет и переходит между 97 поддерживаемыми языками в ходе разговора. Она выполняет инструменты и вызовы API в фоновом режиме, продолжая разговор, поэтому модель может подтвердить запросы и продолжить общение, пока задачи завершаются в фоновом режиме.

Gemini 3.8 Live направляет адаптацию сотрудников в реальном времени, используя визуальный контекст для ответа на живые вопросы.

Смотрите, как Gemini 3.8 Live играет в шахматы практически в реальном времени, используя визуальный контекст, рассуждение и естественный поток разговора.

Для задач, требующих глубокого рассуждения, 3.8 Live Extended Thinking рассуждает и говорит одновременно. Она обеспечивает повышенный интеллект для сложных рабочих процессов, сохраняя при этом непрерывный поток разговора — используя ранние вербальные сигналы, такие как "Позвольте мне проверить это…", чтобы естественным образом подтвердить запросы, и живое повествование о ходе работы, чтобы провести пользователей через многоэтапные фоновые задачи по мере их выполнения.

Смотрите, как Gemini 3.8 Live Extended Thinking преобразует сырые эскизы и голосовые отзывы в реальном времени в функциональные компоненты React.

Смотрите, как Gemini 3.8 Live Extended Thinking координирует многоэтапные бронирования и асинхронные вызовы функций — все без прерывания естественного живого разговора.

Смотрите, как Gemini 3.8 Live создает полные бизнес-планы и специальные наборы маркетинговых инструментов на лету через естественную речь.

Во всех Google Workspace и Search наши Live модели обеспечивают более интуитивные, совместные опыты — особенно при решении ваших самых сложных задач.

Попробуйте Gemini 3.8 Live Extended Thinking в Google Workspace с Docs Live, Gmail Live и Keep Live.

Получите пошаговую помощь в реальном времени с помощью Gemini 3.8 Live — прямо в Search Live.

Расширение возможностей экосистемы разработчиков и предприятий голоса

Используя Gemini Live API, платформы для разработчиков, такие как Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам легко создавать и развертывать высокопроизводительные голосовые интерфейсы. Эти платформы управляют сложной инфраструктурой потоковой передачи мультимедиа в реальном времени в фоновом режиме, позволяя разработчикам полностью сосредоточиться на создании пользовательского опыта.

Мы также работаем в партнерстве с компаниями, такими как Salesforce, Genspark и Lumeris, которые с энтузиазмом относятся к 3.8 Live и 3.8 Live Extended Thinking, подчеркивая его впечатляющую задержку, текучесть и возможности для вызова инструментов.

Обеспечьте прозрачность с помощью водяного знака SynthID

Весь звук, генерируемый нашими продуктами ИИ, помечается водяным знаком SynthID. Этот незаметный водяной знак встроен непосредственно в звуковой выход, обеспечивая возможность обнаружения контента, созданного ИИ, для предотвращения дезинформации. Для получения подробной информации о нашем подходе к безопасности и ответственности ознакомьтесь с картой модели.

Начните использовать наши последние модели Gemini Audio:

3.8 Live начинает развертываться сегодня:

3.8 Live Extended Thinking начинает развертываться сегодня:

  • Для разработчиков: в Gemini API и Google AI Studio
  • Для предприятий: в приватной предпросмотре в Gemini Enterprise и скоро в Gemini Enterprise for Customer Experience и клиентов Google Workspace business
  • Для всех: в Gemini Live и для подписчиков Google AI Pro и Ultra в Workspace в Docs и всех подписчиков Google AI в Gmail и Keep