Google анонсировала Gemini 3.5 Transcribe — самую точную на сегодняшний день модель распознавания речи компании, созданную для интеллектуальных голосовых взаимодействий. В отличие от традиционных моделей speech-to-text, которые плохо справляются с фоновым шумом, сложной терминологией и очисткой речи от запинок, Gemini 3.5 Transcribe преобразует необработанное аудио напрямую в точный, отформатированный текст.

В таких продуктах Google, как приложение Gemini и Android, пользователи уже получили доступ к новым голосовым возможностям на основе этой модели транскрипции — например, к функции Rambler на Android и в приложении Gemini на macOS. Теперь разработчики могут создавать аналогичные функции с помощью Gemini 3.5 Transcribe через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.

Модель 3.5 Transcribe спроектирована для бесшовной интеграции в рабочие процессы разработчиков — будь то создание голосовых агентов, инструментов субтитрирования в реальном времени или конвейеров постанализа звонков. Модель доступна через два отдельных API:

  • Потоковая передача в реальном времени: обеспечивает непрерывную двустороннюю потоковую передачу с задержкой менее секунды для интерактивных голосовых приложений через Live API с использованием gemini-3.5-transcribe-live.
  • Обработка записанного аудио: транскрибирует записи, встречи, журналы звонков и прочее с указанием говорящих и временными метками на уровне слов через Interactions API с использованием gemini-3.5-transcribe.

Более точная и интеллектуальная транскрипция

Gemini 3.5 Transcribe спроектирована для распознавания естественной манеры речи, чтобы лучше понимать намерение говорящего и распознавать пользовательскую лексику, позволяя выполнять задачи с помощью голоса.

  • Умная транскрипция: корректно обрабатывает самокоррекции в речи (например, «встретимся во вторник — нет, в среду»), убирает слова-паразиты («эм», «ну») и автоматически форматирует текст.
  • Вызов функций: модель может делегировать сложные задачи (генерацию изображений, анализ файлов) другим моделям Gemini через вызовы функций. Сейчас эта возможность доступна в приложении Gemini для macOS.
  • Более точная транскрипция: по данным Artificial Analysis, модель достигает среднего показателя Word Error Rate (WER) в 4,0% для потокового режима и 2,6% для непотоковых сценариев. Она демонстрирует высокую производительность в шумных условиях реального мира, точно распознавая буквенно-цифровые сущности вроде почтовых индексов и номеров заказов.
  • Пользовательская лексика: распознаёт специализированную терминологию и уникальные написания, адаптируя транскрипцию под заданный пользователем словарь.
  • Глобальная языковая поддержка: автоматически определяет и транскрибирует более 85 языков, корректно обрабатывая региональные акценты и различные диалекты.
  • Идентификация нескольких говорящих: точно атрибутирует речь в записанном аудио с временными метками для до трёх участников (поддержка более трёх говорящих находится в экспериментальном статусе).

По производительности Gemini 3.5 Transcribe представляет собой существенный шаг вперёд по сравнению с предыдущей моделью транскрипции Chirp 3 — новые возможности сочетаются с улучшенным показателем ошибок распознавания слов и значительно меньшей задержкой. По оценке Artificial Analysis, время получения финальной транскрипции сократилось на 70%. На бенчмарке FLEURS, охватывающем набор ведущих языков и локалей, модель демонстрирует точную многоязычную работу, превосходя Chirp 3 и достигая WER в 5,50% в потоковом режиме и 5,04% для непотоковых сценариев.

Graph of streaming speech recognition accuracy

Умная транскрипция и продвинутый диктант на практике

Помимо доступности через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, 3.5 Transcribe выходит за рамки стандартного speech-to-text, делая работу с продуктами Google более естественной и интуитивной. Внедряя контекстно-зависимое понимание непосредственно в повседневные инструменты — Gboard, Antigravity, приложение Gemini и Chrome, — модель улавливает нюансы, намерения и правки на лету.

  • В Gboard на Android, благодаря новой функции Rambler, 3.5 Transcribe превращает произнесённые мысли в аккуратно отформатированный текст, отфильтровывая слова-паразиты. Голосом также можно вносить правки, исправлять опечатки и менять стиль письма.
  • В Google Antigravity 3.5 Transcribe сопоставляет контекст экрана и историю переписки (с разрешения пользователя), чтобы обеспечить точную транскрипцию названий файлов, размышлений агента и активных документов.
  • В Google AI Studio доступ к 3.5 Transcribe открыт в режиме Build — можно создавать приложения голосом в стиле vibe coding.
  • В приложении Gemini на macOS 3.5 Transcribe не только преобразует свободную естественную речь в чистый отформатированный текст, но и позволяет использовать голосовые команды в сочетании с контекстом экрана для выполнения сложных сценариев работы. Вызывая в фоновом режиме другие модели Gemini для выполнения основной работы, модель упрощает суммирование локальных файлов, перенос текста между приложениями или генерацию изображений прямо в месте курсора — с помощью одного лишь голоса.
  • В Chrome в ближайшее время появится возможность диктовать текст в любое веб-поле — это упростит надиктовку ответов, черновиков постов и запросов к Gemini в Chrome.

Первые отзывы

Благодаря использованию Gemini Live API платформы для разработчиков, такие как Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам легко создавать и развёртывать высокопроизводительные голосовые интерфейсы. Эти платформы берут на себя управление сложной инфраструктурой потоковой передачи медиа в реальном времени, позволяя разработчикам сосредоточиться исключительно на пользовательском опыте.

Такие компании, как vivo, Intellitek Health и Lingopal, также поделились положительными отзывами о 3.5 Transcribe, отметив впечатляющую задержку, точность и широкую языковую поддержку модели.

Начать использовать 3.5 Transcribe уже сегодня