Что изменилось
Mercury 2.5 — наиболее мощная диффузионная LLM на рынке. По информации разработчиков, это крупнейшая диффузионная языковая модель из когда-либо обученных.
Качество: рост интеллектуальности на 40% относительно Mercury 2. Сопоставима с оптимизированными по стоимости моделями frontline-уровня вроде GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.
Скорость: 1107 токенов в секунду на широко распространённых GPU NVIDIA.
Контекст: 260K токенов.
Цена: $0.20 за миллион входящих и $0.75 за миллион выходящих токенов.
При запуске Mercury 2.5 доступна с 80% скидкой: $0.04 за миллион входящих и $0.15 за миллион выходящих токенов.
Функции: настраиваемое рассуждение, параллельные вызовы инструментов и JSON с выравниванием по схеме.
С момента запуска Mercury 2, мы наблюдали, как Inception продвигает диффузионные языковые модели вперёд на инфраструктуре NVIDIA AI. Скачок в интеллектуальности Mercury 2.5 при сохранении скорости и низких затрат отражает, насколько быстро новые архитектуры могут трансформироваться в готовые к производству системы на платформе NVIDIA.
Shruti Koparkar, Senior Manager of Product, Accelerated Computing Group at NVIDIA
Mercury в production
Поисковые агенты и RAG-конвейеры
Один поисковый запрос может вызвать дюжины обращений к модели: планирование поиска, переформулировка запросов, переранжирование результатов, структурирование фактов, суммирование источников и проверка ответа. Mercury держит эти обращения достаточно быстрыми, чтобы остаться внутри единого взаимодействия пользователя. Несколько ведущих компаний в области инфраструктуры поиска уже запустили её в production.
Голосовые агенты и интерактивные приложения
В голосовых вызовах задержка — не деталь инфраструктуры. Это пауза, которую слышит звонящий.
OpenCall создаёт AI-агентов, обрабатывающих живые звонки клиентов. На своей production-нагрузке Mercury снизила медианную задержку ответа модели до примерно 170 миллисекунд.
После переходу на Mercury наше время P99 упало с нескольких минут до одной секунды, а P50 упало с 0.4 секунды до менее чем 0.2 — значительно быстрее, чем у любого другого провайдера, которого мы видели, и это включая рассуждение.
Oliver Silverstein, Co-founder and CEO, OpenCall
Вспомогательные агенты и кодирование
Агенты кодирования уже распределяют работу между моделями. Одна может планировать или писать код, а другие осуществляют поиск, запускают инструменты, маршрутизируют запросы, суммируют состояние или компактифицируют длинную сессию. Эти вспомогательные обращения повторяются снова и снова, поэтому задержка и стоимость накапливаются быстро.
Augment Code использует Mercury для компактификации контекста, маршрутизации моделей и поиска инструментов MCP. Перемещение компактификации на Mercury сократило задержку на 82% — с примерно 150 секунд до 27 секунд — и снизило стоимость на 90% при сохранении качества. Резюме поиска инструментов возвращаются менее чем за секунду.
Та же скорость применима к разработке веб-приложений. В демонстрации ниже Mercury 2.5 генерирует рабочее веб-приложение для музыкального поиска всего из нескольких подсказок.
Mercury Voice и Mercury Router — предпросмотр
Наряду с Mercury 2.5 объявляется о предпросмотре Mercury Voice и Mercury Router.
Mercury Voice обеспечивает time-to-first-token (TTFT) менее 170 миллисекунд и представляет собой диффузионную LLM, оптимизированную для голосовых агентов с наиболее жёсткими бюджетами задержки.
Mercury Router распознаёт входящие запросы с помощью диффузионной LLM и маршрутизирует их к наилучшим моделям (открытым и закрытым), которые предлагают лучшее сочетание качества, скорости и стоимости.
Начало работы
Модели Mercury доступны через Inception API, Baseten и OpenRouter. Развёртывания для enterprise поддерживают выделенные ёмкости, автомасштабирование, средства соответствия требованиям и настраиваемую сохранность данных.
Попробуйте Mercury 2.5 в chat
Попробуйте API со 100 миллионами бесплатных токенов · Прочитайте документацию API
Пользователи Baseten: развёртывайте Mercury 2.5 через существующий набор Baseten.
Компании Y Combinator: получите $500,000 в преимуществах развёртывания.
Оцениваете Mercury для голоса? Мы поработаем с вами, чтобы протестировать соответствие нагрузки и подтвердить производительность при ваших ограничениях обслуживания. Свяжитесь с нами.
Что дальше
Тренировка следующей модели уже началась. Это крупнейшая модель на данный момент, и запуск планируется на ближайшие месяцы. Следующая модель будет скачком в возможностях, но без потери скорости и эффективности токенов, присущих диффузионным подходам. Это требует прогресса в обучении моделей, выводе, оценивании и инфраструктуре. Если это вид проблем, над которыми вы хотите работать, будем рады услышать от вас.
Вскоре будет больше новостей.