По мере того как ИИ смещается от чат-ботов к автономным агентам, открытые модели закрывают потребность рынка в полном контроле над тем, где выполняется ИИ и как он развивается и внедряется.

Nvidia расширила семейство моделей Nemotron 3, выпустив Nemotron 3.5 Lightning — самую эффективную в своём классе модель для длительных агентных рабочих нагрузок. Релиз следует за Nemotron 3 Nano и отражает курс компании на постоянное улучшение открытых моделей по точности и скорости.

Nemotron 3.5 Lightning создана для специализированных задач в составе более крупных многоагентных систем. Это модель на 30 млрд параметров с архитектурой mixture-of-experts, которая помогает строить более умные и эффективные агентные приложения.

Помимо этого, Nvidia выпустила NeMo Switchyard — библиотеку с открытым исходным кодом для умной маршрутизации запросов внутри популярных агентных инструментов. Компании могут использовать её для построения маршрутизатора под собственные требования. После внедрения NeMo Switchyard способна автоматически направлять каждый запрос к наиболее подходящей и эффективной модели для конкретной задачи — среди набора открытых, проприетарных и собственных моделей Nvidia — без необходимости переписывать приложения.

Вместе Nemotron 3.5 Lightning и NeMo Switchyard дают больший контроль над тем, как разворачивается ИИ, где он выполняется и насколько эффективно работает — на ПК, рабочих станциях, в датацентрах и облаке.

Nemotron 3.5 Lightning обеспечивает уровень интеллекта передовых моделей в компактном, настраиваемом открытом решении для высокообъёмных агентных рабочих процессов.

Постоянно работающим агентам нужна система моделей

Современные агентные системы — постоянно работающие агенты — всё чаще функционируют как системы моделей, или ансамбли моделей, где разные модели специализируются на разных задачах.

Открытые модели Nvidia Nemotron спроектированы именно под такую архитектуру. Флагманская модель для рассуждений, например Nemotron 3 Ultra или GPT-5.6, может планировать и оркестрировать рабочий процесс, в то время как меньшие специализированные модели, такие как Nemotron 3.5 Lightning, выполняют точечные задачи — ревью кода, использование инструментов, мониторинг предупреждений безопасности или ответы на вопросы по биллингу.

Высокообъёмные специализированные задачи с Nemotron 3.5 Lightning

Nvidia Nemotron 3.5 Lightning — полностью настраиваемая открытая модель, созданная для высокообъёмных задач, которые выполняют постоянно работающие агенты. В разработке участвовала коалиция Nemotron Coalition — её участники предоставили методологии оценки, программное обеспечение для инференса и наборы данных, помогавшие продвинуть модель.

Модель обеспечивает до 4-кратного увеличения скорости генерации, что даёт ускорение выполнения агентных задач на 30% по сравнению с другими моделями своего класса. А поскольку модель открытая и настраиваемая, Nemotron 3.5 Lightning можно легко дообучить с помощью Nvidia NeMo на собственных данных, инструментах и рабочих процессах организации, повышая точность для специализированных задач.

Тесты PinchBench показывают, что Nemotron 3.5 Lightning выполняет агентные задачи быстрее, сохраняя точность на уровне передовых моделей, по сравнению с конкурентами своего класса.

Лидеры отрасли в разных индустриях уже адаптируют Nemotron 3.5 Lightning под свои задачи: CrowdStrike — для кибербезопасности, Harvey совместно с Trajectory — для юридических услуг, а CodeRabbit совместно с Baseten — для ревью кода, повышая точность решения узкоспециализированных агентных задач. Кроме того, Lila Sciences помогает улучшить способности к рассуждению для агентных задач в физических и биологических науках, а Fastino Labs адаптировала модель и достигла лидирующей точности для рабочих нагрузок в разработке ПО, финансах и здравоохранении.

Компании адаптировали Nemotron 3.5 Lightning, чтобы добиться лидирующей точности в своих специализированных задачах в рамках агентных рабочих процессов.

Nemotron 3.5 Lightning также даёт организациям контроль над приватностью и развёртыванием. Модель может работать на локальных ИИ-системах — включая Nvidia RTX PC, Nvidia DGX Spark, Nvidia DGX Station и Nvidia Jetson — что позволяет максимально использовать существующую инфраструктуру, либо масштабироваться на устройства edge AI, рабочие станции Nvidia RTX PRO, датацентры и облачные среды для корпоративных сценариев. Nemotron 3.5 Lightning может работать локально или на собственных серверах для высокообъёмных специализированных задач, требующих быстрого отклика.

Как и при каждом релизе Nemotron, Nvidia публикует максимум обучающих данных и методик, насколько позволяют лицензии, — это обеспечивает прослеживаемость, возможность аудита и обучения других моделей. Вместе с Lightning компания выпустила Nemotron-RL-Agentic-Terminal-Pivot — набор данных для обучения с подкреплением на агентных задачах, использованный для дообучения модели навыкам кодового агента.

Более эффективные ИИ-приложения благодаря маршрутизации моделей

Одни модели лучше подходят для написания кода, другие — для рассуждений, третьи — для лёгких задач, а некоторые оптимизированы для локального запуска с повышенной приватностью и эффективностью. Если использовать одну модель по умолчанию, компания рискует либо переплачивать, либо терять в качестве; если же маршрутизацию настраивать вручную, это превращается в дополнительную интеграционную работу, замедляющую развёртывание.

Nvidia NeMo Switchyard — библиотека с открытым исходным кодом для маршрутизации моделей в ИИ-агентах. Технология автоматически направляет запросы к наиболее подходящей и эффективной модели для каждого шага агентного рабочего процесса, исходя из конкретных потребностей. Разработчики агентных приложений могут настраивать или изменять маршрутизатор с разными алгоритмами маршрутизации в зависимости от приоритетов — качества, задержки или стоимости. В рамках системы моделей компании могут создавать мощных ИИ-агентов с улучшенной токеномикой.

Внутренние тесты Nvidia показывают, что NeMo Switchyard сохраняет точность на уровне передовых моделей, снижая при этом стоимость выполнения задачи почти втрое по сравнению с использованием только Opus 4.8.

Внутренние тесты Nvidia показывают, что NeMo Switchyard сохраняет точность на уровне передовых моделей, снижая стоимость выполнения задачи почти втрое по сравнению с использованием только Opus 4.8.

Nvidia сотрудничает с партнёрами по всей экосистеме ИИ, чтобы внедрить умную маршрутизацию моделей в инструменты и платформы, которыми уже пользуются разработчики.

  • Boomi: протестировала Switchyard по пяти критериям маршрутизации, достигнув 100% точности доменной маршрутизации, направив 59% трафика на дообученную модель, работающую в 5 раз быстрее, и снизив задержку на последующих шагах на 21%.
  • Cadence: повысила эффективность на 9,9%, используя ChipStack AI Super Agent для сценария формальной верификации.
  • Classmethod: использует NeMo Switchyard во внутренних рабочих нагрузках opencode и Fireworks; первичное тестирование показало снижение затрат на 27% при сохранении качества.
  • Cognition: интегрировала многоступенчатый маршрутизатор NeMo Switchyard в Devin Desktop для внутреннего использования Nvidia, достигнув производительности, близкой к передовым моделям, на бенчмарке FrontierCode Main, снизив при этом среднюю стоимость на 28% по сравнению с маршрутизацией всех запросов на одну флагманскую модель.
  • Kong: обеспечивает маршрутизацию через NeMo Switchyard непосредственно в Kong AI Gateway.
  • LangChain: с помощью NeMo Switchyard добилась снижения затрат на 74% в 145 многошаговых задачах Deep Agents, направляя на флагманскую модель лишь 7% запросов при снижении точности на 6%.
  • LiteLLM: добавляет NeMo Switchyard как плагин к своему proxy-слою, чтобы разработчики могли получить преимущества без изменения существующего стека.
  • Nous Research: интегрировала NeMo Switchyard в Hermes, предоставив разработчикам простую в настройке систему маршрутизации для повышения эффективности агентов.
  • Ramp: с помощью NeMo Switchyard добилась производительности флагманской модели при снижении затрат на 58% и времени выполнения на 33% в тесте Ramp SWE-Bench.
  • Siemens: проводит тестирование для повышения эффективности своего Fuse EDA AI Agent.

Nemotron 3.5 Lightning доступна на Hugging Face, ModelScope, OpenRouter и build.nvidia.com в виде микросервиса Nvidia NIM, а также через широкую экосистему облачных партнёров Nvidia, платформ дообучения, инференса и облачных провайдеров. NeMo Switchyard доступна на GitHub, поддержка в партнёрских платформах появится в ближайшее время.