Четыре с половиной года назад команда Modular сделала ставку: ИИ не будет вечно работать на одном типе кремния, а программный стек придётся перестраивать под мир гетерогенного железа и всё более сложных ИИ-нагрузок.

На keynote ModCon этим утром показали, во что превратилась эта ставка. Modular Platform достигла продакшн-готовности, обрабатывает миллиарды токенов в минуту и питает реальные корпоративные развёртывания. Часть платформы теперь открывается для экосистемы, расширяется поддержка совершенно новых классов железа, а к проекту присоединяются крупные индустриальные партнёры.

Modular и Qualcomm анонсировали следующее:

  • Mojo 1.0 полностью открыт под лицензией Apache 2.0.
  • Modular Cloud доступен публично и уже обслуживает крупных клиентов вроде MiniMax.
  • Modular Platform теперь поддерживает AWS Trainium, Google TPU и ускорители Qualcomm Cloud AI 100 и Qualcomm Dragonfly наряду с CPU и GPU. Подробности о работе над Qualcomm Dragonfly — в отдельном посте.
  • В Mojo появится нативная поддержка Windows благодаря сотрудничеству с командой Microsoft Windows.
  • Лицензия MAX больше не содержит ограничений на использование устройств: MAX станет source-available с программой открытого альянса, чтобы более широкая экосистема могла развивать платформу совместно.

Гетерогенные вычисления стали реальностью, и теперь у них есть единая открытая программная платформа.

Mojo 🔥 теперь открытый проект

На прошлой неделе было объявлено, что Mojo достиг версии 1.0, предоставив разработчикам стабильную, готовую к продакшену основу для долгосрочной работы. Среди новых возможностей 1.0 главное — гарантия стабильности: код, написанный сегодня, не сломается под ногами в будущем.

Теперь сделан ещё один шаг: весь язык Mojo открыт под неограничивающей лицензией Apache 2.0, а значит компилятор и весь инструментарий полностью открыты. Язык можно расширять, переносить на новые платформы и строить поверх него любые приложения. Это продолжение постепенного открытия стека, начавшегося со стандартной библиотеки Mojo в 2024 году и ядер MAX в 2025-м, и процесс будет продолжаться. Подробнее о Mojo и участии в проекте — на mojolang.org.

Поддержка Windows для Mojo

Mojo годами поддерживал macOS и Linux, а разработчики на Windows могли пользоваться языком через WSL. Нативная поддержка Windows всегда была одним из самых частых запросов от сообщества.

Миллионы разработчиков ежедневно пишут код под Windows для огромного спектра приложений и задач. В Modular считают, что Mojo способен оказать значимое влияние на эту экосистему. Правильная реализация поддержки Windows требует глубокой экспертизы в платформе, поэтому особенно ценно, что команда Microsoft Windows видит ту же возможность — и стороны работают над этим вместе.

«Мы рады видеть, что Mojo приходит на Windows, и тем возможностям, которые это открывает для разработчиков, работающих на стыке системного программирования и ИИ. Миллионы разработчиков создают продукты на Windows каждый день, и мы стремимся дать им доступ к нужным инструментам и технологиям на выбранной ими платформе.»

— Логан Айер, вице-президент по платформе Windows и разработчикам

Представляем Modular Cloud

Modular Cloud — это место, где весь стек Modular собирается в единый продакшн-сервис. Он даёт разработчикам прямой доступ к ведущей в индустрии производительности инференса Modular, скрывая при этом сложность развёртывания, оптимизации и эксплуатации моделей на гетерогенной инфраструктуре.

Modular Cloud находится в общем доступе на console.modular.com и обслуживает популярные open source модели на стеке Modular через общие эндпоинты и выделенные развёртывания. Общие эндпоинты совместимы с OpenAI API и работают по модели оплаты за токены, а выделенные развёртывания запускаются на инфраструктуре Modular или собственных мощностях клиента в изолированных зарезервированных инстансах.

Modular Cloud уже несколько месяцев тихо обслуживал трафик OpenRouter под именем ModelRun, и его эндпоинты стабильно входили в число лидеров платформы по задержке и пропускной способности на реальном продакшн-трафике. Независимая аналитическая компания Artificial Analysis подтверждает эти результаты.

MiniMax

MiniMax — флагманский корпоративный клиент Modular Cloud, использующий M3 на выделенном развёртывании Modular, которое обслуживает продакшн-трафик со скоростью в миллиарды токенов в минуту.

Эффективное обслуживание M3 в таком масштабе представляет собой нетривиальную системную задачу. Модель сочетает контекстное окно на 1 миллион токенов, нативную мультимодальность и MiniMax Sparse Attention (MSA) — новую архитектуру разреженного внимания, которая избирательно обращается к релевантным блокам KV, снижая требуемые вычисления по мере роста контекста.

Для достижения передовой производительности потребовалась оптимизация на всех уровнях стека: нативная реализация M3 в MAX, разработка и настройка специализированных ядер MSA, а также оптимизация развёртывания под реальные паттерны трафика MiniMax.

За пределами GPU: Trainium, TPU и Dragonfly

Modular Cloud уже обслуживает продакшн-нагрузки на GPU NVIDIA и AMD. Теперь поддержка железа расширяется за пределы GPU и включает специализированные ИИ-ускорители — гораздо более требовательное испытание переносимости платформы.

Добавлена поддержка AWS Trainium, Google TPU, Qualcomm Cloud AI 100 Ultra и Qualcomm Dragonfly. Каждое из этих решений работает через единую Modular Platform с одними и теми же API моделирования, рабочими процессами обслуживания, языком программирования и базовыми абстракциями. Разработчики могут написать модель один раз и перенести её на совершенно другие архитектуры железа без перестройки программного стека вокруг неё.

Не менее важно, что каждая из этих платформ была введена в строй с затратами инженерных усилий, составляющими лишь малую долю от традиционно требуемых для запуска нового ИИ-железа — сокращение более чем в 10 раз.

В ближайшие месяцы новые аппаратные платформы будут выведены в продакшн и станут доступны через Modular Cloud.

MAX: общая основа, создаваемая вместе с экосистемой

Инновации в области ИИ-железа набирают темп, но хорошее железо имеет значение только тогда, когда разработчики могут им пользоваться. Слишком много инноваций до сих пор заперто внутри программных стеков, написанных под одну архитектуру. Индустрии нужна общая программная основа: написать модель один раз и получить доступ к любому ускорителю, выбирать железо исходя из производительности и экономики, а не из того, какой стек его поддерживает, и позволить производителям конкурировать по существу возможностей своего кремния. Именно такой видят Modular Platform в компании.

Присоединение к Qualcomm укрепляет эту цель. Modular Platform продолжит поддерживать и оптимизировать широкий спектр железа, включая решения, напрямую конкурирующие с платформами Qualcomm Technologies. Возможности, открывающиеся перед экосистемой, значительно масштабнее дорожной карты любого отдельного поставщика, а фундамент работает только тогда, когда на нём может стоять каждый.

Для построения такой основы запускаются две важные инициативы:

Открытие MAX. Модель лицензирования MAX меняется, а доступ к исходному коду расширяется, чтобы разработчики, предприятия, производители железа и партнёры могли строить на платформе, расширять её и вносить вклад обратно.

Программа альянса для экосистемы. Ведётся работа над индустриальной программой альянса, охватывающей производителей железа, поставщиков моделей, облачные компании и операторов дата-центров. Цель — дать партнёрам прямую роль в интеграции MAX, оптимизации под их платформы и определении дальнейшего пути развития Modular Platform.

Компания HTEC уже показала, как это работает на практике. Её инженеры самостоятельно реализовали поддержку Google TPU на Modular Platform всего за несколько месяцев силами небольшой команды, при этом Modular выступала в поддерживающей роли, а не вела интеграцию сама. Это явное подтверждение задуманного: экосистема способна самостоятельно расширять созданную основу.

Другие стартапы — производители железа — видят на рынке ту же потребность. Один из них — d-Matrix:

«Общая приверженность d-Matrix и Modular гетерогенным вычислениям основана на взаимной поддержке открытых стандартов. По мере вхождения в эпоху дезагрегированных гетерогенных вычислений открытые стандарты способны ускорить развёртывание GPU, CPU и XPU, работающих совместно для повышения эффективности в масштабе, и именно поэтому наше партнёрство так органично.»

— Сид Шет, основатель и CEO d-Matrix

Попробовать уже сегодня

Всё необходимое для начала работы с открытым Mojo 1.0 доступно на mojolang.org. Modular Cloud работает на console.modular.com. Участники ModCon в Сан-Франциско смогут узнать больше на технических докладах во второй половине дня.

ИИ развивается слишком быстро, чтобы каждая компания могла раз за разом перестраивать одну и ту же инфраструктуру под ним. Модели становятся крупнее, обслуживание — более распределённым, а железо — более разнородным. Открытые горизонтальные платформы уже не раз меняли расстановку сил в индустриях, но только когда экосистема объединялась для их создания. Приглашение к сотрудничеству открыто для всех, кто работает с железом, моделями, инфраструктурой или приложениями — связаться с командой можно по адресу alliance@modular.com.