Meta Superintelligence Labs представила Muse Glimmer — новую модель, веса которой выложены в открытый доступ по лицензии Apache 2.0.
Muse Glimmer — модель на 30 миллиардов параметров, оптимизированная для постоянно работающих локальных агентов. Она достаточно компактна, чтобы запускаться на Mac или PC с одной потребительской видеокартой, что открывает применение в локальных агентах, вызове функций, локальном кодинге и оценке качества по схеме LLM-as-a-judge. По заявлению разработчиков, Muse Glimmer показывает сильные результаты на ключевых агентных задачах и бенчмарках по сравнению с ведущими моделями своего размерного класса.
Базовые модели уже достигли впечатляющих возможностей в рассуждениях, генерации кода и использовании инструментов, однако большинство развёртываний до сих пор зависит от облачной инфраструктуры и доступа к сети. Локальный запуск позволяет использовать AI в любом месте и в любое время, с подключением к интернету или без него. Такой подход становится всё более реалистичным: open source сообщество показало, что модели меньшего размера при правильном обучении способны приближаться к результатам передовых моделей на узких задачах. Muse Glimmer создана именно для таких локальных сценариев.
Продолжая традицию публикации фундаментальных исследований в области AI, Meta выложила открытые веса Muse Glimmer на Hugging Face, а также подготовила документацию для разработчиков, чтобы упростить создание и запуск собственных агентов. Muse Glimmer рассчитана на работу с инструментами, которые разработчики уже используют. В ближайшие дни появятся оптимизированные интеграции для llama.cpp, MLX и ExecuTorch — путь от загрузки модели до работающего агента должен занимать считанные минуты.
Как обучали Muse Glimmer
Агент, который управляет расписанием, готовит черновики сообщений, организует файлы и подстраивается под стиль работы пользователя, нуждается в глубоком доступе к персональному контексту. Кроме того, ему требуется сразу несколько согласованных способностей: выполнение длительных цепочек действий, точный вызов инструментов, мультимодальное понимание, память на длинном контексте и следование инструкциям.
Muse Glimmer спроектирована с учётом баланса между возможностями модели и ограничениями по памяти и вычислениям на локальном оборудовании. Для этого потребовалась компактная архитектура, новая методика дистилляции, переносящая агентные способности рассуждения от значительно более крупной модели-учителя, а также оптимизации инференса, включая квантование, чтобы уложиться в требования по задержке. Обучение прошло в три этапа:
- Предобучение. Muse Glimmer обучалась на выходных данных модели Muse Spark с помощью дистилляции по логитам, используя схожий с учителем набор данных.
- Промежуточное обучение. Модель дообучали на более длинном контексте, с большим количеством агентных данных и более развёрнутыми цепочками рассуждений, вместе с органическими данными.
- Финальное обучение. Supervised fine-tuning объединили с on-policy дистилляцией и обучением с подкреплением в общих, логических, кодовых и агентных доменах.
Muse Glimmer прошла оценку в соответствии со стандартами Advanced AI Scaling Framework Meta и проверена по всем релевантным категориям перед публикацией открытых весов.
Модель для агентов: что умеет Muse Glimmer
Создание эффективных агентов требует совместной работы нескольких ключевых способностей для достижения целей пользователя. Muse Glimmer обучена и протестирована по каждому из следующих направлений:
- Сквозное выполнение агентных задач. Muse Glimmer демонстрирует высокий процент успешного решения полных задач на бенчмарках DeepSearch QA, MCP-Atlas, 𝛕-Bench и SWE-Bench, которые измеряют способность работать в рамках скаффолдов, писать и отлаживать код, а также доводить многошаговые запросы до конца.
- Надёжное использование инструментов. Модель обрабатывает широкий спектр вызовов функций, точно соблюдая схемы вызова на протяжении длинных сценариев.
- Многошаговые рассуждения. Muse Glimmer выстраивает цепочки рассуждений на длинных горизонтах, сохраняя целостность плана в сложных и продолжительных сценариях.
- Восстановление после сбоев. Если вызов инструмента завершается ошибкой или возвращает неожиданный результат, модель обучена диагностировать проблему и повторить попытку, а не останавливаться.
- Мультимодальный ввод и рассуждения. Благодаря отдельному энкодеру восприятия модель принимает чередующиеся текст и изображения. Это позволяет агентам интерпретировать скриншоты, графики и документы вместе с текстом диалога.
- Совместимость со скаффолдами. Muse Glimmer работает с OpenClaw и другими паттернами агентной оркестрации.
- Управляемая глубина рассуждений. Muse Glimmer поддерживает разные уровни интенсивности рассуждений, чтобы выбирать баланс между качеством и скоростью.
- Многоязычность. Модель обучена на данных более чем 100 языков.
Производительность
Muse Glimmer протестировали на широком наборе бенчмарков, охватывающих способности, необходимые для эффективного автономного поведения агента. В сравнении с Gemma4-31B и Qwen3.6-27B модель показывает сильные результаты для своего размерного класса на нескольких широко используемых бенчмарках LLM.

Подробности методологии оценки доступны в отдельном отчёте.
Оптимизация для локального развёртывания
Локальный агент по-настоящему полезен только тогда, когда он работает достаточно быстро, чтобы ощущаться отзывчивым. Агент, который тратит минуты на ответ или планирование следующего шага, нарушает рабочий процесс. Для практичной скорости работы на потребительском оборудовании без потери качества применили два вида оптимизации.
Размещение модели на устройстве
В полной точности модель на 30 миллиардов параметров потребовала бы более 55 ГБ памяти — намного больше, чем предлагает любая потребительская видеокарта. Веса модели сжимают методами квантования до точности примерно 4 бита, уменьшая размер языковой модели до менее 20 ГБ. Это оставляет достаточно запаса для рабочей памяти модели (её "KV-кэша"), энкодера восприятия для понимания изображений и черновика для спекулятивного декодирования, работающих одновременно в пределах 24 ГБ или 32 ГБ видеопамяти. Проверка показала, что такое сжатие вносит минимальную деградацию или не влияет на качество выполнения агентных задач вовсе.

Ускорение генерации через спекулятивное декодирование
Языковые модели обычно генерируют текст токен за токеном, что может ощущаться медленным при длинных цепочках рассуждений или многошаговых вызовах инструментов. Muse Glimmer поставляется с легковесной моделью-"черновиком" на основе DFlash — небольшой вспомогательной сетью, которая предлагает сразу целые блоки токенов. Основная модель затем проверяет эти предложения параллельно, принимая верные токены и исправляя неверные. Эта техника позволяет Muse Glimmer генерировать текст значительно быстрее стандартной поочерёдной генерации токенов, сохраняя идентичное качество вывода. В релизе доступны квантованные версии черновика для снижения нагрузки на память.
Результат
Скорость модели K-Quant-17GB совместно с квантованным черновиком DFlash измеряли на MacBook M4-Max, M5-Max и на RTX-5090. Скорость достаточна для плавного диалога и взаимодействия с агентом в реальном времени, полностью работающего на устройстве пользователя.

Как начать работу с Muse Glimmer
Muse Glimmer уже доступна — веса можно загрузить на Hugging Face. В ближайшие дни модель можно будет запускать локально через партнёров Ollama, LM Studio и Unsloth, развёртывать с помощью edge-фреймворков llama.cpp, ExecuTorch и MLX, обслуживать в промышленных масштабах через vLLM и SGLang, либо быстро подключить через Together AI, Fireworks AI и OpenRouter. Модель также можно кастомизировать под собственные задачи с помощью функции обучения TorchTitan из PyTorch.
Meta работает с партнёрами, включая AMD, Arm, Dell, Intel и NVIDIA, над оптимизацией производительности на разных устройствах. Также опубликована документация, которая должна помочь разработчикам начать работу и использовать Muse Glimmer ответственно, включая рекомендации по настройке кастомных скаффолдов для быстрого старта в создании и развёртывании персональных агентов. Подробности и ресурсы для разработки доступны в Meta AI Developer Center.
Релиз продолжает многолетнюю практику Meta по открытым исследованиям в области AI, расширяя её на агентный AI и давая разработчикам доступ к локальным агентным возможностям. Компания заявляет, что рассчитывает на отклик сообщества и с интересом ждёт, что разработчики создадут на основе этой модели с открытыми весами.