Как работает Microsoft-Decision-1

Microsoft-Decision-1 построена на основе пост-обучения Qwen3.5-9B для быстрого одноходового скоринга решений, и вскоре будет перестроена на других моделях, включая Microsoft AI (MAI) и OpenAI. Когда дан фиксированный набор вариантов ответов, модель выдаёт откалиброванный балл вероятности для каждого. Поддерживает да/нет, множественный выбор, рейтинговые опции, а также оценку ответов AI и действий агентов по рубрикам — всё через простой вызов структурированного API.

Чтобы построить надёжную модель принятия решений, пришлось решить несколько задач:

1. Скорость

Каждое решение добавляет задержку, особенно если один шаг зависит от другого. Например, если прибавить по 100 миллисекунд к каждому из 20 последовательных решений, к общей длительности рабочего процесса добавится две секунды.

Латентность P50 для Microsoft-Decision-1 примерно в 35 раз быстрее, чем у GPT-6 Sol.

2. Качество, которое обобщается

Легко переобучить модель на одном бенчмарке или на одном типе задачи принятия решений. Нужно знать, сохраняется ли качество на различные задачи, на которых модель не была обучена. По этой причине Microsoft-Decision-1 оценивали на десятках бенчмарков, скрытых от обучения, охватывающих маршрутизацию, ранжирование, длинный контекст, многоязычные и распределённые задачи, рассуждения и безопасность. Также взяли несколько топовых моделей с популярного открытого лидерборда JevBench и протестировали их на 36 дополнительных публичных и приватных бенчмарках. Microsoft-Decision-1 показала лучший результат на этих более широких наборах бенчмарков, демонстрируя сильное обобщение.

3. Робастность

Эквивалентные входные данные должны давать эквивалентные решения. В production состояния и инструкции перефразируют, описания опций меняют, выбор переупорядочивают, ключи меняют, и появляется безобидный шум форматирования. Ничто из этого не должно существенно менять решение.

Модель проверили, изменив один и тот же запрос восьмью способами, и измерили, как часто решение меняется. Microsoft-Decision-1 меняет своё решение на 1,3% возмущений в среднем, и на нулевых возмущениях, когда описания опций перефразируются или когда опции переворачиваются или перетасовываются.

4. Калибровка вероятности и доверия

Сама вероятность — часть API, не просто оценка ранжирования. Приложения используют уверенность, чтобы решить, действовать ли, отложить или попросить проверку, поэтому предсказание 90% должно быть верным примерно в девяти случаях из десяти на репрезентативных примерах.

5. Безопасность

Модель принятия решений должна распознавать вредоносные запросы без излишнего блокирования безопасных. Microsoft-Decision-1 протестировали на 5250 запросах на 11 бенчмарках, охватывающих вредоносный контент, попытки jailbreak и prompt injection, и обнаружили, что модель успешно отклоняет вредоносное поведение, сохраняя высокую полезность.

Примеры демонстрации

Классификация — ключевой вариант использования для моделей принятия решений. Посмотрите, насколько точно и быстро Microsoft-Decision-1 может категоризировать различные запросы по сравнению с GPT-6 Sol:

Как мы тестируем Microsoft-Decision-1 внутри

Вот несколько способов, которыми мы тестировали Microsoft-Decision-1 внутри, и ещё много будет.

Разметка данных

XBOX Research использовала Microsoft-Decision-1 для обработки более 10 000 открытых отзывов и комментариев из опросов, STEAM и Twitter/X и сортировки их в фиксированный набор тем, установленный исследователями, чтобы понять, что люди говорят о разных играх, запусках, трансляциях и прочем. Команда обнаружила, что Microsoft-Decision-1 конкурентна по качеству с GPT-6 Sol, работая при этом в 14 раз быстрее и в 200 раз дешевле.

Контроль качества

Команда Copilot измеряет качество чатов и агентных ответов. Тестирование показало, что Microsoft-Decision-1 конкурентна GPT5.6 Luna и быстрее в 100 раз.

Реагирование на инциденты

Дежурные инженеры используют AI для извлечения релевантных знаний для ответа на live инциденты в логах, системах тикетирования, звонках, сообщениях и других источниках данных. Microsoft-Decision-1 показала лучшие результаты и скорость, чем LLM для извлечения знаний.

Научные открытия

Microsoft Discovery использует адаптивное переплпланирование, где агент оценивает предыдущий эксперимент, пересматривает свой подход на основе оценок по рубрикам и повторяет до завершения целей. Microsoft-Decision-1 показала оценки в 46 раз более согласованными, чем оценки на основе LLM, при этом работая в три раза быстрее и обеспечивая почти четырёхкратное ускорение адаптивного переплпланирования.

Более быстрое и надёжное планирование может существенно повлиять на результаты долгосрочных научных экспериментов.

Это лишь небольшая горсть примеров. Есть гораздо больше потенциальных вариантов использования для Microsoft-Decision-1. Рассмотрите попробовать следующее:

  • Управление агентами: оценить предложенный следующий шаг агента и решить, продолжить, остановиться, повторить или передать модели, инструменту или человеку.
  • Маршрутизация моделей: оценить входящий запрос и выбрать лучшую модель для задачи на основе качества, стоимости и требований по латентности.
  • Решения на основе навыков: применить правила из навыка агента для выбора подходящего следующего действия без повторной обработки долгого списка инструкций.
  • Разметка данных: присвоить согласованные метки постам в соцсетях, отзывам клиентов и другим данным для анализа или обучения.
  • Судейство AI: оценить ответ, сгенерированный AI, по определённым критериям качества и решить, принять, переработать или отклонить его.
  • Анализ намерения: определить, что пользователь пытается сделать, и сопоставить его запрос с поддерживаемым намерением.
  • Маршрутизация реагирования на инциденты: классифицировать инцидент по типу и срочности, затем направить его соответствующей команде или рабочему процессу.
  • Валидация данных: проверить, соответствует ли входящие данные определённым требованиям, и решить, принять, отклонить или отметить его для проверки.
  • Рекомендации: выбрать наиболее релевантный элемент, предложение или следующее действие из набора кандидатов.
  • Релевантность поиска: оценить, насколько хорошо результат поиска соответствует запросу, и присвоить метку релевантности или приоритет.
  • Классификация и фильтрация контента: категоризировать контент по теме или политике и решить, отобразить, отфильтровать или отправить его на проверку.
  • Сканирование кода: оценить код по определённым критериям и отметить потенциальные дефекты или нарушения политики для проверки.
  • Скрининг безопасности и защиты: классифицировать запросы, выходные данные или предложенные действия по риску и решить, разрешить, заблокировать или расширить их.
  • Компьютерное и UI использование: выбрать следующее действие интерфейса из набора опций на основе текущего экрана и задачи.
  • Робототехника: выбрать между предопределёнными действиями робота на основе наблюдений, целей задачи и ограничений операционной системы.
  • Научные открытия: отсеять кандидатные гипотезы, соединения или эксперименты по определённым критериям и приоритизировать их для дальнейшей оценки.

Начало работы

Разработчики могут начать работу с Microsoft-Decision-1 прямо сейчас в Microsoft Foundry: https://ai.azure.com/catalog/models/Microsoft-Decision-1. Также можно начать через OpenRouter: https://openrouter.ai/microsoft/microsoft-decision-1.

Документация доступна здесь: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/use-foundry-models-microsoft-decision.

Цены

Входные токены стоят $0,042 USD за миллион токенов. Выходные токены — бесплатны.

Впереди

Теперь, когда agentive AI стала реальностью, видно, что стоимость играет большую роль в том, как люди решают использовать AI. И всё более важно выбрать правильную модель для правильной работы. С агентами, принимающими меры и оказывающими влияние в реальном мире, модели принятия решений могут помочь людям направлять и контролировать эти агенты в сложных средах.

Нам не терпится увидеть, что будут строить разработчики с Microsoft-Decision-1, и услышать их обратную связь. Продолжим выпускать обновления модели, включая добавление оценок и данных для дальнейшей оптимизации качества, доверия и стоимости.

Приложение: протестированные модели

Quyet-1.0-Large — https://huggingface.co/chinhnc/Quyet-1.0-Large
Surogate Rune 26B-A4B — https://huggingface.co/surogate/rune-26b-a4b-GGUF
GPT-6 Luna Decisions — https://developers.openai.com/api/docs/guides/decisions
deck-31B — https://github.com/krishna-gogineni-765/deck31b
H2O-Lightning-4B — https://huggingface.co/h2oai/h2o-lightning-4b
Strands-Decider 2B — https://github.com/strands-labs/strands-decider