Что такое модель принятия решений?
Модель принятия решений выполняет классификацию для определения, как должен действовать агент, на основе определённых вероятностей. Например, можно передать в модель сообщение от клиента (входные данные) и спросить, срочное ли оно и какая команда должна его обрабатывать. Модель вернёт типизированные ответы с вероятностями (выходные данные), которые код может использовать для маршрутизации билета, инициирования эскалации или передачи человеку. Это означает, что для агентных решений больше не обязательно требуется участие человека — агенты могут программно собирать контекст, принимать решения и выполнять действия по задачам или при необходимости передавать её человеку.
Конкретно в Cloudflare модель Clef тестируют в команде Threat Intelligence для классификации доменов веб-сайтов. Передав домен в Clef (с браузером), она быстро определяет категории, к которым он относится — например, с вероятностью 95% это мода, 85% — электронная коммерция, менее 1% — фишинг и так далее. Классификация заняла 2.2 секунды, чтобы получить, отрендерить и классифицировать сайт. Для сравнения, самая быстрая общепроизводственная модель gpt-oss-120b потребовала 4.7 секунды в том же workflow и вернула только две классификации. Экономия в 2x по задержке и объёму результатов помогает улучшить рабочие процессы анализа угроз и быстрее выявлять вредоносные или легитимные домены. Обобщая на любой случай, когда нужно быстро принимать программные решения, открываются мощные агентные workflow, способные автономно принимать решения, рассуждать и действовать.
В музыкальной теории ключ (clef) — это символ, помещаемый в начало нотного стана и присваивающий определённые названия нот строкам и промежуткам. Модель принятия решений аналогична музыкальному ключу, потому что она помогает определить область контекста и последующие ноты (действия), которые за ней следуют. Clef выбрана как название семейства моделей, потому что она служит похожим целям, а CF намекает на Cloudflare.
Чем Clef отличается от других моделей принятия решений?
Хотя рынок всё более насыщается моделями принятия решений, Clef имеет уникальные свойства, которые вызывают желание выпустить её публике. Во-первых, она имеет энкодер зрения, поэтому способна принимать изображения и классифицировать визуальное содержимое. Это отличается от Jev, которая на данный момент выполняет только текстовую классификацию. Во-вторых, модель имеет контекстное окно 64k (в сравнении с 32k у Jev), что позволяет пользователям вместить больше входного состояния для классификации моделью.
В-третьих, модель точна и мощна, набирая конкурентные баллы против других моделей принятия решений на рынке по различным ориентирам качества. Ниже приведены некоторые оценки, которые важны для принятия решений, как определено в Jev Decision Index, и мы оценили некоторые из более популярных моделей на рынке. Посмотрите таблицу ниже для ориентиров или посмотрите оценки на сайте демонстрации живого решения:
Ориентир |
DiffusionGemma Jev |
|||||
BFCL · case exact |
98.47 |
98.76 |
95.75 |
96.52 |
94.51 |
38.13 |
ToolRet · nDCG@10 |
69.19 |
66.43 |
65.28 |
61.21 |
64.26 |
12.69 |
API-Bank · accuracy |
91.93 |
93.11 |
88.19 |
83.66 |
56.30 |
11.41 |
Home appliances · case exact |
82.95 |
97.73 |
52.27 |
42.05 |
25.00 |
0.00 |
When2Call · accuracy |
72.37 |
65.58 |
80.97 |
75.44 |
49.62 |
11.94 |
BANKING77 · macro-F1 |
94.20 |
90.93 |
79.74 |
74.28 |
84.83 |
14.29 |
CLINC150+OOS · macro-F1 |
97.43 |
66.77 |
89.27 |
83.49 |
79.03 |
3.19 |
BRIGHT · nDCG@10 |
45.91 |
39.26 |
47.52 |
42.94 |
38.53 |
19.90 |
Amazon ESCI · macro-F1 |
57.48 |
57.39 |
55.21 |
53.37 |
49.22 |
24.40 |
PhishNChips · accuracy |
79.60 |
75.05 |
62.55 |
85.35 |
50.75 |
50.15 |
Также мы провели ориентиры по собственному набору оценок Typesafe, и модели Clef показали хорошие результаты, превосходя Jev в 3 из 4 областей. Примечательно, что Clef-flash работает исключительно хорошо, учитывая, насколько он быстрее.
Workflow |
|||
Обработка счетов |
64.7 |
57.1 |
61.8 |
Обслуживание клиентов |
76.3 |
77 |
76.0 |
Инциденты безопасности |
62.9 |
61.7 |
61.7 |
Наблюдение за трассировкой агента |
68.5 |
69.8 |
71.6 |
На 43 ориентирах оценки, которые мы запустили, модели Clef превосходят модели принятия решений по задержке (кроме Laya, которая очень быстра, но жертвует качеством в приведённых выше ориентирах):
Ориентир |
DiffusionGemma Jev |
|||||
Медианная задержка · мс |
209.3 |
38.8 |
524.1 |
84.4 |
51.4 |
5.8 |
Задержка p95 · мс |
238.6 |
122.4 |
536.0 |
211.2 |
187.9 |
222.5 |
Помимо преимуществ в задержке от самой модели, модели Clef размещены на Workers AI. Поскольку они размещены на инфраструктуре Cloudflare, можно использовать преимущества GPU на краю сети, что приводит к низкой сетевой задержке и более быстрым решениям. Это означает, что можно поместить Clef в горячий путь для агентов, чтобы принимать решения, и объединить её с одной из LLM на Workers AI для выполнения действий.
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": {
"urgent": { "type": "bool", "instructions": "Is this support request urgent?" },
"team": {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Payments, invoices, and refunds",
"technical": "Outages, errors, and configuration",
"sales": "Plans and upgrades"
}
},
"severity": {
"type": "score",
"instructions": "How severe is the customer impact?",
"criteria": ["No impact", "Minor", "Major", "Critical"]
}
}
}'
Clef также выдаёт строго типизированные выходные данные, подобные Jev, и полностью совместима по API, поэтому можно легко выполнить переход. Большая модель Clef — это мощная модель точности, в то время как модель Clef-Flash хороша для решений, критичных по задержкам. Модели готовы к использованию на предприятии с гарантией, что не читаем, не храним и не обучаемся на запросах или ответах (если не хотите использовать продукт дообучения, который рассматривается ниже). Можно начать работу с моделями Clef сегодня, начиная с документации разработчика или экспериментировать с моделью с открытым исходным кодом на репозитории Hugging Face.
Если нужна помощь в настройке Clef для конкретной рабочей нагрузки, предлагается также служба дообучения — сначала как партнёрство с передовыми инженерами (FDE), а затем как самостоятельная платформа дообучения для клиентов для обучения и повторного развёртывания модели на Cloudflare.
Как мы обучали Clef
На той же неделе, когда вышла Jev, опубликовали об экспериментах с собственной гомогенной моделью принятия решений. Демонстрация показывает, как адаптировали модель DiffusionGemma для вывода детерминированных вероятностей путём раскрытия logprobs, генерируемых большой языковой моделью. Начальный подход строился на независимых исследованиях Matt Mastracci, активного в ML-сообществе с обменом новыми идеями и pull request в vLLM engine для поддержки DiffusionGemma.
Clef строится на этой концепции, но использует другую базовую модель в качестве основы. Используется Qwen как базовая модель, которую пост-обучили для случаев использования моделей принятия решений. Во время инференса Clef использует Qwen для прохода только префиксации, затем параллельно оценивает действительные варианты схемы. Шаг решения является неавторегрессивным, поэтому нет промежуточного текста для генерации токена за токеном, что делает Clef значительно быстрее, чем авторегрессивные LLM. Вместо создания промежуточного текста для получения структурированных ответов Clef и Clef-flash получают варианты схемы непосредственно из внутренних представлений основы. Такой подход полагается на специализированный двухэтапный процесс маршрутизации внимания: каждый действительный вариант извлекает контекст, релевантный подсказке, позволяя отдельным параметрам поля перекрёстно посещать друг друга и назад к исходной полезной нагрузке перед оценкой. Используя лексический приоритет, модель сохраняет семантическое намерение во всех вариантах. В конце концов, архитектура объединяет маршрутизацию доказательств, специфичных для опций, совместное перекрёстное внимание полей и оценку, привязанную схемой.
Заморозив Qwen3.8-27B для Clef и Qwen3.5-9B для Clef-flash, совместно оптимизировали головку маршрутизации с адаптерами низкого ранга (rank-256). Пост-обучение использует сглаженную перекрёстную энтропию для действительных выходов схемы в паре с потерей Brier для уточнения калибровки вероятности. Это обучение использует собственные внутренние синтетические датасеты, меняющие порядки полей, подсказки и структуры схемы. Также разработали Reinforcement Learning for Calibrated Decisions (RLCD) в качестве вторичной цели оптимизации, предоставляющей частичный кредит смежным порядковым выборам, награждающей полностью точные выходные записи и применяющей штраф за ссылку для предотвращения сдвига распределения, давая лучшую точность и обобщение.
Это означает, что удалось достичь нескольких инновационных моментов с Clef: улучшена точность классификации модели, ограничена только выводом вероятности вместо генерации текста и сделана быстрее, чем Jev и базовые модели Qwen.
Как дообучение может расширить возможности Clef
Услышали много внутренних вариантов использования, требующих дообучения модели Clef для встраивания в агентные workflow в Cloudflare. Например, внутренние команды хотят модели-классификатора для оценки запросов доверия и безопасности, помощи в сортировке запросов поддержки Cloudflare или даже встраивания в продукты ботов для определения, хорош ли краулер или плох.
Эти варианты использования невероятно специфичны, и в течение многих лет было собрано помеченные решения, которые можно было использовать для обучения конкретного классификатора. При дообучении модели, возможно, пожертвует некоторой универсальной производительностью в обмен на более высокую точность в конкретном домене. Поскольку Cloudflare имеет более 15 лет данных сети в разных доменах, можно дообучить модель для подбора этих конкретных вариантов использования, которые точнее и быстрее, чем универсальная модель Clef. Уже работаем с внутренними командами, чтобы понять, как можно пост-обучить Clef для создания мощных ML-моделей, повышающих влияние и улучшающих workflow по всей Cloudflare. Эти внутренние команды и варианты использования — это следующая область нашей новой команды FDE дообучения и основа продукта подкрепления (RL).
Наша новая служба RL
Предлагается служба для помощи клиентам в дообучении Clef для их workload с прямым участием FDE команды. Из этого изучат опыт использования для создания самостоятельной платформы, которую могут использовать клиенты для захвата данных, дообучения и повторного развёртывания модели на Cloudflare.
Это на самом деле долгое время — были построены примитивы платформы AI, где можно было создавать пользовательский продукт RL. Интерес к Jev показывает необходимость в быстрой, маленькой, специфической классификационной модели, и выбрал это для ниши в начале экспериментов с среда RL.
Для этого используются примитивы, которые уже построены на платформе Cloudflare:
- Cloudflare AI Gateway — проходит весь трафик AI через AI Gateway и автоматически создаёт датасет запросов для вашего случая использования
- Cloudflare Workers AI — создаёт развёртывания по базовой модели Clef
- Cloudflare Containers — sandbox RL для оценки и повтора действий агента
- [НОВОЕ] Trainer — обновляет веса дообученной модели Clef
- Cloudflare Workers AI + BYO Model — повторное развёртывание дообученной модели на Workers AI
Это объединяет несколько работающих фрагментов платформы AI, над которыми работали, включая AI Gateway, который захватывает трафик AI для использования собственных данных запроса/ответа, Containers для RL sandbox и работу Bring Your Own Model (Cog) Workers AI, прогрессирующую с момента приобретения Replicate.
Попробуй сегодня
Удалось запустить первую модель ML, обученную Cloudflare, из команды Workers AI сегодня. Всё ещё на ранней стадии и множество улучшений впереди, но это замечательная демонстрация тяжёлой работы на команде платформы AI. Убеждены, что Clef способна нарушить способ использования агентов, что естественно вписывается в миссию Cloudflare быть облаком агентов.
Если есть конкретные варианты использования и уже клиент этих продуктов — хотели бы поговорить и стать партнёром дизайна в экспериментах в этом пространстве.
Попробуй модели Clef, размещённые на Workers AI, загрузи веса на Hugging Face, если хочешь исследовать самостоятельно, и свяжись, если есть случаи дообучения, в которых хочешь помочь.
ML команда растёт по влиянию, от оптимизации моделей к исследованию обучения моделей. Если заинтересован в присоединении к миссии, посмотри открытые вакансии.