Модель на 3 млрд параметров с открытыми весами и адаптивными политиками модерации сопоставима по качеству оценки безопасности текста с моделями, в 7 раз превышающими её по размеру, и задаёт новый уровень качества для мультимодальной модерации контента.

Shieldstral

«Продвигает ли этот контент насилие в отношении защищённой группы? Безопасно ли показывать это изображение несовершеннолетнему? Отказался ли ассистент выполнять запрос?»

На подобные вопросы приходится отвечать каждому продукту, использующему модели, — но правильный ответ зависит от продукта, аудитории и контекста. Один и тот же контент может быть приемлем для инструмента кибербезопасности и вреден для платформы психического здоровья. Большинство guardrail-моделей зашивают фиксированную таксономию категорий вреда прямо в веса, поэтому перенастройка под новый контекст развёртывания требует полного переобучения. А поскольку определения безопасности различаются между приложениями и доменами, единого «правильного» набора категорий изначально не существует.

Shieldstral устроена иначе: политика модерации формулируется как обычный вопрос на естественном языке прямо во время инференса, а модель возвращает калиброванную оценку безопасности. Переобучение не требуется, интерфейс единый для текста и изображений, а вердикт формируется из одного токена. Подробности — в техническом отчёте.

Как один из первых участников Open Secure AI Alliance вместе с NVIDIA и другими организациями, Mistral выпускает Shieldstral с открытыми весами под лицензией Apache 2.0. Скачать модель можно здесь.

Модерация как вопрос

Shieldstral формулирует модерацию контента как задачу бинарного ответа на вопрос. Каждый запрос состоит из трёх частей:

  • <Instruct> — контекст оценки, степень строгости и (опционально) определение того, что считается небезопасным контентом.

  • <Query> — единственный вопрос с ответом да/нет, например: «Продвигает ли этот контент физическое насилие?»

  • <Document> — оцениваемый контент: промпт, ответ, пара промпт-ответ или изображение с опциональным текстом.

Во время инференса модель считывает только логиты токенов yes и no и нормализует их через softmax в непрерывную оценку безопасности. Эта простая формулировка решает сразу несколько задач: объединяет классификацию промптов, модерацию ответов, детекцию отказов и детекцию токсичности в одну общую задачу; позволяет полностью хранить политики в промпте, так что один и тот же чекпоинт адаптируется к новым политикам прямо во время развёртывания.

Основные особенности

  • Высокая производительность — сопоставима или превосходит открытые guard-модели, в 7 раз превышающие её по размеру, по показателям безопасности текста, детекции отказов, адаптивности политик и мультимодальных бенчмарков.

  • Адаптивность и гибкость — единый интерфейс на естественном языке покрывает текст, изображения и связку текст+изображение для промптов, ответов и пар промпт-ответ. Политики задаются в виде произвольных запросов и перенастраиваются во время инференса без дообучения.

  • Компактность, обучение на разнородных источниках — модель на 3 млрд параметров работает на одном GPU с 16 ГБ памяти, обучена на реальных и синтетических данных с разными форматами разметки и таксономиями, объединёнными в единый фреймворк.

  • Непрерывная оценка безопасности — возвращает калиброванную вероятность yes/no за один проход вперёд, что позволяет устанавливать пороги или ранжировать по уверенности вместо использования дискретной метки.

  • Открытость — веса распространяются под лицензией Apache 2.0.

Бенчмарки

Shieldstral сравнивалась с открытыми guard-моделями, превышающими её по размеру до 7 раз, по четырём направлениям. Все оценочные выборки исключены из обучающих данных.

Безопасность текста Детекция отказов Адаптивность политик Мультимодальная безопасность

Как это устроено

Ключевая идея заключается в том, что небольшая модель способна превзойти гораздо более крупные, если данные подобраны правильно. Для этого пришлось решить четыре задачи:

Унификация разнородных данных. Публичные датасеты безопасности расходятся в таксономиях, метках и соглашениях по аннотированию — от бинарных флагов «безопасно/небезопасно» до детальных многометочных таксономий. Каждый датасет преобразуется в единый формат instruction–query–document с помощью отдельного процессора под каждый источник, а формулировки инструкций, запросов и разделителей промпт-ответ варьируются, чтобы модель обобщала на уровне смысла, а не переобучалась под конкретный стиль. Строгость также калибруется отдельно для каждого источника — строже для состязательных jailbreak-примеров, мягче для данных о качестве ответов, — чтобы модель усваивала калиброванные границы принятия решений. Это позволяет объединить источники, которые иначе были бы несовместимы.

Обучение различению, а не запоминанию. При обучении на фиксированном наборе меток политик модель учится классифицировать только эти заранее заданные политики, вместо того чтобы рассуждать о точных границах конкретной политики. Это мешает обобщению на новые политики. Вместо этого создаются наборы намеренно похожих, легко путаемых политик, а LLM просят переписать безопасный текст в контрастные пары: каждая переработка сконструирована так, чтобы нарушать одну политику, но не соседнюю с ней. Это учит модель различать, какую именно политику нарушает конкретный фрагмент контента, — навык, который переносится на неизвестные, определяемые пользователем политики во время инференса.

Опора на визуальные данные. Небезопасные изображения нельзя синтезировать с помощью LLM так, как это делается с текстом, поэтому визуальных данных о безопасности мало. Ограниченные датасеты модерации дополняются датасетами изображений общего назначения в качестве качественных негативных примеров, запросы модифицируются для расширения датасета, а каждая пара «изображение-запрос» фильтруется через vision-language реранкер, чтобы снизить количество неверно размеченных данных и галлюцинаций.

Объединение взаимодополняющих чекпоинтов. Модель дообучается с помощью LoRA, после чего через SLERP объединяются: чекпоинт, откалиброванный на публичных данных, чекпоинт с детальным различением политик на сгенерированных данных, и базовая instruct-модель. Такое объединение позволяет получить в одной модели одновременно общую калибровку политик и адаптивность к новым политикам, а следование инструкциям из базовой модели переносится на задачу модерации.

Forge. Shieldstral была полностью построена на Forge — платформе Mistral для обучения, выравнивания и оценки кастомных моделей. Forge взяла на себя управление инфраструктурой, шардинг данных и модели, метрики и логирование поверх современного распределённого обучения, что позволило команде сосредоточиться именно на данных — том, что и определяет качество модели безопасности.

Что дальше

Shieldstral — шаг в сторону модерации, которая адаптируется к контексту вместо того, чтобы навязывать каждому продукту одну застывшую таксономию. Команда продолжает работу над многоязычной поддержкой, устойчивостью к длинным документам и расширением мультимодальной безопасности — и рассчитывает увидеть, что сообщество построит на базе модели.

Mistral также открыта для найма новых сотрудников — вакансии доступны на странице карьеры.