Shieldstral 1.0 3B: лёгкий модератор контента от Mistral с политикой в промпте

Mistral AI представила Shieldstral 1.0 3B — открытый мультимодальный классификатор безопасности с весами под Apache 2.0. Его ключевая особенность — политика модерации задаётся текстом в промпте на этапе инференса, а не зашита в веса модели. Это позволяет адаптировать модерацию под новый контекст без переобучения: один и тот же контент может быть приемлем на платформе кибербезопасности и вреден для приложения о ментальном здоровье.

Модерация как бинарный вопрос

Большинство guardrail-моделей зашивают список категорий вреда в веса. Перенацелить такую модель на новый сценарий — значит переобучать её заново. Shieldstral инвертирует подход: оператор формулирует политику как один вопрос «да/нет» на естественном языке, а модель за один прямой проход возвращает калиброванный score безопасности.

На инференсе модель разворачивает эмбеддинги только к токенам yes и no и нормализует их через softmax в непрерывную оценку с порогом τ=0.5. Это сводит классификацию промптов, модерацию ответов, детекцию отказов и определение токсичности к одной задаче.

Промпт состоит из трёх полей:

  • <Instruct> — контекст оценки и строгость;
  • <Query> — политика, сформулированная как один вопрос «да/нет»;
  • <Document> — промпт, ответ, пара «промпт-ответ» или изображение с текстом.

Рекомендация Mistral — одна политика на вызов. Для широкого вердикта «безопасно/небезопасно» категории перечисляются в <Instruct>, а в <Query> задаётся один общий вопрос.

Данные вместо масштаба

Заявленное преимущество достигается данными, а не размером модели. Shieldstral обучался на 54,1 млн сэмплов: 45,2 млн открытых текстовых, 4,4 млн синтетических контрастивных текстовых и 4,5 млн мультимодальных. Шаблонный слой унификации приводит каждый датасет к единому формату «инструкция-вопрос-документ» через отдельные процессоры с рандомизированными формулировками и калиброванной строгостью.

Ключевой приём — контрастивная генерация. LLM переписывает безопасный текст в небезопасный вариант, который нарушает целевую категорию, но намеренно не нарушает соседнюю. Так за один вызов получается позитивный и сложный негативный пример на идентичном контенте. Модель учится тому, какая именно политика нарушена, а не грубому делению «безопасно/небезопасно».

Изображения, которые нельзя синтезировать как текст, дополняются общими датасетами как негативами, мутацией запросов по визуальной таксономии из 14 подкатегорий и фильтрацией через vision-language реранкер.

Обучение — LoRA fine-tuning с последующим тройным SLERP-слиянием: 0.6 публичные+сгенерированные, 0.3 только публичные, 0.1 Ministral-3B-Instruct.

Результаты бенчмарков

На текстовой безопасности Shieldstral показывает 84.9% среднего F1, сравнявшись с GPT-OSS-Safeguard-20B и оставшись самой маленькой моделью в сравнении. Победы на ToxicChat (84.1), HarmBench (99.4) и Aegis v2 response (87.2).

На мультимодальной безопасности — 83.8% против 77.6% у OmniGuard-7B, лидерство на VLGuard (97.7) и UnsafeBench (81.8). LlavaGuard-7B по-прежнему лидирует на одноимённом бенчмарке с 81.4.

На адаптационном бенчмарке с расходящейся таксономией из 12 суперклассов, 26 подкатегорий и 52 листовых категорий Shieldstral набирает 91.3% F1, уступая GPT-OSS-Safeguard-20B (94.1%) и Nemotron-3.5-Safety-4B (91.8%), но без генерации цепочки рассуждений. Детекция отказов — 91.5% против 93.7% у GPT-OSS-Safeguard-20B.

Слабые места: многоязычная классификация промптов отстаёт на арабском и индонезийском, а также на промптах RTP-LX (70.3 против 86.1 у Nemotron-3.5-Safety-4B). Снижена надёжность на состязательных или обфусцированных входах и очень длинных документах. Обученный контекст — 32k токенов на 12 языках.

Развёртывание

Shieldstral-1.0-3B помещается в 16 ГБ видеопамяти в BF16 и работает на одной GPU. Лицензия Apache 2.0 разрешает коммерческое и некоммерческое использование. Поддерживаются vLLM (≥0.26.0, рекомендуется), llama.cpp через GGUF-конвертацию с квантованием Q8_0/Q5_K_M/Q4_K_M, SGLang и Transformers. Дообучение — через Axolotl.

Классификатор эмитит один токен, поэтому задержка и стоимость значительно ниже, чем у рассуждающих guardrail-моделей вроде GPT-OSS-Safeguard-20B. Такой след подходит стартапам, которые не могут позволить себе контракт с вендором модерации, а открытая лицензия и self-hosting — командам среднего и крупного бизнеса, которым нужны guardrails внутри VPC или on-premise для аудита и резидентности данных. SaaS-вендоры с мультитенантностью получают отдельное преимущество: одна контрольная точка может применять разную политику для каждого клиента.

Поскольку выход — непрерывная оценка, а не метка, команды могут настраивать порог для каждой поверхности или направлять пограничные результаты на ручную проверку вместо жёсткой блокировки. Это особенно актуально в свете новых правил ЕС по маркировке ИИ-контента, вступивших в силу в августе 2026 года.

Где применить

  • модерация пользовательских промптов и ответов модели;
  • классификация отказов;
  • проверка изображений с подписями для рекламы и мемов;
  • курирование обучающих данных и RAG-корпусов;
  • ограничение вывода в агентных пайплайнах;
  • применение политик для отдельных тенантов.

Отрасли: UGC-платформы, ed-tech и защита детей, здравоохранение и приложения для ментального здоровья, fintech и страховые, игры и голосовые чаты, маркетплейсы и проверка рекламы, госсектор с требованиями суверенитета данных.

Как и другие недавние решения — например, агентная модель Liquid AI для устройств или система Microsoft для автоматической генерации тестов — Shieldstral демонстрирует тренд на специализированные, эффективные и контролируемые компоненты ИИ-инфраструктуры.

Как это связано с другими моделями Mistral

Shieldstral построен на Ministral-3-3B-Base-2512 с нативным vision-энкодером Pixtral. Это продолжение линейки открытых моделей Mistral, где упор делается на эффективность и контролируемость. В отличие от универсальных языковых моделей, Shieldstral — узкоспециализированный классификатор, что и позволяет добиться результатов на уровне моделей в 7 раз больше.

Частые вопросы

Что такое Shieldstral 1.0 3B?

Это открытый мультимодальный классификатор безопасности от Mistral AI с весами под Apache 2.0. Он оценивает контент по политике, заданной как вопрос на естественном языке в промпте, и возвращает оценку безопасности одним токеном.

Чем Shieldstral отличается от других guardrail-моделей?

Политика не зашита в веса, а передаётся в промпте на этапе инференса. Это позволяет менять правила модерации под новый контекст без переобучения модели.

Насколько хорошо Shieldstral справляется с модерацией?

84.9% среднего F1 на текстовой безопасности — уровень GPT-OSS-Safeguard-20B, модели в 7 раз больше. На мультимодальной безопасности — 83.8%, что выше всех оценённых Mistral базовых моделей.

Какие требования к железу?

16 ГБ видеопамяти в BF16, одна GPU. Поддерживаются vLLM, llama.cpp, SGLang и Transformers.

Можно ли использовать Shieldstral коммерчески?

Да, лицензия Apache 2.0 разрешает коммерческое и некоммерческое использование без ограничений.

Какие слабые места у Shieldstral?

Отставание на арабском и индонезийском, сниженная надёжность на обфусцированных входах и очень длинных документах. Обученный контекст — 32k токенов.

Чем полезен непрерывный score вместо метки?

Команды могут настраивать порог срабатывания для каждой поверхности отдельно или отправлять пограничные результаты на ручную проверку вместо автоматической блокировки.

Источник: marktechpost.com