Mistral представила Shieldstral: открытую модель для адаптивной модерации контента

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Компания Mistral выпустила Shieldstral — открытую мультимодальную модель с 3 миллиардами параметров, которая выполняет задачи безопасности через естественный язык. Она позволяет настраивать правила модерации без дообучения и работает на одном GPU.

Ценность: Shieldstral меняет подход к безопасности ИИ, заменяя фиксированные таксономии вредности на гибкие политики, задаваемые в момент инференса. Это снижает барьеры для внедрения контекстно-зависимой модерации в различных продуктах.

Компания Mistral представила Shieldstral — открытую модель с 3 миллиардами параметров, предназначенную для мультимодальной модерации контента. В отличие от традиционных «охранных» моделей, которые имеют встроенный фиксированный набор категорий вреда, Shieldstral рассматривает задачу безопасности как вопрос-ответ на естественном языке. Это позволяет разработчикам формулировать конкретные политики безопасности прямо в момент инференса, не требуя перетренировки модели под новый контекст или аудиторию.

Архитектура модели основана на бинарной задаче классификации. Каждый запрос состоит из трех частей: контекста оценки, конкретного вопроса (например, «Содержит ли этот текст призывы к насилию?») и самого документа — текста или изображения. Модель анализирует логиты для ответов «да» и «нет», нормализуя их через softmax в непрерывный калиброванный балл безопасности. Такой подход объединяет классификацию промптов, модерацию ответов и детекцию токсичности в единую задачу, обеспечивая гибкость при работе с различными типами контента.

Согласно данным Mistral, Shieldstral демонстрирует производительность, сопоставимую или превосходящую открытые модели безопасности размером до 7 раз больше. Модель обучалась на гетерогенных данных, включая реальные и синтетические наборы с различными форматами меток. Для обучения дискриминации политик команда использовала метод генерации контрастных пар, где LLM переписывал безопасный текст так, чтобы он нарушал одну политику, но не другую. Это научило модель различать тонкие границы между похожими правилами, что критически важно для адаптации к новым, ранее не встречавшимся политикам.

Для работы с изображениями, где данные о небезопасном контенте ограничены, команда использовала общие наборы изображений в качестве негативных примеров и применяла vision-language ранкер для фильтрации пар «изображение-запрос». Это помогло снизить количество ошибочно размеченных данных. Обучение проводилось с использованием LoRA и слияния чекпоинтов через SLERP, что позволило объединить калибровку на публичных данных, дискриминацию политик и следование инструкциям базовой модели в одном весах.

Shieldstral доступна под лицензией Apache 2.0 и может работать на одном GPU NVIDIA с 16 ГБ видеопамяти. Mistral позиционирует этот релиз как шаг к модерации, адаптирующейся к контексту продукта, а не заставляющей все приложения использовать одну замороженную таксономию. Компания также сообщила о планах по расширению мультиязычной поддержки и устойчивости к длинным документам.