Вышла новая модель для классификации контента и модерации безопасности Shieldstral
Раскрыта новая модель Shieldstral (https://huggingface.co/mistralai/Shieldstral-1.0-3B), являющаяся политико-адаптивным мультимодальным (текст и изображение) классификатором безопасности на 3 млрд параметров (основанным на Ministral-3B).
Задачей установили сведение модерации контента к бинарному вопросно-ответному формату, когда по естественно-языковой инструкции, вопросу о безопасности и документу модель выдаёт оценку "да/нет", унифицируя разнородные политики и таксономии.
Данных собрали из примерно 54,1 млн примеров. 45,2 млн открытых текстовых сэмплов привели к единому шаблону с варьируемыми инструкциями и запросами. 4,4 млн синтетических контрастных пар включали один и тот же контент, сочетающийся с релевантным и нерелевантным запросом, а безопасные тексты переписывали в небезопасные под конкретные категории, чтобы научить модель различать тонкие границы политик. Ещё подготовили 4,5 млн мультимодальных примеров с аугментацией запросов и добавлением безопасных изображений из общих наборов данных.
Обучение произвели методом LoRA на Ministral-3B (один выходной токен). Следом две специализированные контрольные точки (открытые данные и их сочетание с сгенерированными) объединили через сферическую линейную интерполяцию (SLERP), добавив инструктивную версию базовой модели.
В результате степень защиты текста составляет F1 84,9%, соответствуя GPT-OSS-Safeguard-20B, несмотря на разницу примерно в 7 раз по размеру. Мультимодальная безопасность достигла среднего F1 83,8%, став новым state-of-the-art. Адаптивность к политике набрала F1 91,3% при оценивании по новым, независимо разработанным таксономиям с произвольными запросами на естественном языке.





























