Mistral выпустила Shieldstral: модерация через промпт вместо весов
Такой подход решает давнюю проблему guard-моделей вроде Llama Guard. У них таксономия вредного контента фиксирована на этапе обучения, и под каждый продукт её приходится переучивать. Ведь что безопасно для медицинского ассистента, недопустимо для подросткового чата, а обсуждение эксплойтов — норма для пентест-платформы. Mistral честно признаёт: единого списка категорий вреда не существует, определения безопасности расходятся между доменами по сути. Shieldstral позволяет перенастроить модерацию простой заменой вопроса в промпте, без дообучения.
Одна модель закрывает сразу несколько сценариев: фильтрацию входящих запросов, проверку ответов, детекцию отказов и токсичности. Причём работает и с текстом, и с картинками — мультимодальность встроена в интерфейс, а не вынесена в отдельный пайплайн. Вместо дискретной метки модель выдаёт непрерывный скор, по которому можно ранжировать уверенность и строить очередь на ручную проверку.
Обучение строилось на 54 миллионах примеров. Авторы унифицировали несовместимые публичные датасеты, варьировали формулировки инструкций и вопросов, а главное — создавали контрастивные пары, где текст переписывался так, чтобы нарушать одну политику, но не соседнюю. Это научило модель различать близкие политики, а не запоминать список запрещённых тем. Мердж трёх чекпоинтов через SLERP собрал воедино калибровку, дискриминацию политик и базовые инструкции. В итоге модель в семь раз меньше конкурентов, но не уступает им по качеству — и делает это за один forward pass, что критически важно для продакшена.
Источник: habr.com
Поделиться