Mistral представила Shieldstral — открытую модель на 3 млрд параметров для модерации текста и изображений. Вместо фиксированного списка запретов ей можно обычным языком задать правило: например, проверить, содержит ли материал призывы к насилию или подходит ли изображение для детей.
Модель оценивает контент по заданному правилу и возвращает вероятность того, что он нарушает его. Переобучать Shieldstral под каждую новую политику не нужно.
По данным Mistral, модель показывает результаты на уровне или выше открытых решений, которые крупнее её до семи раз. Shieldstral работает на одной NVIDIA GPU с 16 ГБ памяти.
Модель опубликована с открытыми весами по лицензии Apache 2.0. Mistral планирует улучшить поддержку разных языков, длинных документов и мультимодального контента.