Mistral выпустила Shieldstral для проверки текста и изображений на безопасность
Mistral представила Shieldstral — открытую модель на 3 млрд параметров для модерации текста и изображений. Вместо фиксированного списка запретов ей можно обычным языком задать правило: например, проверить, содержит ли материал призывы к насилию или подходит ли изображение для детей. Модель оценивает контент по заданному правилу и возвращает вероятность того, что он нарушает его. Переобучать Shieldstral … Читать далее