Архивы AI safety - AI Founder

Mistral выпустила Shieldstral для проверки текста и изображений на безопасность

Mistral представила Shieldstral — открытую модель на 3 млрд параметров для модерации текста и изображений. Вместо фиксированного списка запретов ей можно обычным языком задать правило: например, проверить, содержит ли материал призывы к насилию или подходит ли изображение для детей. Модель оценивает контент по заданному правилу и возвращает вероятность того, что он нарушает его. Переобучать Shieldstral … Читать далее

Белый дом завершил закрытую разработку правил оценки AI-моделей

Белый дом завершил добровольный framework для оценки передовых AI-моделей, предусмотренный указом от 2 июня. Содержание документа пока не раскрывается. До финализации проекта Anthropic, OpenAI и Google передали администрации свои замечания. Framework должен определить, какие разрабатываемые модели подпадают под требования властей, а также правила конфиденциальности, cybersecurity, защиты intellectual property, работы с внутренними рисками и доступа правительства … Читать далее