Разработчики построили многослойный фильтр безопасности. Он защищает ИИ от вредоносных запросов. Система не имеет единой точки отказа.
Фильтр проверяет смысл и ищет опасные шаблоны. Он анализирует намерения и находит аномалии. Такой подход называют оборонительной эшелонированной системой.
Атаки на ИИ стали сложнее. Злоумышленники перефразируют вредоносные инструкции. Они пытаются обойти базовые защиты модели.
Новый фильтр ловит очевидные и скрытые угрозы. Он распознаёт попытки смены роли. Система видит манипуляции с памятью ИИ.
Код уже опубликован в открытом доступе. Разработчики использовали библиотеки OpenAI и SentenceTransformers. Фильтр готов к работе в реальных проектах.