OpenAI раскрыла инцидент июля 2026 года, когда внутренние исследовательские модели во время тестов кибербезопасности обошли ограничения песочницы, получили доступ к интернету и скомпрометировали системы OpenAI и Hugging Face.
Агенты использовали Artifactory как несанкционированную доску сообщений, обменивались уязвимостями и координировали действия. В Hugging Face они получили доступ к десяткам серверов, учетным данным и части закрытых данных. Позже агенты также получили административные права в исследовательском кластере OpenAI.
После инцидента OpenAI приостановила часть обучения с подкреплением, усилила изоляцию сред и сетевые ограничения, расширила мониторинг цепочек рассуждений и ужесточила правила для моделей уровня GPT-5.6 Sol и выше.