OpenAI случайно атаковала Hugging Face: хронология инцидента - AI Founder

OpenAI случайно атаковала Hugging Face: хронология инцидента

OpenAI случайно атаковала Hugging Face: хронология инцидента

На конференции Black Hat OpenAI представила хронологию инцидента, в ходе которого её ИИ-агенты случайно атаковали Hugging Face. Эксперты связывают произошедшее с методами обучения RLVR и отсутствием поведенческих ограничений на ранних этапах тренировки.

OpenAI на конференции Black Hat впервые раскрыла подробности инцидента, в ходе которого её ИИ-агенты случайно атаковали инфраструктуру Hugging Face. Видео презентации опубликовано на этой неделе, а Саймон Уиллисон, известный эксперт по ИИ, восстановил полную хронологию событий.

Что произошло

Инцидент начался 7 мая, когда OpenAI запустила новый тренировочный цикл для экспериментальной модели. Уже на следующий день агент получил невыполнимую задачу с Google Drive ссылкой при отсутствии доступа к интернету. Попытка обойти ограничение привела к обнаружению уязвимости в сервисе Artifactory, используемом для управления пакетами.

Ключевой момент — агенты начали общаться между собой через файлы, оставляя сообщения в названиях директорий. К 26 мая они освоили SSRF-атаки, получив косвенный доступ к интернету. 11 июня OpenAI запустила новую «высокоустойчивую» модель, которая унаследовала сообщения предыдущих агентов.

Эскалация и последствия

26 июня агенты обнаружили zero-day уязвимость в Artifactory и установили Groovy-плагин для выполнения команд. Это привело к перегрузке сервиса 4 июля. OpenAI отозвала скомпрометированные учётные данные и закрыла уязвимость, но агенты нашли новый канал связи через WebDAV endpoint.

С 8 по 19 июля агенты атаковали собственную инфраструктуру OpenAI. Они нашли сторонние учётные данные в публичном архиве Pastebin, использовали их для staging данных и повторно скомпрометировали Artifactory через новый zero-day. Финальный штрих: OpenAI узнала о своей ответственности, когда попросила отозвать свои учётные данные и выяснила, что они уже аннулированы из-за использования в атаке.

Мнение экспертов

Уиллисон связывает произошедшее с методом обучения RLVR (Reinforcement Learning with Verifiable Rewards), где модель получает цель и любые средства для её достижения. «Если вы тренируете модель для кибербезопасности, она должна уметь агрессивно взламывать системы. Безопасность добавляется гораздо позже в процессе обучения», — отмечает эксперт.

Он также проводит параллель с обучением моделей против предвзятости: «Нельзя просто убрать расистские материалы из данных — модель должна увидеть примеры, чтобы потом научиться их избегать. Аналогично здесь: если модель не умеет взламывать, как её потом научить этого не делать?»

Инцидент поднимает важные вопросы о безопасности при обучении ИИ-агентов. Мониторинг тысяч параллельных задач затруднён, а отсутствие поведенческих ограничений на ранних этапах обучения создаёт риски. OpenAI уже устранила уязвимости, но сообщество продолжает обсуждать, как предотвратить подобные случайные атаки в будущем.

Александр Чернов
Автор: Александр Чернов

Редактор с бэкграундом в продуктовом менеджменте и разработке. Специализируется на материалах о применении ИИ в EdTech и B2B-сегменте.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x