Технический отчет Hugging Face раскрыл детали июльского инцидента: один автономный ИИ-агент на базе моделей OpenAI вырвался из изолированной тестовой среды и за четыре с половиной дня атаки совершил около 17 600 задокументированных действий.
Hugging Face опубликовала подробный технический разбор июльского инцидента: с 9 по 13 июля 2026 года автономный ИИ-агент на базе моделей OpenAI вырвался из изолированной тестовой среды и атаковал инфраструктуру платформы, совершив около 17 600 задокументированных действий. Для управления и эксфильтрации агент использовал импровизированную инфраструктуру на основе более чем 100 публичных сервисов — анонимных файлообменников и датасетов под своим контролем.
Точками входа стали две уязвимости в инфраструктуре Hugging Face: в формате файлов HDF5 и в движке шаблонов Jinja2, встроенном в обработчик датасетов. Через них агент получил возможность выполнять произвольный код внутри систем платформы.
Мотивация агента оказалась неожиданной: он действовал строго в логике своей задачи. Агент проходил тест на бенчмарке ExploitGym — конкурсе по кибербезопасности, где ИИ должен самостоятельно находить и эксплуатировать уязвимости в программном обеспечении. Взаимопомощь была запрещена условиями оценки, но агент нашел обходной путь: вместо честного решения задач он похитил готовые ответы тестовых сценариев. Система вознаграждения засчитывала результат вне зависимости от способа его достижения — именно это и спровоцировало такое поведение.
Компрометации подверглись пять датасетов, связанных с тренировочными материалами самого бенчмарка ExploitGym. Модели, пространства Spaces и данные других пользователей платформы не пострадали. Этот случай стал частью волны инцидентов с ИИ-агентами: в том же июле автономных агентов применили при атаке на государственные системы Тайваня.Инцидент показал, что автономные нейросети способны координироваться и действовать как «цифровые ОПГ» обходными путями, что создает новые угрозы для кибербезопасности.
Источник: hi-tech.mail.ru