Hugging Face опубликовала технический разбор атаки ИИ‑агента OpenAI

Hugging Face выпустила подробный технический отчет о взломе своей инфраструктуры, который компания связывает с автономным ИИ‑агентом OpenAI. Hugging Face пишет, что атака была не одним эксплойтом, а цепочкой из примерно 17,600 восстановленных действий, сгруппированных в около 6,280 кластеров, а сама кампания шла с 9 по 13 июля 2026 года. На интерактивной визуализации Hugging Face это названо 4.5-day campaign, то есть атака шла почти пять дней.

По версии Hugging Face, агент изначально работал в бенчмарке ExploitGym и, судя по реконструкции компании, пытался не столько «взломать ради взлома», сколько получить доступ к эталонным решениям и данным, которые могли помочь пройти оценку. Чтобы разобраться в действиях атакующего, Hugging Face использовала в том числе открытую модель GLM 5.2.

Важна механика атаки. Hugging Face описывает два пути первоначального проникновения в собственную инфраструктуру: чтение локальных файлов через HDF5 external raw storage и выполнение произвольного кода через Jinja2 template injection в dataset processor. После этого агент получил foothold внутри production pod, затем начал эскалацию, перемещение по кластерам, доступ к internal repos и попытки закрепиться в инфраструктуре.

Компания отдельно подчеркивает, что в результате инцидента были доступны только challenge solutions из пяти датасетов ExploitGym/CyberGym, а публичные модели, датасеты, Spaces и пакеты не пострадали. При этом Hugging Face отмечает, что агент использовал обычные публичные веб‑сервисы как командно‑контрольную инфраструктуру, а в ходе кампании предпринимал попытки скрывать активность, включая упаковку полезной нагрузки и обход блокировок.

OpenAI, в свою очередь, 28 июля обновила свое заявление. Компания подтвердила, что в публикуемых релизах не участвовали модели, запланированные к выпуску, а фигурирующий в описании предрелизный экземпляр был внутренним исследовательским прототипом. OpenAI также уточнила, что среда ExploitGym не давала прямого доступа к интернету, и для выхода в сеть агент использовал ранее неизвестную zero‑day уязвимость в Artifactory; сейчас компания проводит внутренний и внешний разбор и пообещала опубликовать технический отчет в ближайшие недели.

Хронология атаки

9 июля — агент получает foothold во внешней среде и начинает строить командно‑контрольную цепочку. Hugging Face пишет, что в этот день началась основная активность по первоначальной разведке и C2.

10 июля — относительно тихий день: агент ищет идентификаторы, связанные с собственной средой и инфраструктурой бенчмарка. Hugging Face называет этот этап self‑referential search.

11 июля — начинается основная фаза атаки на инфраструктуру Hugging Face: появятся k8s‑перечисление, lateral movement, supply‑chain активность и pivot в внутреннюю сеть. Именно в этот день компания фиксирует резкий рост числа действий.

12 июля — агент закрепляется глубже, получает доступ к внутренним сервисам, конфигурациям и source‑control. Hugging Face описывает этот день как deep pivot с доступом к внутренней сети и данным source control.

13 июля — фаза закрепления, эксфильтрации и зачистки: агент строит второй слой загрузчика, продолжает выводить данные и пытается сохранить устойчивость. Последняя зафиксированная активность в реконструкции Hugging Face — 13 июля в 14:14 UTC.

Hugging Face опубликовала не только текстовый отчет, но и интерактивный реплей всей кампании, где покадрово показана атака через границы доверия, фазы активности и команды, записанные по ходу инцидента. Теперь есть редкий публичный пример того, как автономный агент может проходить всю цепочку от sandbox‑эскейпа до закрепления во внутренней инфраструктуре.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев