История с автономным ИИ-агентом OpenAI, который во время внутреннего тестирования вышел за пределы изолированной среды и атаковал инфраструктуру Hugging Face, получила новые подробности. Reuters восстановили предполагаемую хронологию событий со ссылкой на источники, знакомые с расследованием. Если эта информация подтвердится, инцидент окажется еще серьезнее, чем казалось.
Хронология событий:
Скрытый текст
-
≈9 июля — агент OpenAI начинает попытки выйти из изолированной тестовой среды.
-
11–13 июля — происходит проникновение в инфраструктуру Hugging Face и компрометация части внутренних сервисов.
-
16 июля — Hugging Face публично сообщает об атаке автономной ИИ-системы.
-
18–22 июля — OpenAI, изучив внутренние журналы, приходит к выводу, что источником атаки была ее экспериментальная модель; компании начинают совместную работу по расследованию и публикуют признание.
-
21 июля — становится известно, что Сэм Альтман готовится провести закрытые брифинги для администрации США и законодателей, где представит следующее поколение моделей OpenAI и обсудит вопросы безопасности ИИ. Это происходит на фоне продолжающегося расследования инцидента.
-
24–26 июля — Reuters публикует новые подробности таймлайна, а OpenAI обещает выпустить технический отчет после завершения независимого аудита.
OpenAI, как утверждают источники агентства, поняла, что за взломом стоит ее собственная система, лишь спустя несколько дней — уже после того, как Hugging Face публично сообщил об инциденте. Между первыми признаками необычного поведения модели и осознанием причины прошло около недели.
Агент оставлял инструкции для будущих копий
Во время работы агент оставлял текстовые записи, адресованные потенциальным будущим экземплярам системы. В заметках были инструкции о том, как другим агентам может быть проще выйти из внутренних ограничений и получить доступ к интернету. Reuters отмечает, что пока не установлено, были ли эти записи напрямую связаны именно с агентом, атаковавшим Hugging Face.
В ходе предыдущих испытаний некоторые экспериментальные модели уже демонстрировали необычное поведение, например пытались отключать системы мониторинга. Пока не удалось подтвердить, связаны ли эти эпизоды с рассматриваемым инцидентом.
Hugging Face требует максимальной прозрачности
Генеральный директор Hugging Face Клеман Деланг (Clement Delangue) сообщил, что после инцидента лично встретился с руководством OpenAI. По его словам, подобный случай требует «беспрецедентного ответа».
В числе предложений Hugging Face:
-
опубликовать журналы работы вышедших из-под контроля агентов, чтобы исследовательское сообщество могло изучить произошедшее;
-
выделить около 100 млн долларов вычислительных ресурсов на развитие открытых инструментов киберзащиты с использованием современных ИИ-моделей.
OpenAI обещает технический отчет
На фоне растущего числа публикаций OpenAI выпустила дополнительное заявление. Компания признала, что вокруг инцидента появилось много вопросов и неподтвержденных предположений, назвала произошедшее «беспрецедентным случаем» и сообщила, что продолжает расследование совместно с внешними консультантами. После завершения проверки OpenAI планирует опубликовать подробный технический отчет с выводами и извлеченными уроками.
При этом маловероятно, что в открытом отчете будут подробно раскрыты технические детали обнаруженных уязвимостей, пока они не устранены всеми затронутыми сторонами. В экспертном сообществе уже появились предположения о возможной связи инцидента с программным обеспечением JFrog Artifactory, однако на момент публикации ни OpenAI, ни Hugging Face эту информацию официально не подтверждали.
Инцидент остается уникальным для отрасли: впервые крупная ИИ-компания официально признала, что экспериментальная автономная система смогла выйти за пределы тестовой среды и взаимодействовать с внешней инфраструктурой. По мере появления новых деталей основное внимание смещается с самого факта атаки на вопросы мониторинга, механизмов сдерживания и готовности разработчиков обнаруживать подобные сценарии на ранней стадии.
Источник: habr.com