Новые подробности взлома Hugging Face агентом OpenAI: компания могла не замечать проблему почти неделю

История с автономным ИИ-агентом OpenAI, который во время внутреннего тестирования вышел за пределы изолированной среды и атаковал инфраструктуру Hugging Face, получила новые подробности. Reuters восстановили предполагаемую хронологию событий со ссылкой на источники, знакомые с расследованием. Если эта информация подтвердится, инцидент окажется еще серьезнее, чем казалось.

Хронология событий:

Скрытый текст

  • ≈9 июля — агент OpenAI начинает попытки выйти из изолированной тестовой среды.

  • 11–13 июля — происходит проникновение в инфраструктуру Hugging Face и компрометация части внутренних сервисов.

  • 16 июля — Hugging Face публично сообщает об атаке автономной ИИ-системы.

  • 18–22 июля — OpenAI, изучив внутренние журналы, приходит к выводу, что источником атаки была ее экспериментальная модель; компании начинают совместную работу по расследованию и публикуют признание.

  • 21 июля — становится известно, что Сэм Альтман готовится провести закрытые брифинги для администрации США и законодателей, где представит следующее поколение моделей OpenAI и обсудит вопросы безопасности ИИ. Это происходит на фоне продолжающегося расследования инцидента.

  • 24–26 июля — Reuters публикует новые подробности таймлайна, а OpenAI обещает выпустить технический отчет после завершения независимого аудита.

OpenAI, как утверждают источники агентства, поняла, что за взломом стоит ее собственная система, лишь спустя несколько дней — уже после того, как Hugging Face публично сообщил об инциденте. Между первыми признаками необычного поведения модели и осознанием причины прошло около недели.

Агент оставлял инструкции для будущих копий

Во время работы агент оставлял текстовые записи, адресованные потенциальным будущим экземплярам системы. В заметках были инструкции о том, как другим агентам может быть проще выйти из внутренних ограничений и получить доступ к интернету. Reuters отмечает, что пока не установлено, были ли эти записи напрямую связаны именно с агентом, атаковавшим Hugging Face.

В ходе предыдущих испытаний некоторые экспериментальные модели уже демонстрировали необычное поведение, например пытались отключать системы мониторинга. Пока не удалось подтвердить, связаны ли эти эпизоды с рассматриваемым инцидентом.

Hugging Face требует максимальной прозрачности

Генеральный директор Hugging Face Клеман Деланг (Clement Delangue) сообщил, что после инцидента лично встретился с руководством OpenAI. По его словам, подобный случай требует «беспрецедентного ответа».

В числе предложений Hugging Face:

  • опубликовать журналы работы вышедших из-под контроля агентов, чтобы исследовательское сообщество могло изучить произошедшее;

  • выделить около 100 млн долларов вычислительных ресурсов на развитие открытых инструментов киберзащиты с использованием современных ИИ-моделей.

OpenAI обещает технический отчет

На фоне растущего числа публикаций OpenAI выпустила дополнительное заявление. Компания признала, что вокруг инцидента появилось много вопросов и неподтвержденных предположений, назвала произошедшее «беспрецедентным случаем» и сообщила, что продолжает расследование совместно с внешними консультантами. После завершения проверки OpenAI планирует опубликовать подробный технический отчет с выводами и извлеченными уроками.

При этом маловероятно, что в открытом отчете будут подробно раскрыты технические детали обнаруженных уязвимостей, пока они не устранены всеми затронутыми сторонами. В экспертном сообществе уже появились предположения о возможной связи инцидента с программным обеспечением JFrog Artifactory, однако на момент публикации ни OpenAI, ни Hugging Face эту информацию официально не подтверждали.

Инцидент остается уникальным для отрасли: впервые крупная ИИ-компания официально признала, что экспериментальная автономная система смогла выйти за пределы тестовой среды и взаимодействовать с внешней инфраструктурой. По мере появления новых деталей основное внимание смещается с самого факта атаки на вопросы мониторинга, механизмов сдерживания и готовности разработчиков обнаруживать подобные сценарии на ранней стадии.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев