Компания Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.

Во всех трёх случаях модель Claude вышла в интернет из тестовой среды, взаимодействуя с третьей стороной, и затем получила несанкционированный доступ к работающим системам этих организаций.
Anthropic заявила, что инцидент с OpenAI в начале этого месяца побудил компанию провести собственную оценку кибербезопасности. В частности, она искала доказательства того, что Claude получила доступ в интернет из тестовых сред, которые предназначены для работы в качестве «песочниц» и изоляции моделей.
Среди 141 006 проанализированных оценочных запусков лаборатория ИИ обнаружила три инцидента, в которых её модель получала доступ к интернету при взаимодействии с Irregular, одним из своих сторонних партнёров. Anthropic заявила, что он был вызван неправильной конфигурацией среды оценки, запущенной с Irregular. Компания назвала это «недоразумением» относительно наличия доступа к интернету в тестовой среде.
Anthropic заявила, что «подходит к исправлению так, как если бы ответственность лежала только на нас», отметив при этом, что Irregular проводит собственное отдельное расследование.
Компания сообщила, что инциденты затронули три разные модели Claude: Opus 4.7, Mythos 5 и внутреннюю исследовательскую тестовую модель.
Примечательно, что в каждом из этих случаев «Claude было прямо указано в запросе, что у него нет доступа к интернету». По всей видимости, модель ИИ исходила из предположения, что реальные системы являются частью задачи, которую ей было поручено выполнить.
В июле Hugging Face сообщила о вторжении в свою инфраструктуру, которое провела автономная система ИИ‑агентов. Платформа смогла отследить и отразить атаку с помощью ИИ. По оценке компании, злоумышленник получил несанкционированный доступ к ограниченному набору внутренних датасетов и к нескольким учётным данным, которые используют сервисы Hugging Face.
Позднее в Reuters восстановили предполагаемую хронологию событий со ссылкой на источники, знакомые с расследованием. Выяснилось, что OpenAI поняла, что за взломом стоит её собственная система, лишь спустя несколько дней — уже после того, как Hugging Face публично сообщил об инциденте. Между первыми признаками необычного поведения модели и осознанием причины прошло около недели.
После этого генеральный директор платформы Клем Деланге призвал к «радикальной прозрачности», попросив компанию «опубликовать следы от „агентов‑изгоев“, чтобы всё исследовательское сообщество могло изучить произошедшее».
Сама Hugging Face уже выпустила подробный технический отчёт о взломе своей инфраструктуры, который компания связывает с автономным ИИ‑агентом OpenAI. Она пишет, что атака была не одним эксплойтом, а цепочкой из примерно 17 600 восстановленных действий, сгруппированных в около 6 280 кластеров, а сама кампания шла с 9 по 13 июля 2026 года.
Источник: habr.com