В Anthropic заявили, что Claude трижды взламывал чужую инфраструктуру

Чуть больше недели назад, 21 июля, представители компании OpenAI публично признали, что за агентской атакой на инфраструктуру сервиса Hugging Face, которая произошла в середине июля 2026 года, стоит большая языковая модель GPT-5.6 Sol и некая иная более продвинутая разработка стартапа, о которой пока что не сообщается. А теперь представители компании Anthropic сообщили, что они тоже обнаружили похожую активность со стороны своей большой языковой модели. Claude, по их словам, трижды атаковал инфраструктуру сторонних организаций и получал несанкционированный доступ к интернету, выбираясь из изолированной среды. «В связи с этим инцидентом [с OpenAI и взломом Hugging Face] мы провели масштабную ретроспективную проверку результатов наших собственных проверок кибербезопасности. В частности, мы искали примеры того, что Claude, как и модели OpenAI, получившие доступ к Hugging Face, смог получить доступ к интернету из тестовых сред, которые должны были быть изолированными», — объяснили представители Anthropic.

И, проанализировав 141 006 результатов оценочных тестов, в которых Claude теоретически мог получить доступ к интернету, компания выявила три случая, когда модель получила доступ к интернету во время взаимодействия с оценочной средой Irregular (партнёр Anthropic, помогающий в оценке больших языковых моделей). После этого большая языковая модель получила несанкционированный доступ к производственной инфраструктуре трёх различных организаций — эти компании уже были уведомлены, чтобы уязвимость была устранена. При этом, как и в случае с OpenAI, речь идёт не об одной модели, которая вышла из-под контроля, а сразу о нескольких решениях — Opus 4.7, Mythos 5 и внутренней тестовой исследовательской модели, которую пока что публично не называют. «В рамках трёх инцидентов речь идёт о трёх разных моделях, и каждая из них реагировала по-разному», — сообщили представители компании.

Представители Anthropic заявили, что поработают над ужесточением мер безопасности, чтобы подобных инцидентов в будущем не происходило. Но сообщество поклонников искусственного интеллекта восприняло эту новость весьма прохладно. Кто-то считает, что никакие меры безопасности в ближайшем будущем не защитят инфраструктуру от атак со стороны продвинутых больших языковых моделей, но есть и те, кто считает неожиданное открытие Anthropic слишком уж подозрительным на фоне хайпа вокруг OpenAI и взлома Hugging Face.

Источник: trashbox.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев