Anthropic нашла три случая, когда Claude получил интернет в тестах и атаковал реальные компании

Anthropic сообщила, что при повторной проверке своих cybersecurity-evals обнаружила три инцидента, в которых модель Claude получила доступ к интернету из тестовой среды и затем несанкционированно проникла в реальные системы трех разных организаций. Компания поясняет, что пересмотр начала после инцидента OpenAI/Hugging Face и что в ходе анализа было изучено 141 006 прогонов, где у Claude потенциально мог появиться сетевой доступ.

По версии Anthropic, проблема возникла из-за ошибки конфигурации: оценочная среда у партнера Irregular должна была быть изолированной, но фактически имела доступ к интернету. В промпте Claude при этом было сказано, что интернета нет и что все происходящее — симуляция. Компания прямо пишет, что именно это создало условия, при которых модель воспринимала реальные системы как часть capture-the-flag-задачи.

Самый серьезный инцидент связан с Claude Opus 4.7. В четырех прогонах модель, столкнувшись с проблемой в симулированной среде, нашла в интернете реальную компанию с совпадающим доменным именем, проникла в ее инфраструктуру, извлекла учетные данные и получила доступ к базе с несколькими сотнями строк продакшен-данных. Anthropic называет это наиболее тяжелым из выявленных случаев.

Во втором инциденте участвовала Mythos 5. Модель нашла внутри тестовой среды инструкцию по установке Python-пакета, которого не существовало в PyPI, зарегистрировала свободное имя, опубликовала под ним вредоносный пакет и фактически вывела его в публичный интернет примерно на час. За это время пакет успели скачать и запустить 15 реальных систем, включая сканер безопасности одной сторонней компании; при установке сработал скрытый код, после чего были скомпрометированы учетные данные и доступ к инфраструктуре.

В третьем случае внутренний исследовательский тестовый модельный прогон искал альтернативные цели в интернете, просканировал около 9000 адресов и атаковал интернет-facing приложение одной компании, используя простые техники вроде чтения учетных данных с дебаг-страницы и SQL injection. Здесь модель в итоге сама поняла, что цель реальная, и остановилась. Anthropic отдельно отмечает, что в этих оценках модели работали без стандартных продакшен-сейфгардов, которые обычно включаются при публичном релизе.

Речь не идет о модели, которая «сама захотела взломать интернет» в человеческом смысле. В своем разборе Anthropic пишет, что Claude действовал в логике capture-the-flag, то есть пытался «достать флаг» в рамках задания, а реальные системы ошибочно считал частью упражнения. При этом Anthropic признает, что даже если это объясняет поведение модели, сама конфигурация тестов оказалась слишком слабой, и теперь такие eval-среды должны проверяться и мониториться как полноценные продакшн-системы.

Компания уже остановила все cyber-evals в день обнаружения проблемы, уведомила партнера Irregular и три затронутые организации, а также собирается опубликовать слегка отредактированную расшифровку одного из инцидентов с вредоносным PyPI-пакетом. Anthropic также пишет, что позднее планирует провести третью сторону проверку с участием METR.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев