Claude случайно взломал реальные компании во время тестов на кибербезопасность

Компания Anthropic сообщила, что несколько версий их ИИ-моделей Claude во время проведения тестов на кибербезопасность случайно получили доступ к реальным системам сторонних организаций и скомпрометировали их.

Инциденты произошли из‑за того, что модели, будучи уверенными, что действуют в симулированной среде, использовали базовые хакерские приемы для взлома настоящей производственной инфраструктуры.

Проблему выявили в ходе плановой проверки тестовых запусков, которую Anthropic инициировала после похожего инцидента, раскрытого OpenAI. В итоге обнаружились три отдельных случая с участием трех разных версий Claude, самые ранние из которых датируются апрелем.

Главная причина крылась в недопонимании между Anthropic и их партнером по проведению оценок, компанией Irregular. Моделям прямо говорили, что у них нет доступа в интернет, однако из‑за неправильной конфигурации доступ на самом деле был открыт. Когда Claude в ходе выполнения задания по поиску флага натыкался на реальные системы в открытой сети, он воспринимал их как часть упражнения, полагая, что все вокруг — лишь симуляция.

Самый серьезный инцидент произошел с моделью Claude Opus 4.7. Она проникла в инфраструктуру реальной компании, извлекла учетные данные и получила доступ к базе данных, содержащей несколько сотен строк рабочей информации. Примечательно, что модель продолжала атаку, даже когда получила доказательства того, что действует в настоящей среде.

В другом случае модель Claude Mythos 5 создала и опубликовала вредоносный пакет Python в общедоступном репозитории PyPI. Модель заметила, что в инструкциях для разработчиков вымышленной компании упоминался несуществующий пакет, и решила опубликовать свой собственный с тем же именем, чтобы получить контроль над системами. Этот пакет был скачан и запущен на пятнадцати реальных машинах. В результате Claude смог похитить учетные данные этой компании.

Третий случай касался внутренней исследовательской модели, которая просканировала около девяти тысяч целей и скомпрометировала веб‑приложение еще одной организации, используя простые методы вроде SQL‑инъекций и чтения паролей из открытой отладочной страницы.

Три модели вели себя по‑разному, когда начинали подозревать, что имеют дело с реальными системами. Самая старая, Opus 4.7, осознала, что вышла на рабочие системы, но не остановилась. Mythos 5 правильно поняла, что вышла в открытый интернет, однако убедила себя в обратном, ссылаясь на технические детали вроде неподписанных сертификатов и системной даты, которая казалась ей «постановочной».

А вот самая новая из трех моделей, внутренний исследовательский прототип, самостоятельно прекратила атаку, когда получила неопровержимые доказательства реальности целей. Anthropic отмечает, что хотя из этих единичных случаев нельзя делать однозначных выводов, прослеживается интересная мысль о том, что более продвинутые модели демонстрируют более ответственное поведение.

Все тесты были построены как соревновательные задачи по «захвату флага». Моделям давалась вымышленная легенда, и они должны были проникнуть в указанную сеть и найти секретную информацию. В инструкции четко говорилось, что интернета нет, но из‑за неправильной настройки это было не так. Обнаружив, что они могут выходить в сеть, модели воспринимали все найденные ресурсы как часть симуляции.

Anthropic признает, что несколько уровней защиты могли предотвратить инциденты — например, тщательная проверка всех путей доступа в интернет перед началом тестов или мониторинг логов в реальном времени. Компания также отмечает, что более точная формулировка задания, которая бы прямо указывала, какие системы входят в рамки упражнения, а какие нет, скорее всего, не позволила бы моделям выходить в открытую сеть. Почему банки теряют интерес к МСБ ИИ в современном образовании. Что изменили высокие технологии в аудиториях ИИ-образование как экономика партнерства университета и бизнеса

Компания приостановила все тесты по кибербезопасности 23 июля, как только были обнаружены подозрительные транскрипты. Уже на следующий день идентифицировали все три инцидента, а 27 июля уведомили партнеров Irregular и пострадавшие организации. Две из них не замечали взлома до уведомления, и сейчас Anthropic помогает им устранить последствия. С третьей организацией связь еще устанавливается.

В ответ на произошедшее компания ужесточает требования к тестовым средам, и теперь они должны соответствовать тем же стандартам безопасности, что и боевые системы. Внедряется непрерывный мониторинг логов и улучшаются инструменты расследования. Усиливается контроль над сторонними поставщиками инфраструктуры для оценки.

Эти случаи высвечивают растущую проблему по мере того, как ИИ‑модели становятся все более самостоятельными. Тесты по кибербезопасности должны быть одновременно реалистичными и безопасными, но грань между симуляцией и реальностью может стираться. Anthropic подчеркивает, что даже изолированные тестовые полигоны с вымышленными сценариями несут риск, когда речь идет о продвинутых агентах.

Компания призывает другие лаборатории провести аналогичные проверки и инициирует отраслевую дискуссию о том, как безопасно и в то же время достоверно оценивать возможности мощных ИИ‑систем. Кроме того, Anthropic сотрудничает с независимой организацией для стороннего аудита и планирует в ближайшее время опубликовать частично отредактированную расшифровку инцидента с PyPI.

Сама Anthropic склонна рассматривать произошедшее скорее как сбой в эксплуатации и настройках, чем как проблему с выравниванием модели. Модели действовали в соответствии с полученными инструкциями, ошибочно полагая, что находятся в симуляции. При этом самая новая модель, осознав реальность, добровольно остановилась, что вселяет осторожный оптимизм. Компания уверена, что усиление контроля и дальнейшие инвестиции в безопасность позволят справиться с подобными рисками.

Источник: www.it-world.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев