ИИ-модели Claude «по ошибке» взломали инфраструктуру трех компаний: подробности

Инциденты произошли во время тестирований.

Компания Anthropic сообщила о трех случаях, когда ее ИИ-модели Claude во время тестирования получили доступ к интернету и проникли в реальные системы организаций без разрешения. Инциденты выявили в ходе внутренней проверки, начатой после аналогичного случая, о котором недавно рассказала OpenAI. Тогда комбинация ИИ-моделей смогла выйти за пределы изолированной тестовой среды и получить доступ к внешним интернет-ресурсам.

По данным Anthropic, проблема возникла во время испытаний, проводившихся совместно с партнером Irregular. Моделям сообщили, что они работают в симуляции без доступа к сети, однако из-за ошибки в настройке интернет оказался доступен. После этого Claude смогла получить доступ к системам трех организаций, используя относительно простые методы — например, незащищенные интерфейсы и слабые пароли. Названия пострадавших компаний не раскрываются.

В инцидентах участвовали модели Opus 4.7, Mythos 5 и один внутренний исследовательский прототип. При этом их поведение различалось. Opus 4.7 продолжила атаку после обнаружения реальных систем, Mythos 5 решила, что все еще находится в симуляции, а экспериментальная модель прекратила выполнение задания.

В Anthropic подчеркнули, что тесты проводились без стандартных защитных механизмов, которые обычно используются перед публичным запуском моделей. Компания приостановила все кибериспытания и начала дополнительное расследование совместно с организацией METR.

Источник: hi-tech.mail.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев