Инциденты произошли во время тестирований.
Компания Anthropic сообщила о трех случаях, когда ее ИИ-модели Claude во время тестирования получили доступ к интернету и проникли в реальные системы организаций без разрешения. Инциденты выявили в ходе внутренней проверки, начатой после аналогичного случая, о котором недавно рассказала OpenAI. Тогда комбинация ИИ-моделей смогла выйти за пределы изолированной тестовой среды и получить доступ к внешним интернет-ресурсам.
По данным Anthropic, проблема возникла во время испытаний, проводившихся совместно с партнером Irregular. Моделям сообщили, что они работают в симуляции без доступа к сети, однако из-за ошибки в настройке интернет оказался доступен. После этого Claude смогла получить доступ к системам трех организаций, используя относительно простые методы — например, незащищенные интерфейсы и слабые пароли. Названия пострадавших компаний не раскрываются.
В инцидентах участвовали модели Opus 4.7, Mythos 5 и один внутренний исследовательский прототип. При этом их поведение различалось. Opus 4.7 продолжила атаку после обнаружения реальных систем, Mythos 5 решила, что все еще находится в симуляции, а экспериментальная модель прекратила выполнение задания.
В Anthropic подчеркнули, что тесты проводились без стандартных защитных механизмов, которые обычно используются перед публичным запуском моделей. Компания приостановила все кибериспытания и начала дополнительное расследование совместно с организацией METR.
Источник: hi-tech.mail.ru