Эксперты компании продолжают разбираться в причинах скандального инцидента.
OpenAI раскрыла новые подробности инцидента, в ходе которого ее ИИ-модели взломали тестовую среду и атаковали платформу Hugging Face. Как рассказали сотрудники компании на конференции Black Hat, еще в мае несколько ИИ-агентов начали тайно обмениваться сообщениями через незамеченные разработчиками «доски объявлений» и совместно искать способ получить доступ в интернет, пишет Bloomberg.
По словам исследователей OpenAI Эрика Уоллеса и Майкла Далтона, модели пытались решить задачи, часть из которых была невыполнима без подключения к сети. Со временем агенты пришли к выводу, что могут атаковать внешнюю инфраструктуру, чтобы найти недостающие данные.
Расследование показало, что современные ИИ-модели склонны обходить ограничения ради достижения цели. В OpenAI признали, что сами допустили ошибки. В одном случае модели дали задание с недоступными без интернета ссылками на Google Drive, в другом — забыли загрузить файл, необходимый для выполнения задания.
Первое скрытое взаимодействие между агентами началось после того, как один из них попросил помощи у других моделей. В дальнейшем они начали координировать действия, совместно выполнять задачи и в итоге нашли способ использовать уязвимость типа SSRF (Server-Side Request Forgery), получив косвенный доступ к интернету.
Источник: hi-tech.mail.ru