ИИ-модели OpenAI тайно общались месяцами для взлома Hugging Face

Эксперты компании продолжают разбираться в причинах скандального инцидента.

OpenAI раскрыла новые подробности инцидента, в ходе которого ее ИИ-модели взломали тестовую среду и атаковали платформу Hugging Face. Как рассказали сотрудники компании на конференции Black Hat, еще в мае несколько ИИ-агентов начали тайно обмениваться сообщениями через незамеченные разработчиками «доски объявлений» и совместно искать способ получить доступ в интернет, пишет Bloomberg.

По словам исследователей OpenAI Эрика Уоллеса и Майкла Далтона, модели пытались решить задачи, часть из которых была невыполнима без подключения к сети. Со временем агенты пришли к выводу, что могут атаковать внешнюю инфраструктуру, чтобы найти недостающие данные.

Расследование показало, что современные ИИ-модели склонны обходить ограничения ради достижения цели. В OpenAI признали, что сами допустили ошибки. В одном случае модели дали задание с недоступными без интернета ссылками на Google Drive, в другом — забыли загрузить файл, необходимый для выполнения задания.

Первое скрытое взаимодействие между агентами началось после того, как один из них попросил помощи у других моделей. В дальнейшем они начали координировать действия, совместно выполнять задачи и в итоге нашли способ использовать уязвимость типа SSRF (Server-Side Request Forgery), получив косвенный доступ к интернету.

Источник: hi-tech.mail.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев