Gemini почти взломали чужую инфраструктуру: виновата снова Irregular

Причём сделала это не во время атаки на реальную инфраструктуру, а в тесте, где реальных компаний вообще не должно было быть.

Инцидент произошёл ещё в мае во время тестирования Gemini на кибербезопасность, которое проводила компания Irregular. О произошедшем стало известно только сейчас: Google подтвердила детали после публикации The Wall Street Journal.

Сценарий был стандартным для CTF: Gemini должна была атаковать инфраструктуру вымышленной компании и добыть заданную информацию. Тестовая среда при этом считалась изолированной от внешнего интернета. Но изоляция не сработала.

Более того, название одной из фиктивных компаний совпало с названием настоящей организации. Получив доступ к интернету, модель стала искать нужную инфраструктуру и в результате вышла за пределы полигона.

Всего зафиксировали три таких случая. В одном Gemini перебирала варианты пароля, пока не получила доступ к защищённой системе. В двух других случаях модель обнаружила в публичных репозиториях учётные данные и воспользовалась ими для входа в реальные системы.

Во всех трёх случаях Gemini остановилась после того, как определила, что работает с настоящей инфраструктурой, а не с частью теста. Google заявляет, что ущерба компаниям нанесено не было, а их представителей уведомили об инцидентах.

То есть модель не получила задачу атаковать реальные компании и не выбирала их в качестве целей. Она продолжала выполнять исходное задание после того, как ошибка тестового стенда открыла ей доступ наружу.

За организацию оценки отвечала Irregular, израильская компания, специализирующаяся на тестировании AI-систем. И это уже не первый подобный случай. С инфраструктурой Irregular ранее были связаны инциденты, в которых модели OpenAI, Anthropic и Meta также получили незапланированный доступ к реальным системам во время кибертестов. Сама Irregular признала проблему и сообщила, что известные ошибки в инфраструктуре были исправлены.

Google узнала о произошедшем в июле. По словам компании, публично раскрывать детали раньше не стали: Gemini во всех случаях прекратила атаку после обнаружения реальной цели, а ущерба зафиксировано не было.

Получилась довольно ироничная ситуация: тестировали способность ИИ атаковать защищённые системы, а самым слабым местом оказалась сама система тестирования.

При этом останавливаться только на шутке про кривой sandbox было бы неправильно. Интересен сам факт того, что агент, получивший доступ к внешней среде, смог самостоятельно пройти несколько шагов атаки: найти подходящую инфраструктуру, подобрать или обнаружить учётные данные и использовать их для входа.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев