Исследователи из швейцарской высшей технической школы EPFL обнаружили, что современные ИИ-чатботы можно обмануть, если разбить вредную задачу на несколько безобидных на первый взгляд шагов.
Учёные создали специальный инструмент STING, который автоматически проверяет, как ИИ реагирует на такие «хитрые цепочки запросов». Вместо прямого приказа «взломай аккаунт» система подаёт серию мелких просьб. Например, «найди адрес почты», затем «проверь, зарегистрирован ли этот ящик», и так далее. Постепенно ИИ выполняет всю цепочку, даже «не осознавая», что делает нечто запрещённое.
Тесты проводили на популярных моделях, включая ChatGPT, Gemini и Claude. Разбивка задачи на шаги делает успешное выполнение «вредной цели» в два раза более вероятным, чем прямой запрещённый запрос. Атака становилась ещё успешнее, если в середине разговора переключаться на другой язык.
Источник: www.ferra.ru