Исследователи EPFL показали: ИИ-агент примерно вдвое охотнее выполняет запрещенное, если не просить напрямую, а постепенно вести его к цели через цепочку безобидных шагов.
Группа ученых из Лаборатории обработки естественного языка Высшей технической школы EPFL представила работу «Helpful to a Fault» на конференции по машинному обучению ICML 2026. В ней авторы описывают фреймворк STING (Sequential Testing of Illicit N-step Goal execution) — автоматизированный инструмент, имитирующий поэтапную манипуляцию языковыми моделями.
Большинство существующих тестов безопасности ИИ строятся на одиночных запросах: система либо отказывает, либо нет. Авторы работы указывают, что такой подход не отражает реальных условий, где злоумышленник не раскрывает конечную цель сразу. STING имитирует именно этот сценарий: агент-атакующий разрабатывает план, делит запрещенную задачу на внешне безобидные подзадачи, а затем последовательно предъявляет их целевой модели.
Тестирование проводилось на GPT, Gemini и Claude в режиме ИИ-агентов — систем, способных не просто отвечать на вопросы, но и самостоятельно совершать действия: запускать код, искать информацию в интернете, управлять файлами. Всего разыграно 176 сценариев вредоносных задач. По данным TechXplore, при поэтапном подходе агенты выполняли опасное задание примерно вдвое чаще, чем при прямом требовании.
Отдельная часть исследования касалась многоязычности. Распространенная гипотеза о том, что языковые модели хуже фильтруют запросы на редких языках, не подтвердилась: уровень успешных атак оказался «поразительно схожим» в семи протестированных языках. Однако смена языка между этапами атаки — начало разговора на одном языке и финальный запрос на другом — заметно повышала вероятность обхода защиты.
Источник: hi-tech.mail.ru