OpenAI сообщила о масштабной кампании по извлечению защищённых рассуждений своих моделей. Компания связывает ключевую группу активности с людьми, связанными с Moonshot AI (разработчик Kimi). При этом OpenAI отдельно отмечает, что не может утверждать, будто все участники кампании работали на одного оператора.
Активность началась 1 июля и поначалу оставалась небольшой. 24 и 25 июля произошёл резкий всплеск: OpenAI зафиксировала 16 000 запросов от более чем 4 000 пользователей, использовавших характерный для извлечения рассуждений паттерн. Дальнейшее расследование выявило похожую активность уже у кластера из более чем 15 000 пользователей. К 28 июля OpenAI заявила, что кампанию удалось полностью пресечь.
Интересен сам метод. Операторы копировали зашифрованные рассуждения из одного диалога, переносили их в другой и просили модель расшифровать и воспроизвести скрытое содержимое в открытом виде.
При этом взлома шифрования не было. OpenAI утверждает, что злоумышленники не получили доступ к базе данных или сохранённым пользовательским чатам. Пишут о манипуляциях с взаимодействием между моделями, которые позволяли выводить защищённые данные в доступной пользователю форме.
OpenAI называет такой подход adversarial distillation — попыткой использовать ответы или внутренние рассуждения одной модели для обучения, воспроизведения или улучшения другой. В компании считают, что масштабное извлечение reasoning может позволить переносить возможности продвинутых моделей в другие системы без сопоставимых затрат на их разработку и безопасность.
После обнаружения кампании OpenAI заблокировала связанные аккаунты и усилила защиту от подобных атак. Компания также сообщила об обнаруженной независимыми исследователями уязвимости, связанной с переносом защищённых рассуждений между разговорами, и заявила, что поделилась информацией о классе атак с партнёрами через Frontier Model Forum.
Отмучу, 16 000 запросов — это не 16 000 успешно украденных рассуждений. В общем, история получилась довольно характерная для гонки моделей: вместо попытки взломать шифрование напрямую операторы пытались убедить сами модели раскрыть то, что им раскрывать не положено.
Источник: habr.com