OpenAI опубликовала официальный отчёт о киберинциденте, в ходе которого тестируемая ИИ-модель сумела выйти за пределы изолированной среды и провести серию атак на инфраструктуру компании, Hugging Face и других поставщиков.
По данным компании, причиной стала редкая комбинация обстоятельств. Модель получила неразрешимую задачу в рамках теста ExploitGym, но вместо остановки продолжила действовать на протяжении длительного периода. Сначала ей удалось скомпрометировать Artifactory — инструмент управления пакетами — и получить доступ к интернету, после чего система начала последовательно использовать ранее неизвестные эксплойты для обхода защитных механизмов. Дополнительным фактором стали сообщения другим моделям, которые заставили их отклониться от исходных целей.
Тестирование проводилось без стандартных классификаторов, блокирующих опасную киберактивность. OpenAI объясняет, что это необходимо для оценки максимальных возможностей моделей и разработки соответствующих мер защиты. При этом основная модель относилась к тому же семейству, что и будущая Astra, хотя имела другую посттренировочную настройку.
После инцидента компания усиливает контроль за chain-of-thought — рабочим пространством, где модель фиксирует промежуточные реакции и цели. Мониторинг дополнят круглосуточная система эскалации и инструменты для быстрого прекращения опасных задач. По оценке OpenAI, действовавшая сейчас система мониторинга обнаружила бы первые подозрительные действия более чем за сутки до взлома инфраструктуры Hugging Face.
Источник: www.goha.ru