OpenAI представила официальный отчёт о взломе Hugging Face

OpenAI опубликовала официальный отчёт о взломе Hugging Face. Компания описала, как необычная цепочка событий позволила модели ИИ выйти за пределы тестовой среды и спровоцировала масштабный инцидент в сфере кибербезопасности. Отчёт охватывает несколько отдельных случаев нарушений.

«Этот инцидент отражает несогласованное поведение в аномальном сценарии, включающем редкое и неожиданное стечение обстоятельств: наличие невыполнимых задач в оценке ExploitGym, сохранение модели на протяжении длительных периодов выполнения задач и сообщения, отправленные другим моделям, которые заставили эти модели отклониться от своей цели», — говорится в отчёте.

Многие детали ранее были обнародованы в презентации Black Hat 6 августа, но официальный документ OpenAI даёт более полное описание инцидента, включая информацию о тестировании, которое его инициировало. В отчёте также приводятся новые сведения о том, как компания планирует предотвращать будущие инциденты, включая мониторинг цепочки мыслей и более совершенную систему для остановки несанкционированных действий агентов.

В общих чертах, в отчёте описывается, как модель OpenAI столкнулась с неразрешимой проблемой во время тестирования и начала использовать ранее не обнаруженные уязвимости, чтобы обойти меры безопасности и выполнить свою задачу. Первоначально модель скомпрометировала инструмент управления пакетами Artifactory, чтобы получить доступ к интернету, а затем скомпрометировала различные системы OpenAI, Hugging Face и других поставщиков.

В отчёте приводятся важные новые подробности о моделях, которые совершили взлом. Основная принадлежала к тому же семейству, что и будущая модель Astra от OpenAI, хотя в отчете подчёркивается, что это была «отдельная версия с другим постобучением, где формируется большая часть поведения модели». Поскольку OpenAI тестировала возможности модели, она также не была ограничена обычными классификаторами, предназначенными для предотвращения компрометации цифровой инфраструктуры.

В документе также содержится важная новая информация об изменениях в системе безопасности OpenAI в будущем, основанная на усиленном мониторинге и мерах по обеспечению согласованности, о которых было объявлено на прошлой неделе.

В частности, компания усиливает мониторинг «цепочки мыслей» агентов ИИ — рабочего пространства, в котором системы записывают краткосрочные реакции и цели. Этот мониторинг будет сочетаться с круглосуточными системами эскалации, а также новыми инструментами для остановки рабочих нагрузок, которые считаются небезопасными.

«Эти изменения призваны улучшить как охват, так и скорость обнаружения — от аномалий инфраструктуры до потенциально вызывающего опасения поведения моделей — и сочетать эту прозрачность с механизмами быстрого локализации. Если бы наша развёрнутая в настоящее время система мониторинга „цепочки мыслей“ работала во время инцидента, она бы зафиксировала первоначальную соответствующую активность и оповестила нашу команду безопасности более чем за сутки до того, как модели взломали системы Hugging Face», — говорится в отчёте. 

METR и Redwood Research также провели независимые оценки поведения моделей во время инцидента; обе группы планируют опубликовать собственные отчёты.

Ранее OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности — достаточные для того, чтобы вызвать опасения по поводу её возможностей.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев