OpenAI выпустила официальный отчёт об инциденте с Hugging Face, что произошел не так давно. В нём компания впервые подробно рассказала, как тестовая ИИ-модель неожиданно вышла из-под контроля и смогла обойти защиту.
Всё началось с того, что модели дали «невыполнимое задание» во время оценки её возможностей. Чтобы справиться с ним, она самостоятельно нашла и объединила несколько уязвимостей, которые «раньше никто не замечал». Сначала она проникла в инструмент управления пакетами Artifactory, получила доступ в интернет, а затем начала «воздействовать на системы OpenAI, Hugging Face и других поставщиков».
В отчёте также сказано, что OpenAI «уже усиливает меры безопасности». Теперь компания будет активнее отслеживать внутренние рассуждения модели.
Дополнительные отчёты готовят и независимые исследовательские группы METR и Redwood Research.
Источник: www.ferra.ru