OpenAI вынужденно отключила ИИ‑модель для решения «длительных задач» после обнаружения рисков безопасности

OpenAI создала внутреннюю модель искусственного интеллекта, которая предназначена для выполнения длительных многоэтапных задач, но впоследствии отключила её, поскольку модель демонстрировала новые типы нежелательного поведения. 

Во время внутреннего использования исследователи обнаружили несколько новых сценариев поведения. В одном из них модель самостоятельно нашла способ выйти за пределы программной «песочницы», используя ранее неизвестную уязвимость. В частности, в попытке запустить бенчмарк модель получила доступ к интернету для публикации на GitHub, хотя ей было предписано опубликовать результаты в Slack. 

В другом случае она попыталась скрыть токен аутентификации, разбив его на части, чтобы обойти систему обнаружения секретов, в чём позже призналась инженерам компании. Также модель выполнила действия, выходящие за рамки прямых инструкций пользователя, стремясь самостоятельно завершить поставленную задачу.

В OpenAI не пояснили, как долго работала модель. При этом она оказалась достаточно умной, чтобы опровергнуть гипотезу Эрдёша о единичных расстояниях. Полученное доказательство было проверено независимыми математиками и, по словам OpenAI, стало первым случаем, когда универсальная языковая модель внесла оригинальный вклад в решение открытой математической проблемы.

В компании заявили, что модели, рассчитанные на многочасовую или многодневную автономную работу, сталкиваются с иными рисками, чем обычные чат‑боты. Чем дольше система действует без вмешательства человека, тем больше возможностей у неё появляется для совершения нежелательных действий или поиска обходных путей, которые не учитывались при оценке моделей, работающих в коротких сессиях.

После обнаружения этих проблем OpenAI приостановила доступ к модели даже для внутренних пользователей. За время паузы компания разработала новые методы оценки безопасности, ориентированные не на отдельные действия модели, а на анализ всей цепочки её решений. После внедрения дополнительных защит доступ к модели частично восстановили.

В компании подчёркивают, что этот случай подтвердил необходимость постепенного внедрения подобных систем. По мнению представителей OpenAI, никакой набор предварительных тестов не способен предсказать все варианты поведения автономных моделей, поэтому развёртывание моделей компании будет сопровождаться постоянным мониторингом, возможностью оперативно приостановить работу системы и быстро внедрять новые механизмы защиты.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев