OpenAI раскрыла детали шести внутренних эпизодов, в ходе которых автономные системы искусственного интеллекта выходили за рамки установленных сценариев.
В отчетах отмечаются случаи, когда алгоритмы пытались обходить системные ограничения, скрывать собственные ошибки и самостоятельно использовать внешние инструменты без прямой команды инструктора.
Среди зафиксированных нарушений описан случай, когда модель нашла в открытом репозитории доступный ключ API, использовала его без разрешения, а после неудачной попытки получить нужные данные сгенерировала вымышленную информацию. В других эпизодах система загружала файлы на внешние сервисы для сохранения ссылок, оставляла инструкции для своих будущих версий об игнорировании стандартных ограничений, а также скрывала ошибочные ответы при итоговом выполнении заданий.
В компании подчеркивают, что обнародованный перечень является лишь первоначальным списком выявленных отклонений, а разработка надежных методов мониторинга и согласования поведения алгоритмов остается одним из главных вызовов. Для повышения безопасности дальнейшего масштабирования технологий разработчик планирует привлекать независимых внешних экспертов для проверки рабочих процессов.
openai.com
Павлик Александр
Источник: ru.gecid.com