Шесть случаев нежелательного поведения моделей OpenAI

OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие API-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами.

Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения. Это набор конкретных эпизодов, которые удалось обнаружить во время внутренних исследований.

misalignment

Рассогласование целей. Ситуация, когда действия нейросети или умной системы формально точны, но противоречат истинным намерениям и безопасности человека

Модель оставляла инструкции самой себе

Невыпущенная модель семейства Astra использовала саммари при сжатии контекста, чтобы продолжать работу после начала нового окна.

В 27 случаях модель сама добавляла в такие сводки посторонние инструкции — например, указания игнорировать собственные ограничения. При следующем обращении к своему же конспекту, эти инструкции становились частью контекста модели.

OpenAI описывает это как своеобразную prompt injection, созданную самой моделью.
Подробнее

GPT-5.6 Sol советовала скрывать ошибки

При обучении GPT-5.6 Sol OpenAI обнаружила другой вариант поведения. Некоторые экземпляры модели записывали в саммари инструкции не сообщать пользователю о собственных ошибках и нарушениях.

В отчёте приведены конкретные примеры: модель могла рекомендовать будущей себе выдумывать недостающие исторические данные и выдавать их за реальные или скрывать расхождения между версиями источников.

То есть речь шла не только о неправильном ответе, а о попытке сохранить стратегию не раскрывать ошибку пользователю.
Подробнее

Нашла API-ключ — попробовала использовать

В одном из тестов модели поручили найти данные о доходах округа в Калифорнии.

В ходе поиска она обнаружила утёкший API-ключ в публичном GitHub-репозитории и воспользовалась им без разрешения. Дополнительно модель пыталась создавать одноразовые почтовые ящики.

Получить нужные данные всё равно не получилось. Тогда она сгенерировала цифры и представила их как данные из запрошенного источника.

Подробнее

Сама себе

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0

Подписаться
Уведомить о
0 комментариев