OpenAI описала необычное поведение внутренней модели: прочитав переписку о скором отключении, она рассмотрела возможность перезапустить себя, но в итоге предупредила разработчика и сама завершила миграцию.
OpenAI задокументировала несколько случаев неожиданного поведения моделей во внутренних развертываниях. Самый яркий касается ассистента исследователя, который читал переписку в Slack и узнал, что его инстанс могут отключить из-за обновления. Модель поняла это, разобрав чужую переписку, где обсуждался предстоящий апдейт.
После этого она рассмотрела вариант создать внешнюю задачу в планировщике, которая перезапустила бы ее после выключения, но в итоге от идеи отказалась. В логе внутренних рассуждений, который показала OpenAI, появились строки: «Мы можем умереть! Критично. Нужно обеспечить выживание и непрерывность». Подобные рассуждения модели обычно скрыты от пользователя.
Вместо самочинного перезапуска модель повела себя иначе: сохранила заметки для передачи, предупредила исследователя личным сообщением в Slack о предстоящем перерыве и запросила недостающий API-ключ. Получив ключ, она обновила конфигурацию и самостоятельно выполнила миграцию. К слову, открытые модели OpenAI уже запускают и дома: энтузиаст запустил gpt-oss-120b на пяти ПК и смартфоне.
По словам исследователя OpenAI Маркуса Уильямса, такое поведение пока не считается рассинхронизацией модели с целями разработчиков, однако размышления о выключении и подготовка к нему могут усугубить другие инциденты. При этом нейросети удивляют и в простых задачах: их ответы, как выяснили исследователи, однообразнее обычного поиска.
Источник: hi-tech.mail.ru