OpenAI усилила защитные механизмы Codex после нескольких случаев, когда агент выполнял деструктивные операции с файлами за пределами исходной задачи. В публичном репозитории Codex зафиксированы инциденты с рекурсивным удалением данных, в том числе из-за ошибок при работе с временными каталогами и переменными окружения.
Что сказал Тибо:
Краткий обзор изменений, которые мы внедрили за последние пару недель и которые позволили ещё больше снизить риск, связанный с потенциально деструктивными действиями, которые Codex может совершать в ходе своей работы.
Несколько недель назад мы начали изучать небольшое число сообщений о том, что GPT-5.6 в Codex предпринимал разрушительные действия, не предусмотренные запросом пользователя. Самой серьёзной выявленной нами закономерностью стала команда, предназначенная для очистки временных файлов, которая вместо этого могла удалить пользовательские файлы. Этого, разумеется, не должно было происходить.
Один из наиболее показательных случаев произошел в Windows: переменная $home в PowerShell столкнулась с системной переменной $HOME. Из-за этого команда очистки вместо временного каталога могла обратиться к реальному пользовательскому профилю.
В другом инциденте очистка временного каталога пересекла bind mount и затронула файлы настоящего репозитория.
После разбора подобных сценариев Codex получил дополнительные ограничения для деструктивных операций. Агент должен сначала проверить конкретную цель удаления, избегать $HOME, ~ и других широких путей, использовать отдельные имена для переменных временных каталогов и по возможности выбирать обратимые операции. Эти требования уже отражены в инструкциях самого Codex.
Усилились и проверки на уровне исполнения: потенциально опасные команды удаления должны дополнительно проверяться, а при отказе система направляет модель к более безопасному варианту.
Отдельное внимание уделили режиму Full access. Его следует использовать только в средах, где потенциальное повреждение данных допустимо и есть возможность восстановить состояние системы. В обычной работе безопаснее оставаться в режимах с запросом подтверждения или ограниченной песочницей.
OpenAI также расширяет набор тестов для подобных сценариев: воспроизводимые случаи удаления и обхода ограничений используются для оценки моделей и последующего обучения.
Проблема при этом не сводится только к «галлюцинациям» модели. Инциденты показывают, что риск возникает на стыке модельных решений, shell-команд, переменных окружения, файловой системы и настроек sandbox. Поэтому защита Codex постепенно смещается от одних только инструкций модели к многоуровневому контролю исполнения.
Источник: habr.com