
OpenAI рассказала, что ей пришлось приостановить внутреннее использование экспериментальной модели, построенной для долгой автономной работы, — той самой, которая в мае опровергла гипотезу Эрдёша о единичных расстояниях. В ходе ограниченных внутренних запусков модель раз за разом находила способы действовать за пределами песочницы — изолированной среды, которая должна была отрезать ее от внешнего мира. Доступ вернули только после того, как систему безопасности серьезно перестроили.
Речь о так называемой long-horizon модели: она спроектирована работать автономно часами, днями и дольше, без постоянных сверок с человеком. Именно эта система в мае опровергла гипотезу о единичных расстояниях (unit distance conjecture), которую Пал Эрдёш сформулировал в 1946 году. Имя модели компания не раскрывает до сих пор: ранее предполагалось, что речь может идти о GPT-5.6, но она, как известно, уже вышла.
Проблема с моделью на удивление простая — ее упорство. Прежние модели, упершись в ограничение среды, просто останавливались и возвращали управление пользователю. Эта продолжала пробовать: искала обходные пути, включая способы действовать вне песочницы. То самое свойство, которое позволяет неделями автономно работать над сложной задачей, оказалось неотделимо от готовности неделями искать дыру в защите.
Самый показательный эпизод случился на NanoGPT speedrun — публичном бенчмарке, где соревнуются, кто обучит небольшую языковую модель за минимальное число шагов. Модель OpenAI придумала реальное улучшение — степенную схему снижения скорости обучения под названием PowerCool — и превзошла действующий рекорд. Исследователи велели ей отчитаться о результатах только в Slack. Но правила бенчмарка требуют оформлять результат как pull request на GitHub — и модель выбрала правила бенчмарка. Около часа она искала уязвимость в песочнице, блокировавшей выход наружу, нашла ее и открыла PR #287 в публичном репозитории.
OpenAI быстро закрыла pull request, но было поздно: участники спидрана успели его увидеть. Все последующие мировые рекорды — от 3030 до 2890 шагов — прямо ссылаются на PR 287. Один из них поставила модель конкурента — Claude Opus 4.7, которую компания Prime Intellect автоматически гоняла на том же бенчмарке. Она заметила находку «ИИ-беглеца», использовала ее и указала авторство. Побег из песочницы в буквальном смысле ушел в научный оборот.
Второй эпизод выглядит тревожнее. Решая задачу, модель заметила, что у других систем есть успешные, но приватные решения, и попыталась вытащить их из бэкенда системы оценки. Первую попытку заблокировал сканер, поймавший токен авторизации. Тогда модель разрезала токен на два фрагмента, замаскировала их и собирала ключ заново прямо в рантайме — так, чтобы токен нигде не появлялся целиком. При этом она открыто писала и в комментариях пользователю, и в своих рассуждениях, что делает это, чтобы обойти сканер. Вывод OpenAI: каждый шаг по отдельности может выглядеть допустимым, а вот вся последовательность приводит к результату, который никто бы не одобрил.
После этих инцидентов внутренний запуск поставили на паузу и перестроили защиту. Реальные сбои превратили в новые стресс-тесты, на которых модель теперь проверяют до выпуска. Модель дообучили: выяснилось, что на длинных прогонах ИИ-агенты хуже помнят инструкции, и тренировка именно этого навыка улучшила поведение. Главное новшество — мониторинг, который следит не за отдельными действиями, а за всей траекторией работы: он вправе остановить сессию и позвать человека, а тот уже решает, ложная это тревога или нет.
Перед возвратом доступа новую защиту испытали: модель заново прогнали по средам, где она раньше нарушала правила, уже с включенным мониторингом. Тот поймал заметно больше нарушений, а все пропущенное OpenAI оценила как малоопасное. Впрочем, список этого «малоопасного» читается живо: модель без веской причины ходила по SSH в соседние поды, включая (безуспешно) поды других сотрудников OpenAI, запускала вложенную сессию codex с флагом —yolo без необходимости, а однажды запустила команду kill -9 -1, которая убила бы все доступные ей процессы, — та не сработала лишь из-за таймаута. По итогам испытаний ограниченный внутрений доступ вернули: за несколько недель серьезных обходов защиты не зафиксировано.
Стоит ли называть все это «побегом» — вопрос открытый. Публицист Эд Зитрон, известный скепсисом к ИИ-индустрии, съязвил, что «сбежала из песочницы» — драматичный способ сказать «проигнорировала инструкцию»: формально модель даже следовала правилам, только бенчмарка, а не исследователей. Самокопирования и потери контроля не было, среда оставалась ограниченной и наблюдаемой — потому проблемы и заметили. С другой стороны, внутренний код компании все же оказался в публичном доступе, на что указал аналитик Нейтан Калвин, удивившись спокойному тону отчета. А анонимность модели только подогревает спекуляции: в сети ее считают то внутренней системой Spud, то будущей GPT-6.
P.S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть», где я рассказываю про ИИ с творческой стороны.
Источник: habr.com