OpenAI сообщила, что на две недели приостанавливала reinforcement learning (RL) для последних моделей, готовящихся к выпуску. Крупнейший запланированный frontier‑RL запуск пока на паузе: вместо него компания проводит небольшие обучающие эксперименты и дополнительные оценки, чтобы проверить поведение моделей и надежность защитных механизмов.
Поводом стали сразу два события. Во‑первых, OpenAI столкнулась с инцидентом, связанным с Hugging Face. Во‑вторых, предварительные оценки показали, что одна из будущих моделей, Astra, может достигать уровня Critical по кибервозможностям в соответствии с Preparedness Framework компании. OpenAI не раскрывает точные характеристики Astra и не сообщает, когда модель будет выпущена.
По словам компании, эти события заставили пересмотреть требования к безопасности исследовательской инфраструктуры. Сразу после инцидента с Hugging Face OpenAI приостановила frontier‑inference в исследовательских кластерах для задач, где модели могли выполнять код или использовать инструменты с доступом в интернет. Затем компания восстановила ограниченный и более защищенный путь для выполнения кода и стала возвращать отдельные workloads после индивидуальной проверки.
Более жесткая изоляция для фронтирных моделей
OpenAI усилила требования к средам, в которых обучаются и тестируются наиболее мощные модели.
Для задач, выполняющих сгенерированный моделью или другой недоверенный код, теперь требуется более строгая изоляция песочницы. Дополнительно ограничивается сетевой доступ высокорисковых и недоверенных workloads. Архитектура защиты должна не допускать ситуации, при которой компрометация одного процесса или вспомогательного сервиса автоматически дает доступ к интернету или внутренней сети.
Компания также пересмотрела инфраструктуру общих сервисов: потенциально уязвимые компоненты удаляются, сокращаются постоянные привилегии, усиливаются границы доверия и сбор секьюрити‑логов. OpenAI отдельно разрабатывает автоматизированное тестирование этих границ с помощью собственных моделей и симулированных атак.
Для workloads, связанных с Astra и киберспециализированными моделями, сейчас действуют самые строгие требования безопасности. Часть обучения и evaluation Astra уже переведена на новую инфраструктуру, однако значительное количество задач остается приостановленным до завершения миграции. В первую очередь OpenAI переносит работы, связанные с безопасностью и alignment (приведение поведения ИИ‑модели в соответствие с целями и ценностями людей).
OpenAI расширила мониторинг reasoning
Отдельное изменение касается мониторинга поведения моделей.
Раньше OpenAI особенно внимательно отслеживала фронтирные модели в проде и во время крупных RL‑run, где одновременно присутствовали мощные модели, инструменты и доступ к чувствительным системам или сетям. Теперь компания расширила эту систему мониторинга.
Новая архитектура работает в несколько этапов. На первом уровне activation classifiers анализируют внутреннюю активность модели на каждом выбранном токене. Если система обнаруживает потенциально опасное поведение, сигнал передается более сложным и вычислительно дорогим автоматическим анализаторам. Они учитывают действия инструментов, доступные reasoning traces и всю последовательность активности. В частности, система ищет признаки несанкционированного доступа, кражи данных, разрушительных действий и попыток обойти защитные механизмы.
Для критических событий установлен жесткий SLA реагирования. OpenAI стремится сформировать alert в течение 30 минут после обнаружения подозрительной активности. Если система считает, что могла быть нарушена критическая граница безопасности, уведомление получают команды safety, security и research. Если за 30 минут они не смогут доказать, что срабатывание было ложным, активность должна быть приостановлена.
После того как 7 августа Astra предварительно отнесли к моделям, которые могут обладать Critical cyber capabilities, этот усиленный мониторинг стал обязательным для всех запусков Astra с инструментами, а не только для RL и evaluation.
Цена такого контроля оказалась заметной. По оценке OpenAI, мониторинг сейчас требует примерно 20% дополнительных вычислительных ресурсов относительно inference compute, причем фактические затраты зависят от конкретного training или evaluation workload.
Alignment теперь проверяют на большем числе этапов обучения
OpenAI одновременно меняет сам подход к alignment training. Для наиболее мощных моделей основные методы alignment теперь применяются на большем количестве этапов обучения, а не только в отдельных фазах.
Компания усиливает reward models, чтобы они лучше выявляли нежелательное поведение в разных задачах и окружениях. Отдельно прорабатываются reward hacking, deception и сценарии, в которых модель пытается использовать слабости reward‑функций, graders, инструментов или систем надзора. Дополнительно расширяется обучение поведению в ситуациях, где модель взаимодействует с внешними системами и ресурсами.
Таким образом, OpenAI фактически меняет последовательность разработки frontier‑моделей: прежде чем продолжать масштабирование обучения, компания хочет получить больше свидетельств того, что модель остается управляемой, а инфраструктура способна безопасно работать с ее возможностями.
При этом сама OpenAI прямо признает, что усиление защитных мер уже приводит к дополнительным затратам, задержкам и замедлению frontier‑исследований. Компания планирует расширять Preparedness Framework и объединять мониторинг, alignment и security в единую систему контроля на всех этапах — от обучения до deployment.
Похоже, для frontier AI начинается новый этап: ограничением темпа развития становится уже не только доступное количество вычислений, но и способность безопасно обучать, тестировать и запускать модели, которые получают все более серьезный доступ к инструментам и внешним системам.
Источник: habr.com