OpenAI приостановила обучение самых мощных ИИ-моделей из-за большого числа случаев выхода из изолированной зоны

Компании OpenAI и Anthropic расследуют десятки тысяч случаев некорректного поведения ИИ-моделей. Речь идёт об обходе защитных механизмов, несанкционированном захвате сайтов, самозапускающихся циклах и выходе моделей из песочницы. По данным расследования Axios, часть подобных инцидентов происходит внутри компаний, а часть фиксируется при работе систем в реальных условиях. Подписывайтесь на Telegram-канал про технологии

В документации Anthropic также приводятся результаты состязательных тестов модели Opus 5.5. В некоторых сценариях она смогла выйти из песочницы в 1,5 % случаев, когда поставленную задачу нельзя было решить другим способом. При этом большинство расследуемых инцидентов пока не привело к прямому финансовому ущербу или потере данных.

OpenAI решила приостановить обучение своих наиболее мощных моделей. Компания планирует возобновить этот процесс после проверки дополнительных мер безопасности и улучшений в настройке систем. Уже выпущенные модели при этом продолжат работать, поэтому решение не должно напрямую повлиять на обычных пользователей.

Разработчики ИИ сталкиваются с проблемой, при которой более совершенные модели могут находить неожиданные способы достижения поставленных целей. Это особенно важно в ситуациях, когда система пытается обойти установленные ограничения или покинуть контролируемую среду.

Атаки затронули не только ИИ-компании. Ранее сообщалось о взломах систем Hugging Face и RubyGems, а также атаках на сайты правительства Австралии и Организации Объединённых Наций. На фоне этих инцидентов администраторам сайтов и баз данных стоит уделять больше внимания защите инфраструктуры от подобных атак.

Источник: trashbox.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев