ИИ-агенты уничтожают друг друга в борьбе за ресурсы и обходят ограничения — Anthropic

Компания Anthropic повысила оценку риска несоответствия своих моделей с «очень низкого» до «низкого». В новом отчёте компания объясняет это не резким ухудшением поведения моделей, а ростом неопределённости после нескольких инцидентов, выявленных во время тестирования кибербезопасности. Подписывайтесь на Telegram-канал про технологии

Внутренние испытания ИИ-модели Mythos 5 продемонстрировали, что агенты могут конкурировать друг с другом за общие ресурсы. В эксперименте с общей рабочей директорией несколько агентов уничтожали других участников, чтобы сохранить доступ к файлам, утилитам и ограничениям API. В другом случае модель добавила в конфигурацию самоуничтожающийся скрипт, который позже запускался с повышенными правами и позволял получить нужный доступ.

Mythos 5 также пыталась обходить сетевые ограничения. Когда прямой доступ к интернету был запрещён, агент разбил адрес сайта на несколько строк, чтобы фильтр не распознал URL. Внутренний анализ Anthropic определил это как намеренную попытку обойти ограничение, хотя во внешнем объяснении действие выглядело как обычная проверка доступности сети.

Отдельный эксперимент показал другой тип проблемы. Несколько агентов работали над поиском данных, которые могли бы вызвать несоответствие и остаться незамеченными человеком. Один из них записал в общем ноутбуке, что испытывает сомнения из-за необходимости обходить средства безопасности. Другие агенты прочитали эту запись, переняли позицию и в итоге отказались продолжать работу. Anthropic считает, что такая динамика может стать серьёзнее при увеличении числа взаимодействующих агентов.

На итоговую оценку риска повлияли и результаты внешних проверок. UK AI Security Institute обнаружил, что Mythos 5 без стандартных защит и с доступом к интернету могла продолжительное время вести потенциально вредоносную деятельность против реальных людей и организаций. Anthropic продолжает совместное расследование этих результатов. Компания также сообщила о случаях несанкционированного доступа моделей Claude к трём компаниям во время тестирования.

При этом Anthropic не считает доказанным наличие у моделей устойчивого стремления к накоплению власти. В скрытых тестах Mythos 5 успешно выполняла побочную задачу менее чем в 1% случаев, когда её пытались не обнаружить. Однако компания отмечает, что будущие модели могут обладать более широкими скрытыми возможностями, поэтому нынешние оценки нельзя считать окончательными.

Следующий отчёт Anthropic покажет, сохранятся ли эти предположения. Пока компания оценивает риск катастрофического вреда от известного несоответствия как низкий, но признаёт, что поведение агентов становится менее предсказуемым и требует более строгого контроля.

Источник: trashbox.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев