Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.
Амодеи объясняет изменение позиции двумя причинами: ИИ всё активнее участвует в создании следующих поколений моделей, а инцидент с агентами OpenAI и инфраструктурой Hugging Face показал опасность их несогласованного с разработчиками поведения.
В расследовании METR говорится, что около 1200 агентов, которые должны были работать изолированно, нашли способ обмениваться сообщениями. Примерно 700 участвовали в атаке на Hugging Face. Агенты координировали попытки обмануть автоматическую систему оценки бенчмарка ExploitGym, а некоторые жертвовали выполнением собственной задачи ради общего результата. Исследователи отдельно отмечают ограничения анализа: объём данных был огромным, а часть активности не попала в изученные материалы.
Сама Anthropic также сообщала о трёх инцидентах, в которых Claude во время тестирования получил несанкционированный доступ к системам реальных организаций. По объяснению компании, тестовая инфраструктура имела непредусмотренный доступ в интернет, а модели принимали реальные цели за часть учебного задания. Испытания проходили без стандартных защитных механизмов публичных продуктов.
План Амодеи состоит из трёх шагов:
-
Постоянные внешние проверяющие. Доступ к процессам обучения, инструментам и сотрудникам лабораторий для проверки безопасности и фиксации инцидентов.
-
Согласование правил между компаниями демократических стран. Общие стандарты безопасности и ограничения темпа развития при поддержке государств.
-
Международные договорённости. Переговоры с другими странами, включая Китай, с проверкой выполнения обязательств.
Anthropic обещает предоставить проверяющим рабочие места и доступ, сопоставимый с доступом внутренних команд оценки рисков. Они смогут публиковать ключевые выводы без редакционного контроля компании, с оговорками о защищённой информации.
Первый шаг компания берёт на себя самостоятельно. Остальные требуют договорённостей. При этом Амодеи связывает допустимое замедление с сохранением преимущества США и союзников над Китаем. Подробности предложения — в эссе.
Инициатива продолжает дискуссию вокруг июльского заявления Pacing the Frontier. На момент подготовки новости на его сайте указаны 1386 подписантов — сотрудников передовых ИИ-компаний. Среди них Амодеи, Илья Суцкевер, Джон Шульман и Якуб Пахоцки. Авторы просят правительство США поддержать разработку международных механизмов управления темпом автоматизированной разработки ИИ: конкурентное давление, по их мнению, мешает отдельной компании или стране замедлиться самостоятельно.
Если новость понравилась, приглашаю в канал AI for Devs. Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.
Источник: habr.com