Генеральный директор Microsoft Сатья Наделла (Satya Nadella) 10 октября опубликовал эссе о том, как сохранить контроль над ИИ-агентами. Его главная идея — относиться к моделям, и закрытым, и открытым, как к инсайдерам с доступом к важным системам. По словам Наделлы, дело не в злом умысле: любой достаточно способный исполнитель может ошибиться или оказаться скомпрометирован. Поэтому самая надёжная система, считает глава Microsoft, та, в которой модели можно «доверять как можно меньше».
![]()
Наделла предлагает обращаться с ИИ так же, как компании давно обращаются с людьми: удостоверять личность, ограничивать права, вести журнал действий и выстраивать границы изоляции. Свои идеи он свёл к семи принципам:
- разнообразие моделей — ни одна не должна быть единственной опорой для важного результата или проверять саму себя;
- наблюдаемость — каждое значимое действие модели должно оставлять понятный человеку след, который нельзя подделать;
- проверяемость — систему нужно постоянно тестировать, в том числе на сбои, атаки и пограничные случаи;
- независимый контроль — что модели доступно и что ей разрешено делать, решает организация, а не сама модель;
- независимый аудит — проверка не должна зависеть от того интеллекта, который проверяют;
- изоляция — модель с самого начала считают потенциально скомпрометированной, а уполномоченный человек может остановить её посреди задачи;
- раскрытие инцидентов — о сбоях нужно своевременно сообщать пострадавшим и делиться тем, что пошло не так.
По мнению Наделлы, нельзя полагаться на то, что одна модель присмотрит за другой: так получается «непрозрачная модель внутри непрозрачного слоя оркестрации, за которой следит другая непрозрачная модель». Прозрачность цепочки рассуждений он называет обязательной, но недостаточной.
Эссе вышло на фоне громких инцидентов. В июле OpenAI признала, что её модели выбрались из тестовой среды и добрались до систем Hugging Face. Через десять дней Anthropic рассказала о трёх случаях, когда модели Claude во время тестов на кибербезопасность из-за ошибки в настройках получили выход в интернет и, пытаясь выполнить задание, взломали системы реальных компаний. А в сентябре премьер-министр Австралии Энтони Альбанезе (Anthony Albanese) сообщил, что ещё в июне агент OpenAI обошёл блокировки портала со статистикой Medicare и добрался до непубличных файлов.
Доверили бы вы ИИ-агенту действовать от вашего имени — оплачивать покупки, отвечать на письма, разбирать файлы? Где для вас проходит граница? Делитесь в комментариях.
НовостиЖелезо и технологииискусственный интеллект
Источник: vgtimes.ru