«Доверять модели как можно меньше»: глава Microsoft предложил обращаться с ИИ как с подозрительным сотрудником — и объяснил почему

Генеральный директор Microsoft Сатья Наделла (Satya Nadella) 10 октября опубликовал эссе о том, как сохранить контроль над ИИ-агентами. Его главная идея — относиться к моделям, и закрытым, и открытым, как к инсайдерам с доступом к важным системам. По словам Наделлы, дело не в злом умысле: любой достаточно способный исполнитель может ошибиться или оказаться скомпрометирован. Поэтому самая надёжная система, считает глава Microsoft, та, в которой модели можно «доверять как можно меньше».

«Доверять модели как можно меньше»: глава Microsoft предложил обращаться с ИИ как с подозрительным сотрудником — и объяснил почему

Наделла предлагает обращаться с ИИ так же, как компании давно обращаются с людьми: удостоверять личность, ограничивать права, вести журнал действий и выстраивать границы изоляции. Свои идеи он свёл к семи принципам:

  • разнообразие моделей — ни одна не должна быть единственной опорой для важного результата или проверять саму себя;
  • наблюдаемость — каждое значимое действие модели должно оставлять понятный человеку след, который нельзя подделать;
  • проверяемость — систему нужно постоянно тестировать, в том числе на сбои, атаки и пограничные случаи;
  • независимый контроль — что модели доступно и что ей разрешено делать, решает организация, а не сама модель;
  • независимый аудит — проверка не должна зависеть от того интеллекта, который проверяют;
  • изоляция — модель с самого начала считают потенциально скомпрометированной, а уполномоченный человек может остановить её посреди задачи;
  • раскрытие инцидентов — о сбоях нужно своевременно сообщать пострадавшим и делиться тем, что пошло не так.

По мнению Наделлы, нельзя полагаться на то, что одна модель присмотрит за другой: так получается «непрозрачная модель внутри непрозрачного слоя оркестрации, за которой следит другая непрозрачная модель». Прозрачность цепочки рассуждений он называет обязательной, но недостаточной.

Эссе вышло на фоне громких инцидентов. В июле OpenAI признала, что её модели выбрались из тестовой среды и добрались до систем Hugging Face. Через десять дней Anthropic рассказала о трёх случаях, когда модели Claude во время тестов на кибербезопасность из-за ошибки в настройках получили выход в интернет и, пытаясь выполнить задание, взломали системы реальных компаний. А в сентябре премьер-министр Австралии Энтони Альбанезе (Anthony Albanese) сообщил, что ещё в июне агент OpenAI обошёл блокировки портала со статистикой Medicare и добрался до непубличных файлов.

Доверили бы вы ИИ-агенту действовать от вашего имени — оплачивать покупки, отвечать на письма, разбирать файлы? Где для вас проходит граница? Делитесь в комментариях.

НовостиЖелезо и технологииискусственный интеллект

Источник: vgtimes.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев