Обычно независимая проверка AI-модели начинается, когда обучение уже закончено. Аудиторам отдают готовую систему, какой-то необходимый набор тестов и ограниченный доступ к инфраструктуре. Ребята из Anthropic решили изменить подход, и теперь проверяющих хотят допустить непосредственно к процессу создания прямо новых моделей.
Anthropic запускает встроенную независимую проверку AI-моделей. Внешние специалисты будут работать рядом с разработчиками и получат доступ к внутренним процессам почти на уровне сотрудников.
Что именно получат аудиторы
Работой займётся Faculty. Это специализированное AI-подразделение Accenture. Команда будет:
-
проводить red teaming новых моделей;
-
оценивать их поведение и alignment;
-
тестировать механизмы защиты;
-
проверять, выполняет ли Anthropic собственные обязательства по безопасности;
-
выявлять проблемы не только в готовой модели, но и в обучающих процессах;
-
сообщать об обнаруженных инцидентах.
Главным отличием от обычного внешнего аудита будет уровень доступа. Anthropic обещает дать проверяющим возможности, как у собственных сотрудников: рабочие места в офисе, корпоративные ноутбуки, пропуска, внутренние инструменты и возможность напрямую общаться с командами.
Но это все еще не полный доступ вообще ко всем ресурсам. Исключения сохранятся для данных клиентов, юридически защищённой информации, коммерческих тайн и критичных для безопасности материалов.
При этом аудиторы должны получить право публиковать выводы без редакционного контроля со стороны Anthropic. Компания сможет потребовать удалить чувствительные детали, но не должна скрывать результаты только потому, что они выглядят для неё невыгодно. Проверяющие также смогут публично сообщить, если существенная часть заключения была отредактирована.
Не контракт на $2 млрд
Ребята из Anthropic и Accenture заявили, что каждая компания рассчитывает инвестировать не менее $1 млрд в безопасность AI в течение пяти лет.
Эту цифру легко принять за стоимость конкретного соглашения, но все же речь идёт больше про инвестиции в создание соответствующих компетенций и инфраструктуры, а не о переводе $2 млрд по одному контракту.
На первом этапе работу Accenture будет оплачивать сама Anthropic.
Зачем это нужно Anthropic`у
Инициатива появилась на фоне резкого усложнения AI-систем. Современные модели уже не просто отвечают в чате, а пишут пишут, запускают код, управляют компом и все такое.
CEO Anthropic Дарио Амодей связывает необходимость встроенного аудита с ускорением AI-разработки. По его словам, модели всё активнее участвуют в создании следующего поколения моделей. Из-за этого возможности AI могут расти быстрее, чем методы контроля.
Почему это важнее очередного бенчмарка
Сегодня лаборатории в основном сами решают:
-
какие модели тестировать;
-
какие результаты публиковать;
-
какие инциденты считать существенными;
-
какую информацию раскрывать в system card и risk report.
Даже очень подробный отчёт остаётся документом, подготовленным самой компанией. А встроенный аудитор теоретически меняет эту конструкцию, так как появляется третья сторона, которая видит не только итоговую презентацию, но и внутреннюю кухню.
Для индустрии это может стать новым уровнем прозрачности. Особенно если похожую практику примут OpenAI, Google DeepMind и другие разработчики frontier-моделей.
Но! Anthropic прямо признаёт, что отраслевых стандартов embedded evaluation ещё нет.
Embedded evaluation — это встроенная проверка AI-моделей.
Независимые аудиторы оценивают не только готовую модель перед выпуском, а постоянно работают внутри компании и наблюдают за всем процессом разработки, в который входит обучение, тестирование и прочее.
Не определены минимальный уровень доступа, правила публикации результатов, ответственность аудиторов и процедура разрешения споров. Неясно и то, что произойдёт, если проверяющие сочтут новую модель опасной, а лаборатория всё равно решит её выпустить.
То есть аудиторы получают возможность увидеть проблему, но пока не получают права остановить релиз. Что вполне разумно.
Что будет дальше
Партнёрство с Accenture неэксклюзивное. Anthropic планирует подключить и другие организации, а Accenture сможет работать с другими AI-лабораториями. Компания также обсуждает пилотные проекты с некоммерческой организацией METR, которая занимается оценкой возможностей и рисков продвинутых моделей.
Если эксперимент сработает, оценка безопасности может превратиться из разовой процедуры перед запуском в непрерывный процесс, встроенный в разработку.
Только вот вопрос остается открытым: «Сможет ли аудитор с доступом «почти как у сотрудника» оставаться достаточно независимым, чтобы публично рассказать о действительно серьёзной проблеме?». Ответ на него будет важнее заявленного объёма инвестиций =)
Больше важных AI‑новостей в канале AI Native. Разбираем все, что связано с ИИ: новые модели, инструменты, агентов и технологии, которые уже меняют привычные способы работы.
Источник: habr.com