Рассматривается вариант, при котором часть вопросов скроют от разработчиков.
«Яндекс» и бизнес обсудили с Минцифры создание национального бенчмарка для проверки ИИ на соответствие духовно-нравственным ценностям и условиям их использования в России. На рабочей встрече в Минцифры 13 августа представители компаний обсуждали подходы к созданию набора тестовых заданий и эталонных данных.
По данным источника «Коммерсанта», близкого к Минцифры, такой тест должен оценивать, насколько ИИ соответствует «духу времени и ценностям страны», а также пригодны для работы в российских условиях. Участник совещания подтвердил обсуждение проекта.
Одним из главных вопросов стала степень открытости будущего теста. По словам источника, представители ФСБ выступили за закрытый формат: это должно помешать разработчикам заранее настраивать модели на прохождение проверки. Представители бизнеса, напротив, считают полностью закрытый бенчмарк слишком сложным для регулярного использования и развития моделей.
В качестве компромисса обсуждалась комбинированная схема. Публичный бенчмарк позволил бы разработчикам самостоятельно проверять модели и находить проблемы до выпуска, а закрытая часть использовалась бы для итоговой оценки. При этом тематики заданий могли бы совпадать, а формулировки вопросов — отличаться.
Открытым остается и вопрос о том, кто будет определять содержание теста. ИТ-сообщество предлагает создать совместную комиссию с участием представителей государства, бизнеса и экспертных организаций. Такой подход, по мнению участников обсуждения, должен помочь сформировать сбалансированный набор заданий.
Источник: hi-tech.mail.ru