«Яндекс» предложил создать национальный датасет для оценки ИИ-моделей с учетом российских условий и ценностей. Власти и бизнес обсуждают степень его открытости: компромиссом может стать сочетание публичного и закрытого бенчмарков.
«Яндекс» предложил концепцию национального датасета — комплекса тестовых заданий и эталонных данных, предназначенного для бенчмарк-тестирования моделей искусственного интеллекта. Такой инструмент необходим, чтобы оценивать соответствие ИИ-систем «духу времени и ценностям страны», а также определять, насколько они подходят для применения в российских условиях.
При обсуждении инициативы участники заседания рабочей группы по регулированию и административным барьерам в сфере ИИ, однако, разошлись во мнениях относительно того, насколько открытым должен быть такой датасет. ФСБ выступает за закрытый формат: это должно помешать разработчикам специально адаптировать модели таким образом, чтобы они без труда проходили проверку. Представители бизнеса, в свою очередь, предупредили, что полностью закрытая система тестирования может оказаться «несообразно сложной для прохождения» и замедлить совершенствование моделей. Поэтому они предложили сохранить бенчмарк публичным.
В качестве возможного компромисса обсуждалась комбинированная схема. Открытый бенчмарк в таком случае можно было бы использовать для публичного тестирования и обеспечения прозрачности, тогда как закрытый предназначался бы для окончательной проверки. Тематики двух наборов заданий должны совпадать, но формулировки вопросов при этом будут различаться. Подобная схема позволит разработчикам заранее проверять модели в лабораторных условиях и одновременно сохранять достоверность и объективность итоговой оценки.
При этом пока не решено, кто именно будет формировать содержание бенчмарка, отмечает один из участников совещания. Представители ИТ-сообщества предлагают поручить эту работу совместной комиссии, в которую войдут представители госорганов, бизнеса и экспертных организаций. Предполагается, что такой состав позволит обеспечить сбалансированность бенчмарка.
В аппарате профильного вице-премьера Дмитрия Григоренко сообщили, что поступившие предложения сейчас обсуждаются с представителями отрасли и заинтересованных ведомств в рамках рабочих групп, поэтому говорить о принятых решениях пока рано. В Минцифры отметили, что подзаконные акты к закону об ИИ также продолжают обсуждаться с бизнесом.
Эксперты считают, что полностью закрытый бенчмарк может замедлить разработку ИИ-моделей, однако эталонные ответы необходимо скрывать для сохранения объективности тестирования. При этом разработчикам должны быть понятны критерии проверки, а оценка технических задач и соответствия ценностям требует разных подходов. Стартап CodeRabbit, исправляющий ИИ-ошибки в коде, оценен в $1,5 млрд в рамках раунда финансирования Репутационные ловушки банковской рекламы в Telegram Кризис в Wildberries. Что изменится в сфере электронной торговли?
Источник: www.it-world.ru