Исследователи из MIT провели эксперимент, чтобы понять, как нейросети для генерации изображений используют обучающие данные. Можно ли проследить связь между готовой картинкой и конкретным произведением, на котором модель училась? Вопрос сложный.
Оказалось, что с ростом объёма обучающего набора данных эта связь «полностью теряется». Учёные обучили несколько десятков собственных моделей на разном количестве изображений (до сотен тысяч). Затем они удаляли отдельные картинки из набора и смотрели, изменится ли результат.
Выяснилось, что чем больше данных использовалось для обучения, тем меньше влияет удаление одного изображения. Даже если убрать все работы конкретного художника.
Так что да, художники, что подают в суд на создателей нейросетей за нарушение авторских прав, скорее всего не смогут доказать использование их работ для обучения ИИ.
Источник: www.ferra.ru