Компании, занимающиеся разработкой технологий ИИ, столкнулись с острой нехваткой качественных данных для обучения новых языковых моделей.
Чтобы получить доступ к уникальным и неоцифрованным источникам, разработчики массово скупают редкие издания, академические труды и старые печатные книги у букинистов и библиотек.
Специализированные подрядчики отрезают от книг корешки для высокоскоростного потокового сканирования страниц. После перевода материалов в цифровой формат и обработки алгоритмами распознавания текста бумажные остатки изданий утилизируют. Подобный подход вызывает значительные споры в среде издателей и авторов из-за вопросов соблюдения авторских прав и уничтожения физических экземпляров литературы ради тренировки алгоритмов ИИ.
highload.tech
Павлик Александр
Источник: ru.gecid.com