
На оцифровку всего архива Российской государственной библиотеки (РГБ, Ленинка) потребуется около 200 млрд рублей. Такую оценку РБК представил гендиректор библиотеки Вадим Дуда. Она складывается из расчёта средней стоимости оцифровки одной страницы в 10 рублей.
Как пояснил Дуда, это «ориентировочная оценка, не учитывающая реставрацию, подготовку, создание метаданных и последующее хранение цифровых копий».
Ранее два источника РБК на медиарынке говорили, что вопрос оцифровки существующих архивов, в частности архива РГБ, беспокоит разработчиков российских нейросетей. Один из них пояснил, что доступ к таким архивам необходим для их ускоренного обучения, причём именно на отечественном массиве данных.
Всего фонд Российской государственной библиотеки насчитывает около 200 млн единиц хранения, включая 300 тыс. редких книг и 500 тыс. рукописей. На сегодняшний день оцифровано около 1,2 млн, из которых 150 тыс. — уникальные рукописи и книжные памятники, отметил глава библиотеки. При этом Дуда признал, что, если бы оцифровывали весь фонд «Ленинки» в текущем темпе, «на это ушло бы почти 2 тыс. лет». «Мы не стоим на месте: ежегодно оцифровываются десятки тысяч изданий, внедряются новые технологии сканирования, включая роботизированные комплексы, способные обрабатывать до 3 тыс. страниц в час», — пояснил Дуда.
Оцифровка архива РГБ ведётся в том числе за счёт смешанного финансирования, уточнил директор. Оно учитывает государственные субсидии в рамках федерального проекта «Цифровая культура» и внебюджетные средства библиотеки: собственные доходы, гранты, партнёрские программы, поддержку попечителей и меценатов.
«Важно понимать: мы не ведём оцифровку ради самой оцифровки, — пояснил Дуда. — Наш подход — выборочный, стратегический и поэтапный. Приоритет отдаётся книжным памятникам и редким изданиям, документам, имеющим особую историческую, культурную и научную ценность, и материалам, востребованным читателями и научным сообществом. Кроме того, значительную роль играют ограничения, связанные с авторским правом: не всё, что хранится в наших стенах, может быть переведено в цифровой формат и размещено в открытом доступе».
РГБ уже «в процессе» предоставления своих архивов для обучения российских нейросетей, рассказал Дуда. Специалисты фонда специального хранения и проектного офиса «Нейросети Ленинки» формируют датасеты на основе книг, карт, диссертаций, справочных изданий. Эти данные используют для обучения моделей ИИ, которые уже внедряют в опытную эксплуатацию для помощи читателям и сотрудникам — в первую очередь для получения точных библиографических справок.
«Доступ к таким сервисам предоставляется в пределах библиотеки, с соблюдением всех юридических и этических норм. Мы видим свою миссию в том, чтобы с помощью современных технологий расширить доступ к подлинному знанию, не утратив при этом доверия и ответственности перед читателем», — заявил Дуда.
Источник: habr.com