DeepSeek представила OCR-модель, которая обрабатывает текст как изображение

Исследователи из DeepSeek показали, как можно полностью переосмыслить процесс распознавания текста. Их новая модель DeepSeek-OCR работает не с текстовыми токенами, как традиционные системы, а с визуальными представлениями страниц. Это меняет сам принцип хранения и анализа информации.

Обычно OCR-модели по символам превращают текст в токены (чем длиннее документ, тем больше вычислений и выше стоимость обработки). DeepSeek предлагает другой путь: превращать текст в изображение, кодировать его через собственный DeepEncoder в компактные визуальные токены, а потом восстанавливать текст обратно. Результат — в разы меньше затрат при почти той же точности.

В экспериментах модель показала впечатляющие результаты. Даже при десятикратном сжатии точность остаётся около 97%, а при двадцатикратном около 60%. Это значит, что система может хранить длинные документы, не теряя смысла, и делать это в десятки раз эффективнее.

Архитектура DeepSeek-OCR устроена по трёхступенчатому принципу:

Локальное внимание для захвата мелких деталей

Свёрточное сжатие в 16 раз

Глобальное внимание для анализа структуры страницы

Кроме того, разработчики внедрили механизм забывания. Старый контекст можно постепенно снижать в разрешении, чтобы свежая информация оставалась точной, а архивные данные занимали меньше места.

Делегируйте часть рутинных задач вместе с BotHub! Для доступа к сервису не требуется VPN и можно использовать российскую карту. По ссылке вы можете получить 100 000 бесплатных токенов для первых задач и приступить к работе с нейросетями прямо сейчас!

Источник

Источник: habr.com

0 0 голоса

Рейтинг новости

0 комментариев

Межтекстовые Отзывы

Посмотреть все комментарии

Даниэль Злобин к записи «Сбер»: международная IT-олимпиада GO.IT для школьников стартовала в России: “Здорово, что продолжают у нас организовываться подобные мероприятия, это опыт, в частности обмен опытом и большие возможности.”

Антон Терехов к записи LG прекращает выпуск Blu-ray-плееров: “Очень странная статья! Как так получается, что компания LG запустила впервые блюрей проигрыватели только в 2018 году? У меня имеется…”

Антон Терехов к записи Blu-ray диски получили второй шанс: “А разве у нас мало людей в стране, у которых есть и блюрей проигрыватели, саундбары с блюрей приводом, домашние кинотеатры…”

Дмитрий Любинецкий к записи В «Почте Mail» теперь можно оплачивать Steam, Battle.net и другие цифровые товары: “Забавно что в почтовом приложении теперь можно и игры оплачивать. Мир изменился))”

Nargis F к записи Российский прототип на базе Атом проехал 695 км на автопилоте: от Москвы до Казани: “Добрый день! В новости есть опечатка. Из заголовка следует, что поездка прошла на электромобиле Атом, однако это не так. Для…”