Cohere Labs выпустила North Micro Vision — компактную vision‑language model (VLM) с 2,4 млрд параметров. Это самая маленькая зрительно‑языковая модель компании на момент релиза. Основной сценарий North Micro Vision — работа с документами, таблицами, графиками, скриншотами, формами и другими структурированными изображениями.
Главное отличие модели от многих компактных VLM — обработка изображения в исходном разрешении. Обычно перед подачей в мультимодальную модель изображение приводят к фиксированному размеру. При таком ресайзе могут теряться мелкие элементы: текст, подписи на графиках, границы таблиц и другие детали. North Micro Vision сохраняет исходные пропорции изображения, что особенно полезно для document understanding и OCR. При этом высокое разрешение увеличивает требования к памяти и задержку обработки.
Модель выпущена с открытыми весами под лицензией Apache 2.0. Cohere позиционирует ее как компактную основу для прототипирования и task‑specific fine‑tuning — то есть дообучения под конкретную предметную область или тип документов.
Архитектура
Общий размер модели составляет около 2,4 млрд параметров. В ней используется vision encoder примерно на 400 млн параметров, обученный на основе SigLIP 2 SO400M, и языковая часть примерно на 2 млрд параметров.
Языковой backbone построен на архитектуре North Micro LLM. В основе — чередование sliding‑window attention и глобального attention без позиционных эмбеддингов. Для локального внимания используется RoPE, а глобальный слой не привязан к позиционной разметке. Такой дизайн позволяет сочетать локальный контекст с возможностью учитывать информацию на уровне всей последовательности.
Интереснее устроено соединение зрения и языка. Вместо того чтобы передавать языковой модели только один набор визуальных признаков, North Micro Vision использует информацию с нескольких уровней vision encoder и внедряет ее в ранние слои языковой части. Этот подход основан на архитектурной идее DeepStack: языковая модель получает визуальные признаки разной степени абстракции, а не только итоговое представление изображения.
За счет этого модель лучше сохраняет мелкие визуальные детали, которые особенно важны при разборе документов и структурированных изображений.
На что рассчитана модель
Cohere не позиционирует North Micro Vision как замену крупным универсальным мультимодальным моделям. Ее преимущество — в компактности и специализированных сценариях.
Основные задачи — visual question answering, OCR, распознавание и разбор документов, работа с графиками и таблицами, visual grounding и извлечение структурированных данных. Поддерживаются также несколько изображений в одном запросе и мультиязычный ввод.
Небольшое количество параметров делает модель интересной для локального запуска и дообучения. Cohere отдельно указывает на возможность использовать ее как базовую модель для создания специализированного visual expert под конкретный набор данных.
При этом ограничения тоже существенны. North Micro Vision не является reasoning‑моделью, а ее способности к математическим и программным задачам ограничены. Кроме того, native‑resolution обработка может заметно увеличивать потребление памяти и время инференса по мере роста размера изображения.
Бенчмарки
В опубликованном сравнении Cohere модель сопоставлялась с другими компактными VLM. Сильнее всего North Micro Vision показывает себя именно на задачах, для которых она и проектировалась: документы, графики, понимание структуры изображения и visual grounding.
По данным Cohere, на DocVQA модель получила 0,921, на ChartQA — 0,808, на AI2D — 0,775, а на RefCOCO — 0,732. При этом на более общих тестах вроде MMMU результаты значительно слабее.
Разработчики оптимизировали модель под конкретный класс мультимодальных задач, где критичны детали изображения, пространственная структура и извлечение информации из визуальных данных. Мы получили минимальный размер модели в обмен на специализацию и возможность работать непосредственно с визуальными деталями исходного изображения.
-
Лицензирование: Apache 2.0 License.
-
Статья
-
Модель
-
Демо
Источник: habr.com