DeepSeek открыла веса экспериментальной V4-Flash-Vision

DeepSeek опубликовала веса DeepSeek-V4-Flash-Vision-Exp — экспериментальной мультимодальной модели на 305 млрд параметров. Их выкатили спустя 10 дней после первоначального релиза V4-Flash и распространяют под лицензией MIT.

Модель построена на архитектуре V4-Flash, к которой добавили визуальный модуль и дополнительное обучение на мультимодальных данных. Задача — получить модель, способную не только работать с текстом, но и анализировать скриншоты, графики и другие изображения, а также использовать инструменты в агентных сценариях.

Мультимодальные задачи

На ApexBench новая модель набрала 36,5 балла против 26,2 у DeepSeek-V4-Flash-0731. Однако сравнение здесь стоит делить на два: предыдущая версия не принимала изображения на входе.

На Agents’ Last Exam V4-Flash-Vision-Exp получила 27,3 балла, против 25,7 у Opus 4.8. На ZeroBench — 35,0 против 34,0.

При этом на других мультимодальных тестах модель пока немного уступает Opus 4.8: на ApexBench — 36,5 против 39,4, на Chartography — 64,3 против 65,0.

Текст и агенты

В задачах, не связанных напрямую с изображениями, модель также показывает улучшения относительно V4-Flash-0731. На Toolathlon-Verified результат вырос с 70,3 до 75,9, а на NL2Repo — с 54,2 до 57,7. На CyberGym результат, наоборот, снизился: с 76,7 до 75,3.

На DeepSWE новинка набрала 59,3 балла, немного обойдя Opus 4.8 с результатом 58,0. На Terminal-Bench 2.1 DeepSeek-V4-Flash-Vision-Exp получила 83,9 против 85,0 у Opus 4.8.

Что в репозитории DeepSeek

В репозитории опубликованы не только веса, но и компоненты для самостоятельного запуска: токенизатор, минимальная реализация инференса на PyTorch, визуальный энкодер, DFlash attention, MoE-компоненты, Hyper-Connections и прямой проход DSpark.

Для изображений предусмотрено несколько форматов передачи — в том числе блочная запись, похожая на используемую в OpenAI, и более компактное представление через специальные теги.

Модель можно запускать через vLLM, SGLang, Transformers и Docker. Сообщество уже подготовило собственные квантованные сборки для локального инференса.

При этом DeepSeek прямо позиционирует V4-Flash-Vision-Exp как экспериментальный чекпоинт, поэтому опубликованные результаты стоит воспринимать прежде всего как демонстрацию нового направления архитектуры, а не как финальные характеристики будущей V4-Vision.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев