DeepSeek объявили о запуске новой экспериментальной модели DeepSeek‑V4‑Flash‑Vision‑Exp на своей API-платформе.
Модель наконец-то(!) мультимодальная. Текстовые возможности (работа с агентами, рассуждения, общие знания) на уровне базовой модели DeepSeek‑V4‑Flash. На мультимодальных бенчмарках для агентов новинка приближается к результатам Opus‑4.8.
Чтобы использовать модель, в запросах надо указать параметр model=’deepseek-v4-flash-vision-exp’. Также в день анонса выпущена версия DeepSeek Harness 0.1.1, которая обеспечивает поддержку новой модели «из коробки».

Технические детали API
Пройдемся по пунктам релиза:
-
Поддерживаются конечные точки Chat Completions, Messages и Responses;
-
Допускается смешанный ввод — текст и изображения одновременно;
-
Изображения можно передавать в кодировке base64;
-
Токенизация изображений для биллинга: до 384 токенов за одно изображение, тарификация осуществляется по цене V4‑Flash.
Файловый API
Вместе с моделью запустили бесплатный файловый API. Он даёт загрузить изображение один раз, получить идентификатор file_id, а дальше ссылаться на него в запросах, экономя трафик и избегая повторной отправки данных. Один и тот же файл можно использовать в нескольких вызовах.
Подробнее смотрим здесь и здесь.
Источник: habr.com