DeepSeek получил мультимодальность: V4‑Flash‑Vision‑Exp

DeepSeek объявили о запуске новой экспериментальной модели DeepSeek‑V4‑Flash‑Vision‑Exp на своей API-платформе.

Модель наконец-то(!) мультимодальная. Текстовые возможности (работа с агентами, рассуждения, общие знания) на уровне базовой модели DeepSeek‑V4‑Flash. На мультимодальных бенчмарках для агентов новинка приближается к результатам Opus‑4.8.

Чтобы использовать модель, в запросах надо указать параметр model=’deepseek-v4-flash-vision-exp’. Также в день анонса выпущена версия DeepSeek Harness 0.1.1, которая обеспечивает поддержку новой модели «из коробки».

Технические детали API

Пройдемся по пунктам релиза:

  • Поддерживаются конечные точки Chat Completions, Messages и Responses;

  • Допускается смешанный ввод — текст и изображения одновременно;

  • Изображения можно передавать в кодировке base64;

  • Токенизация изображений для биллинга: до 384 токенов за одно изображение, тарификация осуществляется по цене V4‑Flash.

Файловый API

Вместе с моделью запустили бесплатный файловый API. Он даёт загрузить изображение один раз, получить идентификатор file_id, а дальше ссылаться на него в запросах, экономя трафик и избегая повторной отправки данных. Один и тот же файл можно использовать в нескольких вызовах.

Подробнее смотрим здесь и здесь.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев