DeepSeek представила мультимодальную модель V4-Flash-Vision-Exp — в тестах на уровне Opus 4.8

Компания DeepSeek представила экспериментальную мультимодальную ИИ-модель DeepSeek-V4-Flash-Vision-Exp, способную понимать не только текстовые, но и визуальные запросы. Разработчики заявляют, что в тестовых задачах новая модель приближается к Opus 4.8 компании Anthropic, а в некоторых моментах даже превосходит её. V4-Flash-Vision-Exp основана на флагманской модели V4 Flash, которая изначально могла работать только с текстом. Новая версия получила возможности, благодаря которым умеет анализировать изображения, скриншоты и другой визуальный контент, а также выполнять различные действия на основе анализа информации без постоянного контроля со стороны человека.

V4-Flash-Vision-Exp сохраняет уровень V4-Flash при работе с текстом, обеспечивая аналогичный уровень возможностей в таких направлениях, как агентные сценарии, рассуждения и работа с общеизвестной информацией. При этом основной прирост производительности приходится именно на мультимодальные задачи. Такие задачи являются одним из ключевых направлений развития современных ИИ-агентов, которые должны самостоятельно проходить через несколько последовательных этапов.

DeepSeek заявляет, что изображения в API тарифицируются по модели V4-Flash, но каждое изображение учитывается максимально до 384 токена. Модель поддерживает комбинированные запросы, в которых одновременно содержатся текст и визуальный контент. Это позволяет использовать V4-Flash-Vision-Exp в приложениях, где ИИ должен понимать разный контекст.

Экспериментальная модель DeepSeek-V4-Flash-Vision-Exp на текущий момент ориентирована прежде всего на разработчиков, а доступ к ней можно получить пока только через API DeepSeek. При успешном тестировании мультимодальные функции могут стать частью будущих моделей DeepSeek.

Источник: trashbox.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев