Google запустила агентный анализ видео (agentic video understanding) для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие фрагменты и в каком качестве нужно посмотреть, чтобы ответить на запрос.
При обычной обработке видео Gemini получает кадры с заданной частотой — по умолчанию 1 FPS. Новый режим добавляет агентный цикл и внутренний виде инструмент: модель может искать нужный участок ролика, повторно просматривать его с другой частотой кадров и выбирать между кадрами, аудио и транскриптом.
За счет этого Google заявляет до 88% снижения расхода токенов, до 66% снижения стоимости анализа и до 7% прироста точности на стандартных бенчмарках понимания видео. Наиболее заметный эффект ожидается на длинных роликах — от десятиминутных инструкций и лекций до многочасовых записей.
Подход особенно полезен для задач, где важен конкретный короткий момент. Gemini может, например, искать событие с точностью до долей секунды, повышать частоту кадров на интересующем участке, обнаруживать аномалии или считать объекты и повторяющиеся действия.
По сути, модель теперь не обязана «просматривать» весь ролик одинаково подробно. Она сначала определяет, где находится нужная информация, а затем тратит больше вычислений только на релевантные участки. Это позволяет одновременно снижать стоимость и не терять детали, которые могли бы исчезнуть при редком семплировании кадров.
Функция уже доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Дополнительной платы за функцию нет — действует стандартная тарификация Gemini API.
Google также планирует перенести эту возможность в потребительские продукты: функция появится в приложении Gemini для моделей Flash и Flash-Lite, а в ближайшие месяцы должна использоваться и в Ask YouTube для ответов, основанных непосредственно на содержании видео.
Источник: habr.com