Google выкатила Gemini 3.8 Live и версию с рассуждениями

15 сентября Google представила две нативные speech-to-speech модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Первая заточена под масштаб и цену, вторая — под многошаговые задачи с рассуждением прямо в диалоге.

Интереснее баллов то, что голосовые агенты наконец получили признаки продакшен-продукта. Асинхронные вызовы функций, предсказуемая цена, интеграции с тем, на чем такие системы реально собирают.

Хочу напомнить, как это делалось раньше. Голосовой бот — конвейер из трех сервисов. Распознавание речи, языковая модель и синтез. Задержки складываются, а вместе с текстом может потеряться все остальное — интонация, скорость речи, эмоция, шум на фоне. Модель получает расшифровку и не знает, что собеседник злится. Проблемным было и перебивание. Пока распознавание не закрыло фразу, система вообще не понимает, что ее прервали. Нативная speech-to-speech модель работает с аудио напрямую и снимает оба ограничения разом.

Цифры

Extended Thinking занял первое место в Speech to Speech Quality Index от Artificial Analysis с результатом 82,6. На агентных задачах τ-Voice у него 68,6%, на банковском срезе τ-Voice-banking от Sierra — 35,1%, на Big Bench Audio — 97,7%.

Источник.Источник.

Бенчмарки звучат абстрактно, поэтому переведу. Разговаривать и рассуждать вслух модель научилась отлично. А вот довести клиента до конца банковской процедуры, где надо проверить данные, удержать состояние и не ошибиться в сумме, у нее получается в трети случаев.

Обычная Live встала второй в Speech Agent Arena, и здесь акцент сделан на стоимости. Аудио на входе стоит 0,005 $ за минуту, на выходе — 0,018 $. В пересчете на токены получается примерно 3 $ за миллион входных и $12 за миллион выходных.

Что появилось технически

Асинхронный вызов функций — самое практичное изменение. Инструмент выполняется в фоне, пока аудиопоток продолжается, и агент больше не замолкает, уходя в API. Extended Thinking вдобавок проговаривает прогресс вслух, пока думает. В голосовом интерфейсе это заменяет анимированный значок загрузки, который обычно крутится на экране, пока программа выполняет какую-то задачу.

Из остального — обработка визуального контекста почти в реальном времени и 97 языков с переключением посреди разговора. Отдельно Google поработала над точностью распознавания буквенно-цифровых последовательностей, номеров заказов, кодов, счетов. Аудио на выходе помечается водяным знаком SynthID.

Где это живет

Модели доступны через Gemini API и Google AI Studio, в Gemini Enterprise пока приватное превью. Для пользователей обычная Live уехала в Search Live, Extended Thinking — в Gemini Live и Workspace на тарифах AI Pro и Ultra. Из интеграций заявлены LiveKit, Pipecat, LangChain, Vercel, Agora. Из партнерских кейсов — Salesforce, ServiceNow, Genspark и Lumeris.

В релизе не подсвечена одна оговорка. Self-hosting не предусмотрен, обе модели работают только как хостируемый сервис.

Что это значит

Цену полезно перевести в понятные единицы. Час разговора, где модель говорит примерно половину времени, обходится в доллар с небольшим, без учета вызовов инструментов. Час работы живого оператора почти в любой юрисдикции стоит на порядок дороже.

При таких цифрах экономика сценария упирается уже в интеграции с CRM и телефонией, а главное — в цену ошибки. Поэтому 35,1% на банковском бенчмарке для того, кто планирует внедрить, важнее, чем первое место в общем рейтинге. 

Ограничение тоже понятное. Голос — персональные данные в самой неудобной форме. Голосовой отпечаток, фоновые звуки, случайные фразы третьих лиц рядом. Отсутствие self-hosted варианта закрывает весь класс сценариев, где аудио не имеет права покидать периметр, а в медицине, финансах и госсекторе таких сценариев довольно много.

Кто-нибудь уже собирал голосового агента на нативной speech-to-speech модели? Пишите в комментарии.

ИИ‑роутер — доступ к 300+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев