Google представила Gemini 3.5 Transcribe — модель для распознавания речи в реальном времени, в которой компания делает ставку на точность, низкую задержку и автоматическую очистку текста. Новинку уже можно проверить в AI Studio, а разработчикам доступен API для встраивания модели в свои продукты.

Судя по описанию, Gemini 3.5 Transcribe умеет убирать слова-паразиты, распознавать речь на более чем 85 языках в реальном времени и лучше понимать контекст сказанного. Модель не только вычищает междометия, но и может убрать целые ошибочно сказанные реплики, оставив в тексте актуальный вариант. Это делает её полезной не только для обычной транскрибации, но и для более аккуратной обработки живых записей.
Отдельно Google подчёркивает, что Gemini 3.5 Transcribe доступна через два API: Live API для потокового режима и Interactions API для записанных аудиофайлов. Для готовых записей модель также определяет говорящих и добавляет пометки времени по словам. Такой набор функций ориентирован на сценарии, где важны не только слова, но и структура разговора.
В компании уверяют, что по представленным бенчмаркам Gemini 3.5 Transcribe обошла конкурентов, включая ElevenLabs Scribe v2. Ещё один заявленный показатель — задержка меньше секунды, а доля ошибок на готовых записях составляет 2,6 %. На фоне этого Google говорит о заметном отрыве по точности и скорости.
Сейчас модель уже доступна в Google AI Studio, клавиатуре Gboard для Android и приложении Gemini для macOS. В будущем её также обещают встроить в браузер Chrome. Среди платформ, где Google продвигает Gemini 3.5 Transcribe, также указаны Android, macOS, Google AI Studio, Gemini API, Gboard, Gemini app, Gemini Enterprise Agent Platform и Google Antigravity.
Google заявляет о заметном отрыве от конкурентов по точности и задержке. Достаточно ли этого, чтобы вы доверили Gemini 3.5 Transcribe свои рабочие записи?
PCMacAndroid Новости ChromeНовостиАнонсыЖелезо и технологииGoogleChrome
Источник: vgtimes.ru