
Google представила Gemini 3.5 Transcribe — новую модель для преобразования речи в текст. Она работает как с заранее записанным аудио, так и в реальном времени с задержкой меньше секунды и умеет разделять говорящих, ставить временные метки и переключаться между языками прямо посреди разговора.
Интереснее обычной транскрипции то, что модель автоматически чистит речь: убирает «э-э», учитывает исправления человека на ходу и может сразу выдавать нормально оформленный текст. Google отдельно продвигает её как основу для голосовых агентов, а не просто сервис расшифровки диктофона.
На многоязычном тесте FLEURS Google заявляет ошибку распознавания около 5%, а время до окончательной транскрипции, по данным Artificial Analysis, сократилось примерно на 70% относительно предыдущего решения Chirp 3. Это всё же тестовые показатели, а качество на шумной кухне, производстве или совещании с плохими микрофонами может отличаться очень сильно.
Голосовые интерфейсы десятилетиями проигрывали клавиатуре по одной банальной причине: человеку приходилось говорить так, чтобы его понял компьютер. Сейчас направление разворачивается — система сама начинает разбираться в паузах, оговорках и исправлениях. И если голос действительно становится надёжным входом для агентов, это куда важнее очередной функции «надиктовать сообщение».
Читать далее
Источник: habr.com