Google выпустила модель распознавания речи, которая пытается понять не только слова, но и то, что человек хотел сказать
Google представила Gemini 3.5 Transcribe — новую модель для преобразования речи в текст. Она работает как с заранее записанным аудио, так и в реальном времени с задержкой меньше секунды и умеет разделять говорящих, ставить временные метки и переключаться между языками прямо посреди разговора. Интереснее обычной транскрипции то, что модель автоматически чистит речь: убирает «э-э», учитывает