Microsoft выпустила модель для живой расшифровки речи — она обходит конкурентов по точности

MAI-Transcribe-2-Streaming понимает 60 языков и заняла первое место по точности в рейтинге Artificial Analysis.

Подразделение Microsoft AI представило MAI-Transcribe-2-Streaming. Это первая модель компании для потоковой расшифровки, то есть она переводит речь в текст прямо во время разговора. Вместе с ней Microsoft выпустила две новые модели синтеза речи — MAI-Voice-2.1 и MAI-Voice-2.1-Flash.

В независимом рейтинге Artificial Analysis новая модель заняла первое место по точности. Причем лидирует она сразу в двух зачетах: по итоговой расшифровке и по черновым вариантам, которые система выдает до конца фразы. Первый черновик текста появляется чуть более чем через 100 миллисекунд после начала звука. Затем по мере поступления контекста модель уточняет его и фиксирует окончательную версию. По внутренним тестам Microsoft, слова на экране появляются вдвое быстрее, чем у ближайшего конкурента.

Итоговая расшифровка содержит в среднем 2,5% ошибочных слов. Это лучший результат среди 38 моделей в потоковом тесте Artificial Analysis. По данным бенчмарка, у Grok Voice Transcribe 2.0 этот показатель составляет 2,7%, у Cartesia Ink Preview — 3,1%, у ElevenLabs Scribe v2 Realtime — 3,6%. Готовый текст модель Microsoft выдает через 0,13 секунды после окончания речи, а у Grok на это уходит 0,49 секунды.

MAI-Transcribe-2-Streaming поддерживает 60 языков и сама определяет, на каком из них говорят, даже если собеседник переходит с одного на другой. Быстрые черновики нужны прежде всего голосовым ассистентам. Они могут начать обдумывать ответ или обращаться к другим сервисам еще до того, как человек закончит фразу. Кроме того, живые субтитры появляются на экране почти одновременно с речью. До конца года час расшифровки стоит 0,54 доллара по вводному тарифу.

Источник: hi-tech.mail.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев