Microsoft представила голосовую ИИ-модель MAI-Transcribe-2: в тестах она превосходит решения от Google и OpenAI

Компания Microsoft представила сразу три новые модели для работы с голосом — MAI-Transcribe-2-Streaming, MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Они рассчитаны на голосовых ассистентов и другие приложения, где важны скорость обработки и небольшая задержка.

MAI-Transcribe-2-Streaming предназначена для транскрибации речи в реальном времени. Первые фрагменты текста появляются чуть больше чем через 100 мс после поступления аудио, а затем модель уточняет результат по мере продолжения разговора. Она поддерживает 60 языков и умеет автоматически определять язык во время записи. Microsoft заявляет, что в её тестах модель показала лучшую точность среди конкурирующих решений от Google и OpenAI. Стоимость использования до конца 2026 года составит 0,54 доллара за час аудио.

MAI-Voice-2.1 отвечает за преобразование текста в речь и поддерживает 23 языка в 26 языковых версиях. Один и тот же голос может говорить на разных языках, сохраняя особенности звучания и используя соответствующий акцент. Цена модели составляет 22 доллара за миллион символов.

Для задач, где особенно важна скорость, Microsoft выпустила MAI-Voice-2.1-Flash. Она способна генерировать 45 секунд аудио примерно за 150 мс. По данным компании, обработка стала на 55 % быстрее, а стоимость снизилась примерно на 60 % по сравнению с аналогичными решениями. Использование модели обойдётся в 15 долларов за миллион символов.

Все три новинки доступны через Microsoft Foundry, MAI Playground и Vercel. Голосовые модели также можно использовать через OpenRouter и Azure Voice Live, а поддержку LiveKit обещают добавить позднее. Новые решения поддерживают и клонирование голоса на разных языках по нескольким секундам исходной записи.

Источник: trashbox.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев