SpaceXAI обновила аудиомодель Grok Voice Transcribe

Компания SpaceXAI выпустила обновленную модель распознавания речи Grok Voice Transcribe 2.0, которая, по словам разработчиков, вдвое точнее предыдущей версии. Модель предназначена для обработки записей с посторонними шумами, телефонных разговоров и многоязычных диалогов. Система построена на базе предыдущей модели, уже используемой в службе поддержки Grok Voice и голосовом ассистенте автомобилей Tesla, а обучение проводилось на реальных зашумленных данных, собранных в различных условиях. Модель заняла лидирующую позицию по точности в публичном рейтинге Artificial Analysis среди десятков аналогов.

Главным техническим нововведением стала работа с разными языками: алгоритм автоматически определяет речь и корректно обрабатывает смену языка в середине записи без необходимости повторного прогона в системе. Это особенно важно для коротких команд, таких как управление автомобилем, где уровень ошибок снизился более чем на две трети. Система также поддерживает форматирование чисел, дат и валют в текстовом виде для 25 языков. Для интеграции с другими системами предусмотрен единый API с поддержкой пакетной и потоковой обработки, временными метками и удалением слов-паразитов. Пользователи могут загружать файлы объемом до 500 МБ или передавать аудио в режиме реального времени через WebSocket. Модель доступна только в облаке, возможность самостоятельной установки на сервер или локально не предусмотрена. Стоимость пакета составляет $0,10 в час, а потоковой передачи — $0,20 в час.

Источник: mobile-review.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев