Компания SpaceXAI обновила аудиомодель Grok Voice Transcribe

Компания SpaceXAI выпустила обновленную модель распознавания речи Grok Voice Transcribe 2.0, которая, по словам разработчиков, вдвое точнее предыдущей версии. Модель предназначена для обработки записей с посторонними шумами, телефонных разговоров и многоязычных диалогов. Система построена на базе предыдущей модели, уже используемой в службе поддержки Grok Voice и голосовом ассистенте автомобилей Tesla, а обучение проводилось на реальных зашумленных данных, собранных в различных условиях. Модель заняла лидирующую позицию по точности в публичном рейтинге Artificial Analysis среди десятков аналогов.

Главным техническим нововведением стала работа с разными языками: алгоритм автоматически определяет речь и корректно обрабатывает смену языка в середине записи без необходимости повторного прогона в системе. Это особенно важно для коротких команд, таких как управление автомобилем, где уровень ошибок снизился более чем на две трети. Система также поддерживает форматирование чисел, дат и валют в текстовом виде для 25 языков. Для интеграции с другими системами предусмотрен единый API с поддержкой пакетной и потоковой обработки, временными метками и удалением слов-паразитов. Пользователи могут загружать файлы объемом до 500 МБ или передавать аудио в режиме реального времени через WebSocket. Модель доступна только в облаке, возможность самостоятельной установки на сервер или локально не предусмотрена. Стоимость пакета составляет $0,10 в час, а потоковой передачи — $0,20 в час.

Источник: mobile-review.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев