OpenAI выпустила две новые модели распознавания речи: GPT Transcribe для обработки аудиофайлов и GPT Live Transcribe для потоковой расшифровки речи с низкой задержкой. Обе модели уже доступны через API и ориентированы на разработчиков, которым нужны мультиязычное распознавание, учет текстового контекста и работа в реальном времени.
GPT Transcribe: быстрее офлайн-расшифровки
GPT Transcribe предназначена для пакетной обработки аудио и видеофайлов. По данным OpenAI, модель способна обрабатывать записи примерно в 34 раза быстрее реального времени, что делает ее удобной для транскрибации интервью, подкастов, лекций и корпоративных архивов. Она поддерживает учет предварительного текстового контекста и списка ключевых слов, что помогает точнее распознавать профессиональную терминологию, имена и названия компаний.
GPT Live Transcribe: ставка на низкую задержку
Вторая модель — GPT Live Transcribe — оптимизирована для потокового распознавания речи. Она предназначена для голосовых интерфейсов, звонков, видеоконференций и других сценариев, где критична минимальная задержка между произнесенной фразой и появлением текста. Модель также поддерживает мультиязычный ввод и контекстные подсказки.
Что показывают тесты
По данным Artificial Analysis, GPT Transcribe демонстрирует уровень ошибок в словах (WER) 3,3% на бенчмарке AA-WER, что примерно на 0,7 процентного пункта лучше, чем у GPT-4o Transcribe. В общем рейтинге модель пока не занимает первое место.
Модель
WER
Alibaba Fun-Realtime-ASR-Preview
1,7%
ElevenLabs Scribe v2
2,2%
Microsoft MAI-Transcribe-1.5
2,4%
Mistral Voxtral Small
2,8%
Gemini 3.1 Pro
2,8%
OpenAI GPT Transcribe
3,3%
OpenAI заметно улучшила собственные модели распознавания речи, но по текущим независимым оценкам они все еще уступают лидерам рынка.
GPT Transcribe стоит $0,0045 за минуту аудио, а GPT Live Transcribe — $0,017 за минуту. Модели стали заметно дешевле.
Источник: habr.com