Eleven v4 предпочли конкурирующим моделям 75% слушателей в слепых тестах — она поддерживает более 90 языков

ElevenLabs представила новое поколение моделей синтеза речи — Eleven v4 и Eleven v4 Turbo. Новинки получили обновленную архитектуру, которая должна лучше учитывать не только сам текст, но и контекст, интонацию, темп, эмоции и особенности подачи. Параллельно модели появились в сравнительных тестах Artificial Analysis, где качество речи оценивалось в том числе в слепых прослушиваниях.

Обе модели поддерживают более 90 языков, включая русский, английский, китайский, японский, корейский и ряд менее распространенных языков. Eleven v4 рассчитана прежде всего на создание готового контента — озвучку видео, аудиокниг, персонажей и других длинных материалов. Eleven v4 Turbo предназначена для приложений, где важна минимальная задержка, например голосовых ассистентов и AI-агентов.

Основная панель настройки нейросети

Основная панель настройки нейросети

Одним из ключевых направлений обновления стало сохранение индивидуальности голоса. Eleven v4 лучше удерживает тембр, манеру речи и особенности исходного диктора, причем стабильность должна сохраняться даже при повторной генерации отдельных фрагментов и работе с длинными сценариями. Для многоспикерных сцен также предусмотрена поддержка нескольких голосов. Instant Voice Clones позволяют создать копию голоса всего по 10 секундам аудиозаписи, а Professional Voice Clones предназначены для случаев, когда требуется более точное и стабильное воспроизведение исходного голоса.

Для управления подачей Eleven v4 поддерживает текстовые теги. С их помощью можно указать эмоцию, манеру произнесения или действие непосредственно в сценарии — например, [laughs], [whispers], [sighs], а также различные звуковые события. По данным ElevenLabs, медианная задержка вывода составляет около 100 миллисекунд, а время до появления первого звука — примерно 150 миллисекунд. Модель поддерживает потоковую передачу, поэтому речь может начинать воспроизводиться еще до того, как система полностью сформирует ответ.

Клонировать голоса можно теперь более качественно и естественно

Клонировать голоса можно теперь более качественно и естественно

Обе модели доступны через ElevenAPI, а также используются в продуктах ElevenLabs для создания контента и голосовых AI-агентов. При этом компания продолжает развивать модели после запуска, поэтому их характеристики и поведение могут меняться по мере дальнейшего обучения и обновлений.

Как вы думаете, что важнее для синтеза речи: поддержка множества языков или точное сохранение индивидуальности голоса?

НовостиАнонсыОС и программыЖелезо и технологиинейросети

Источник: vgtimes.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев