NVIDIA выпустила открытую модель, которая определяет, кто и когда говорил

NVIDIA выпустила Nemotron 3 Diarization, компактную модель для определения того, кто и когда говорит в аудиозаписи. Она содержит около 100 млн параметров, работает с прямыми эфирами и готовыми записями, поддерживает до восьми собеседников и не теряется, когда несколько человек говорят одновременно.

Веса опубликованы на Hugging Face под лицензией OpenMDW 1.1. Согласно карточке модели, её разрешено использовать как в коммерческих, так и в некоммерческих проектах.

Что именно умеет модель

Nemotron 3 решает задачу диаризации. Если обычная система распознавания речи отвечает на вопрос «что сказали», то диаризация определяет «кто говорил в этот момент».

На выходе модель создаёт временную шкалу с анонимными метками:

speaker_0: 00:00–00:07speaker_1: 00:06–00:12speaker_0: 00:13–00:18

Пересечение первых двух отрезков означает, что собеседники говорили одновременно. Nemotron 3 может отмечать такую речь сразу в нескольких каналах.

При этом модель не расшифровывает содержание разговора и не определяет людей по имени или голосу. Она знает только условных speaker_0, speaker_1 и так далее. Для полноценной стенограммы её нужно объединить с ASR-моделью, а для определения личности потребуется отдельная система верификации говорящего.

Nemotron 3 принимает одноканальное аудио с частотой 16 кГц и выдаёт таблицу вероятностей размером [T, 8]. Каждая из восьми колонок соответствует одному говорящему, а строки по умолчанию описывают отрезки продолжительностью 10 мс.

Один чекпойнт для записи и прямого эфира

Одна и та же модель может обрабатывать готовые файлы и потоковое аудио. В последнем случае она получает запись небольшими фрагментами и использует кеш ранее услышанных голосов, чтобы не менять метки собеседников после пауз и перебиваний.

Голоса нумеруются в порядке появления. Первый участник разговора становится speaker_0, следующий speaker_1.

Разработчик может выбирать между несколькими режимами задержки. NVIDIA рекомендует буферы продолжительностью 30,4, 1,04, 0,64 или 0,32 секунды. Технически модель может работать с буфером 80 мс, но минимальным рекомендуемым значением остаются 320 мс.

Эти цифры описывают только количество аудио, которое необходимо накопить перед запуском модели. Сетевая задержка, распознавание слов и остальная обработка в них не учитываются.

Что показали тесты

В предварительном рейтинге VoiceArena Diarization-Bench модель заняла первое место среди 12 систем и 17 конфигураций. Тест включал 139 англоязычных разговоров общей продолжительностью около 22 часов.

Nemotron 3 получила 14,72% DER против 19,3% у ближайшего конкурента. DER, или diarization error rate, складывается из пропущенной речи, ложных срабатываний и случаев, когда реплика приписана не тому участнику. Чем меньше показатель, тем лучше результат.

Разница составляет около 24% в относительном выражении. Однако NVIDIA отдельно предупреждает, что результаты VoiceArena пока предварительные и могут измениться после завершения первой версии тестирования.

В собственных тестах компании Nemotron 3 при буфере 1,04 секунды снизила DER во всех восьми проверенных условиях по сравнению с предыдущей потоковой моделью NVIDIA. Среднее относительное улучшение составило 41%. Предшественница поддерживала только четырёх говорящих, новая модель увеличила предел до восьми.

Прирост особенно заметен в разговорах с большим количеством участников. Правда, на одном из тестов с двумя собеседниками старая модель всё же показала немного меньшую ошибку. Универсальной победы на каждом отдельном сценарии не получилось.

Как запустить

Модель поддерживается фреймворками NVIDIA NeMo и Hugging Face Transformers. Для локального запуска также доступен облегчённый C++-рантайм NeMo-Speech.cpp.

После его установки обработка записи запускается одной командой:

nemo-speech diarize meeting.wav

Можно сразу объединить диаризацию с распознаванием речи и получить результат в JSON:

nemo-speech transcribe meeting.wav --diarize --json

На Hugging Face опубликованы веса в форматах NeMo и Safetensors, примеры кода и интерактивная демонстрация.

Для чего это пригодится

Основные сценарии вполне приземлённые. Это стенограммы совещаний, звонки поддержки, интервью, подкасты, медицинские консультации и голосовые агенты, которым важно понимать не только содержание фразы, но и её автора.

Размер в 100 млн параметров делает Nemotron 3 значительно компактнее современных генеративных моделей. Её можно запускать локально и не отправлять записи разговоров во внешний сервис. Впрочем, требования к скорости и оборудованию всё равно придётся проверять на собственном сценарии.

Попробуйте Kodacode на своём проекте: скачать для IDE, CLI и Desktop. Анонсы обновлений, практические разборы и новости продукта в нашем Telegram‑канале.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев