NVIDIA выпустила Nemotron 3 Diarization, компактную модель для определения того, кто и когда говорит в аудиозаписи. Она содержит около 100 млн параметров, работает с прямыми эфирами и готовыми записями, поддерживает до восьми собеседников и не теряется, когда несколько человек говорят одновременно.
Веса опубликованы на Hugging Face под лицензией OpenMDW 1.1. Согласно карточке модели, её разрешено использовать как в коммерческих, так и в некоммерческих проектах.
Что именно умеет модель
Nemotron 3 решает задачу диаризации. Если обычная система распознавания речи отвечает на вопрос «что сказали», то диаризация определяет «кто говорил в этот момент».
На выходе модель создаёт временную шкалу с анонимными метками:
speaker_0: 00:00–00:07speaker_1: 00:06–00:12speaker_0: 00:13–00:18
Пересечение первых двух отрезков означает, что собеседники говорили одновременно. Nemotron 3 может отмечать такую речь сразу в нескольких каналах.
При этом модель не расшифровывает содержание разговора и не определяет людей по имени или голосу. Она знает только условных speaker_0, speaker_1 и так далее. Для полноценной стенограммы её нужно объединить с ASR-моделью, а для определения личности потребуется отдельная система верификации говорящего.
Nemotron 3 принимает одноканальное аудио с частотой 16 кГц и выдаёт таблицу вероятностей размером [T, 8]. Каждая из восьми колонок соответствует одному говорящему, а строки по умолчанию описывают отрезки продолжительностью 10 мс.
Один чекпойнт для записи и прямого эфира
Одна и та же модель может обрабатывать готовые файлы и потоковое аудио. В последнем случае она получает запись небольшими фрагментами и использует кеш ранее услышанных голосов, чтобы не менять метки собеседников после пауз и перебиваний.
Голоса нумеруются в порядке появления. Первый участник разговора становится speaker_0, следующий speaker_1.
Разработчик может выбирать между несколькими режимами задержки. NVIDIA рекомендует буферы продолжительностью 30,4, 1,04, 0,64 или 0,32 секунды. Технически модель может работать с буфером 80 мс, но минимальным рекомендуемым значением остаются 320 мс.
Эти цифры описывают только количество аудио, которое необходимо накопить перед запуском модели. Сетевая задержка, распознавание слов и остальная обработка в них не учитываются.
Что показали тесты
В предварительном рейтинге VoiceArena Diarization-Bench модель заняла первое место среди 12 систем и 17 конфигураций. Тест включал 139 англоязычных разговоров общей продолжительностью около 22 часов.
Nemotron 3 получила 14,72% DER против 19,3% у ближайшего конкурента. DER, или diarization error rate, складывается из пропущенной речи, ложных срабатываний и случаев, когда реплика приписана не тому участнику. Чем меньше показатель, тем лучше результат.
Разница составляет около 24% в относительном выражении. Однако NVIDIA отдельно предупреждает, что результаты VoiceArena пока предварительные и могут измениться после завершения первой версии тестирования.
В собственных тестах компании Nemotron 3 при буфере 1,04 секунды снизила DER во всех восьми проверенных условиях по сравнению с предыдущей потоковой моделью NVIDIA. Среднее относительное улучшение составило 41%. Предшественница поддерживала только четырёх говорящих, новая модель увеличила предел до восьми.
Прирост особенно заметен в разговорах с большим количеством участников. Правда, на одном из тестов с двумя собеседниками старая модель всё же показала немного меньшую ошибку. Универсальной победы на каждом отдельном сценарии не получилось.
Как запустить
Модель поддерживается фреймворками NVIDIA NeMo и Hugging Face Transformers. Для локального запуска также доступен облегчённый C++-рантайм NeMo-Speech.cpp.
После его установки обработка записи запускается одной командой:
nemo-speech diarize meeting.wav
Можно сразу объединить диаризацию с распознаванием речи и получить результат в JSON:
nemo-speech transcribe meeting.wav --diarize --json
На Hugging Face опубликованы веса в форматах NeMo и Safetensors, примеры кода и интерактивная демонстрация.
Для чего это пригодится
Основные сценарии вполне приземлённые. Это стенограммы совещаний, звонки поддержки, интервью, подкасты, медицинские консультации и голосовые агенты, которым важно понимать не только содержание фразы, но и её автора.
Размер в 100 млн параметров делает Nemotron 3 значительно компактнее современных генеративных моделей. Её можно запускать локально и не отправлять записи разговоров во внешний сервис. Впрочем, требования к скорости и оборудованию всё равно придётся проверять на собственном сценарии.
Попробуйте Kodacode на своём проекте: скачать для IDE, CLI и Desktop. Анонсы обновлений, практические разборы и новости продукта в нашем Telegram‑канале.

Источник: habr.com