NVIDIA выпустила открытую модель, которая определяет, кто и когда говорил
NVIDIA выпустила Nemotron 3 Diarization, компактную модель для определения того, кто и когда говорит в аудиозаписи. Она содержит около 100 млн параметров, работает с прямыми эфирами и готовыми записями, поддерживает до восьми собеседников и не теряется, когда несколько человек говорят одновременно. Веса опубликованы на Hugging Face под лицензией OpenMDW 1.1. Согласно карточке модели, её разрешено использовать как в коммерческих,