NVIDIA выпустила открытую модель, которая определяет, кто и когда говорил
NVIDIA выпустила Nemotron 3 Diarization, компактную модель для определения того, кто и когда говорит в аудиозаписи. Она содержит около 100 млн параметров, работает с прямыми эфирами и готовыми записями, поддерживает до восьми собеседников и не теряется, когда несколько человек говорят одновременно.Веса опубликованы на Hugging Face под лицензией OpenMDW 1.1.
Согласно карточке модели, её разрешено использовать как в коммерческих, так и в некоммерческих проектах.Nemotron 3 решает задачу диаризации.
habr.com