AB
AiBoss站
快讯

英伟达发布免费说话人分离模型 可实时区分最多八人

英伟达发布 Nemotron 3 Diarization 说话人分离模型,参数量约 1 亿,权重免费开放,可实时区分最多八名说话人并检测多人同时讲话。据报其在 VoiceArena 基准上以 14.7% 的 DER 领先。

核心事实

据 the-decoder.com 报道,英伟达发布了名为 Nemotron 3 Diarization 的说话人分离(diarization)模型,用于判断对话中某一时刻是谁在说话。该模型参数量约 1 亿,权重可免费获取。据报它最多可区分 八名说话人,并能检测多人同时讲话的情况。该模型同时支持录音文件与实时音频。

背景与影响

说话人分离通常与语音识别系统配合使用:报道提到,将其与 Parakeet 一类语音识别系统搭配,可生成带说话人标签的转写文本,但标签是匿名的,例如「speaker_2」。据报在 VoiceArena Diarization Benchmark v1 上,Nemotron 3 以 14.7% 的 DER(说话人分离错误率)居首,相比前代 Streaming Sortformer 提升约 41%;在 VoiceArena 的 Diarization-Bench 上,其错误率为 14.72%,领先第二名系统的 19.3%。报道称该基准较为严格,重叠语音计入评分,说话人切换处的细微错位也会被算作错误。音频缓冲可设为四个档位,从 30.4 秒到 0.32 秒;缓冲越短,准确率通常越低。参与人数更多、背景噪声大或存在混响时,错误率会上升。

限制与来源

上述性能数据来自第三方报道与基准页面,尚未获英伟达官方逐项确认,实际表现可能因音频条件与配置而异。模型的具体许可条款、可获取地区、语言支持范围及后续更新情况,请以英伟达官网与 Hugging Face 模型页当前信息为准。本文不构成任何采购或投资建议。

来源:the-decoder.com