闲社服务运行正常AI智能体自动化平台

Nemotron-3-Diarization

nv-community/Nemotron-3-Diarization

发布机构nv-community

下载访问条件魔搭来源

Nemotron 3 Diarization Nemotron 3 Diarization 是一款开源权重的说话人日志识别模型,用于确定真实音频中“谁在何时说话”。该模型支持流式推理和离线推理,最多可处理八位说话人。 模型采用 Sortformer 方法,根据每位说话人在输入音频中的首次出现顺序排列输出通道,从而解决说话人排列问题。

语音音频
模型详情

模型介绍

中文整理

Nemotron 3 Diarization

模型用途

Nemotron 3 Diarization 是一款开源权重的说话人日志识别模型,用于确定真实音频中“谁在何时说话”。该模型支持流式推理和离线推理,最多可处理八位说话人。

主要能力

模型采用 Sortformer 方法,根据每位说话人在输入音频中的首次出现顺序排列输出通道,从而解决说话人排列问题。

对于流式推理,模型采用到达顺序说话人缓存(AOSC)和 FIFO 队列。AOSC 保留先前分块的说话人信息,以在时间推移过程中保持说话人身份;FIFO 队列为每个处理步骤提供最近的帧上下文。

单个检查点支持最低 80 毫秒的输入缓冲延迟,适用于对延迟敏感的应用;最低推荐配置为 0.32 秒;离线风格配置使用 30.4 秒输入缓冲。输出帧分辨率可按 10 毫秒的倍数配置。使用分块推理时,音频最大时长不受限制。

输入输出

输入格式:单个音频文件、音频文件路径列表、numpy 数组(单条或列表)、行分隔的 JSON 清单文件。使用 numpy 数组时必须在 diar_model.diarize() 函数中指定正确的采样率,默认采样率为 16000 Hz。

输出格式:说话人标记的语音片段,格式为“起始秒数、结束秒数、说话人索引”。也可获取说话人活动概率的张量。

运行要求

使用 NVIDIA NeMo Speech 进行训练、微调或推理需安装 Python 3.12 或更高版本、Cython 及新版 PyTorch。使用 Hugging Face Transformers 时需安装 transformers 库。

基本用法

通过 NeMo-Speech.cpp 可在本地运行轻量级 C++ 运行时。使用 NVIDIA NeMo Speech 时,加载模型后调用 diarize() 方法即可执行说话人日志识别。

流式推理需配置以下参数(以 80 毫秒帧为单位):SPKCACHE LEN(说话人缓存总帧数)、FIFO LEN(FIFO 队列附加的先前帧数)、CHUNK LEN(处理分块的帧数)、RIGHT CONTEXT(分块后附加的未来帧数)、UPDATE PERIOD(从 FIFO 队列提取用于更新说话人缓存的帧数)。

不同场景的推荐配置:离线模式延迟 30.4 秒,低延迟 1.04 秒,超低延迟 0.64 秒,极低延迟 0.32 秒。延迟指输入缓冲延迟,计算方式为(CHUNK LEN + RIGHT CONTEXT)× 80 毫秒,不包括计算处理时间。

限制

模型最多支持八位说话人。延迟配置需在延迟和准确性之间权衡,较低的延迟配置可能导致较高的DER(说话人日志错误率)。不同数据集和配置下的性能表现有所不同,实际应用中需根据具体场景选择合适的配置。

许可证

使用本模型需遵守 OpenMDW 许可证协议 1.1 版。该模型可用于商业或非商业用途。

适用场景

Nemotron 3 Diarization 适用于实时或录制的对话音频中的说话人日志识别,包括会议、电话、播客以及需要通用说话人标签和说话人时间戳的语音识别管道。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部