闲社服务运行正常AI智能体自动化平台

VoxCPM2

OpenBMB/VoxCPM2

发布机构OpenBMB

下载访问条件魔搭来源

VoxCPM2 是一款无需分词器的扩散自回归文本转语音模型,包含 20 亿参数,支持 30 种语言,可输出 48kHz 音频,基于超过 200 万小时的多语言语音数据训练而成。 多语言支持:支持 30 种语言,无需语言标签,直接输入任意支持语言的文本即可。 语音设计:仅通过自然语言描述(性别、年龄、语调、情感、语速等)即可生成全新声音,无需参考音频。

语音音频
模型详情

模型介绍

中文整理

VoxCPM2

模型用途

VoxCPM2 是一款无需分词器的扩散自回归文本转语音模型,包含 20 亿参数,支持 30 种语言,可输出 48kHz 音频,基于超过 200 万小时的多语言语音数据训练而成。

主要能力

多语言支持:支持 30 种语言,无需语言标签,直接输入任意支持语言的文本即可。

语音设计:仅通过自然语言描述(性别、年龄、语调、情感、语速等)即可生成全新声音,无需参考音频。

可控语音克隆:从短音频片段克隆任意声音,可通过风格引导控制情感、语速和表达方式,同时保留音色。

终极克隆:提供参考音频及其完整转录文本进行音频续接克隆,精确还原声音细节。

48kHz 录音室级输出:接受 16kHz 参考音频,通过 AudioVAE V2 内置超分辨率输出 48kHz,无需外部上采样器。

上下文感知合成:自动根据文本内容推断适当的韵律和表达方式。

实时流式输出:在 NVIDIA RTX 4090 上实时因子约 0.3,使用 Nano-VLLM 加速可降至约 0.13。

输入输出

输入:文本(可附加括号包裹的语音描述);克隆模式需提供参考音频(16kHz)及可选转录文本。

输出:48kHz 高品质音频。

运行要求

Python ≥ 3.10

PyTorch ≥ 2.5.0

CUDA ≥ 12.0

显存约 8 GB

数据类型:bfloat16

基本用法

文本转语音:在文本开头使用括号包裹语音描述,后接待合成内容。

可控语音克隆:提供参考音频片段,可选添加风格引导。

终极克隆:同时提供参考音频和对应的准确转录文本,以获得最高相似度。

流式输出:支持实时流式推理。

限制

语音设计和风格控制结果可能因运行而异,建议生成 1-3 次以获得理想输出。

不同语言的表现取决于训练数据可用性,可能存在差异。

超长或高度表达的输入可能出现不稳定情况。

严禁用于冒充、欺诈或虚假信息。AI 生成内容应明确标注。

许可证

采用 Apache-2.0 许可证,允许商业免费使用。生产部署前建议进行充分测试和安全评估。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部