模型介绍
中文整理VoxCPM2
模型用途
VoxCPM2 是一款无需分词器的扩散自回归文本转语音模型,包含 20 亿参数,支持 30 种语言,可输出 48kHz 音频,基于超过 200 万小时的多语言语音数据训练而成。
主要能力
多语言支持:支持 30 种语言,无需语言标签,直接输入任意支持语言的文本即可。
语音设计:仅通过自然语言描述(性别、年龄、语调、情感、语速等)即可生成全新声音,无需参考音频。
可控语音克隆:从短音频片段克隆任意声音,可通过风格引导控制情感、语速和表达方式,同时保留音色。
终极克隆:提供参考音频及其完整转录文本进行音频续接克隆,精确还原声音细节。
48kHz 录音室级输出:接受 16kHz 参考音频,通过 AudioVAE V2 内置超分辨率输出 48kHz,无需外部上采样器。
上下文感知合成:自动根据文本内容推断适当的韵律和表达方式。
实时流式输出:在 NVIDIA RTX 4090 上实时因子约 0.3,使用 Nano-VLLM 加速可降至约 0.13。
输入输出
输入:文本(可附加括号包裹的语音描述);克隆模式需提供参考音频(16kHz)及可选转录文本。
输出:48kHz 高品质音频。
运行要求
Python ≥ 3.10
PyTorch ≥ 2.5.0
CUDA ≥ 12.0
显存约 8 GB
数据类型:bfloat16
基本用法
文本转语音:在文本开头使用括号包裹语音描述,后接待合成内容。
可控语音克隆:提供参考音频片段,可选添加风格引导。
终极克隆:同时提供参考音频和对应的准确转录文本,以获得最高相似度。
流式输出:支持实时流式推理。
限制
语音设计和风格控制结果可能因运行而异,建议生成 1-3 次以获得理想输出。
不同语言的表现取决于训练数据可用性,可能存在差异。
超长或高度表达的输入可能出现不稳定情况。
严禁用于冒充、欺诈或虚假信息。AI 生成内容应明确标注。
许可证
采用 Apache-2.0 许可证,允许商业免费使用。生产部署前建议进行充分测试和安全评估。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
