模型介绍
中文整理Audio8 TTS Preview 0.1B
模型用途
零样本文本转语音模型,支持语音生成和零样本声音克隆。
主要能力
语音生成和声音克隆。主模型约 1.7 亿参数, codec 解码器约 1.2 亿参数。采用慢速和快速自回归双分支架构:慢速分支预测语义 token,快速分支基于慢速隐藏状态预测 codec codebook。
支持语言
主要语言:中文、英语
实验性支持:德语、西班牙语、法语、意大利语、日语、韩语
输入输出
输入:参考音频文件和对应的参考文本(用于克隆)
输出:生成的语音
合成模式:也可不提供参考音频进行普通语音合成
运行要求
推荐配置:Python 3.11 或更高版本,CUDA GPU
CPU 部署:ONNX INT8 版本,约 0.4 GiB 内存,无需 PyTorch 或 Transformers 依赖
基本用法
加载模型时需设置 trust_remote_code=True。进行声音克隆时,用自己的音频和文本替换参考音频和参考文本,参考文本应与参考音频的说话内容一致。
限制
中文和英语是主要目标语言,其他语言质量通常较弱且不稳定。极长、噪音过多或转录错误的参考音频会降低生成稳定性和说话人相似度。生成的语音可能被滥用于冒充或虚假信息,克隆声音需获得同意,并适当披露合成音频。部署前需评估模型的准确性、安全性和法律合规性。
许可证
Audio8 Community License v1.0
非商业用途(研究、个人、教育、评估)免费。
商业用途:年营收(含母公司、子公司和关联公司)低于 200 万美元免费。
年营收 200 万美元及以上需获得 Audio8 书面商业授权。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
