闲社服务运行正常AI智能体自动化平台

Audio8-TTS-Preview-0.1b

Audio8/Audio8-TTS-Preview-0.1b

发布机构Audio8

下载访问条件魔搭来源

Audio8 TTS Preview 0.1B 零样本文本转语音模型,支持语音生成和零样本声音克隆。 语音生成和声音克隆。主模型约 1.7 亿参数, codec 解码器约 1.2 亿参数。采用慢速和快速自回归双分支架构:慢速分支预测语义 token,快速分支基于慢速隐藏状态预测 codec codebook。

语音音频
模型详情

模型介绍

中文整理

Audio8 TTS Preview 0.1B

模型用途

零样本文本转语音模型,支持语音生成和零样本声音克隆。

主要能力

语音生成和声音克隆。主模型约 1.7 亿参数, codec 解码器约 1.2 亿参数。采用慢速和快速自回归双分支架构:慢速分支预测语义 token,快速分支基于慢速隐藏状态预测 codec codebook。

支持语言

主要语言:中文、英语

实验性支持:德语、西班牙语、法语、意大利语、日语、韩语

输入输出

输入:参考音频文件和对应的参考文本(用于克隆)

输出:生成的语音

合成模式:也可不提供参考音频进行普通语音合成

运行要求

推荐配置:Python 3.11 或更高版本,CUDA GPU

CPU 部署:ONNX INT8 版本,约 0.4 GiB 内存,无需 PyTorch 或 Transformers 依赖

基本用法

加载模型时需设置 trust_remote_code=True。进行声音克隆时,用自己的音频和文本替换参考音频和参考文本,参考文本应与参考音频的说话内容一致。

限制

中文和英语是主要目标语言,其他语言质量通常较弱且不稳定。极长、噪音过多或转录错误的参考音频会降低生成稳定性和说话人相似度。生成的语音可能被滥用于冒充或虚假信息,克隆声音需获得同意,并适当披露合成音频。部署前需评估模型的准确性、安全性和法律合规性。

许可证

Audio8 Community License v1.0

非商业用途(研究、个人、教育、评估)免费。

商业用途:年营收(含母公司、子公司和关联公司)低于 200 万美元免费。

年营收 200 万美元及以上需获得 Audio8 书面商业授权。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部