模型详情
模型介绍
中文整理# Breeze TTS 2 模型卡片
模型用途
Breeze TTS 2 是一个开源权重的文本转语音模型,专为实时交互设计。该模型在 Artificial Analysis TTS 排行榜上位列开源模型第一,同时在某些方面优于前沿闭源系统。
## 主要能力
- *语音克隆**:使用参考音频及其完整转录文本,保留音色、节奏、情感和风格。
- *语音设计**:通过自然语言描述创建独特声音,无需参考音频。
- *语音导向**:基于参考音频克隆声音,同时控制语调、情感、节奏和表达方式。
- *语音事件**:在文本中直接添加表达性事件。英语使用括号,如 (laugh)、(cough)、(clears throat)、(sigh);中文使用方括号,如 [笑]、[咳嗽]、[清嗓子]、[叹气]。
- *超低延迟**:在 NVIDIA H100 上使用预热快速路径,首音频延迟低于 40 毫秒。
- *实时流式输出**:在 NVIDIA H100 上实现约 0.32 的实时因子,生成速度约为实时的 3.1 倍。
- *GPU 高效**:Eager 推理约占用 7.7 GiB GPU 内存,推荐最低配置为 12 GB GPU。
- *双语支持**:单个模型可生成自然的英语和中文语音。
## 输入输出
- *输入**:文本、参考音频(可选)、自然语言指令(用于语音设计和导向)
- *输出**:流式单声道 24 kHz 有符号 16 位小端 PCM 音频
运行要求
- *系统环境**:Linux 和 Python 3.10 或更高版本
- *硬件要求**:CUDA 兼容的 NVIDIA GPU
- *GPU 内存**:
- Eager 推理:约 7.7 GiB
- 启用 --fast-all:约 14.4 GiB
- *推荐配置**:
- Eager 推理:12 GB GPU
- 快速路径:24 GB GPU
基本用法
- *语音克隆**:提供清洁的参考音频和准确转录文本,模型将保留说话者的音色、节奏、情感和风格。
- *语音设计**:使用自然语言描述创建声音,无需参考音频。指令语言应与目标文本语言一致。建议使用 --cfg-scale 4 增强指令遵循能力。
- *语音导向**:保留参考说话者身份的同时,控制语调、情感、节奏和表达方式。建议使用 --cfg-scale 4 增强指令遵循能力。
- *流式 API**:默认使用 PyTorch 运行时和 eager 执行。启用 --fast-all 可使用快速路径以获得最佳性能。
限制
- *使用限制**:模型权重、衍生模型和自托管输出仅限研究和非商业用途。未经授权的语音克隆、冒充、欺诈及其他违法或有害使用均被禁止。
- *合规责任**:用户有责任遵守适用法律,并获取输入、参考音频、声音和输出所需的所有权利和同意。
许可证
- *源代码**:Apache License 2.0
- *音频分词器**:基于阿里巴巴 Qwen 团队的 Qwen3-TTS,采用 Apache License 2.0
- *模型权重、适配器、衍生模型和自托管输出**:受 BreezeBlue 研究和非商业许可证约束,Apache License 不授予商业使用权
- *商业使用**:通过 breezeblue.ai 托管平台或 API 生成的内容,在拥有有效付费订阅的情况下可用于商业用途,但付费订阅不授予开源权重模型或自托管输出的商业权利
- *免责声明**:代码和模型材料按"原样"提供,不提供任何明示或暗示的保证,在法律允许的最大范围内免除责任
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
