模型介绍
中文整理Qwen3-TTS
模型用途
Qwen3-TTS是一个文本转语音模型,支持根据文本生成自然语音。该模型涵盖10种主要语言(中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语)以及多种方言语音档案,可满足全球应用需求。
主要能力
模型具备强大的上下文理解能力,能够根据指令和文本语义自适应控制语调、语速和情感表达,并对噪声输入文本具有显著增强的鲁棒性。
核心特性包括:基于自研Qwen3-TTS-Tokenizer-12Hz实现高效声学压缩和高维语义建模,充分保留副语言信息和声学环境特征;采用离散多码本语言模型架构实现全信息端到端语音建模;基于双轨混合流式生成架构支持流式和非流式生成,单字符输入后即可输出首个音频包,端到端合成延迟低至97毫秒;支持自然语言指令驱动的语音生成,可灵活控制音色、情感和韵律等多维声学属性。
已发布的模型包括:Qwen3-TTS-12Hz-1.7B-VoiceDesign(语音设计)、Qwen3-TTS-12Hz-1.7B-CustomVoice(自定义语音,支持9种优质音色)、Qwen3-TTS-12Hz-1.7B-Base(基础模型,支持3秒快速语音克隆)、Qwen3-TTS-12Hz-0.6B-CustomVoice和Qwen3-TTS-12Hz-0.6B-Base(参数量较小的版本)。
输入输出
输入:文本字符串、语言参数、说话者标识、指令(可选)、参考音频和转写文本(用于语音克隆)
输出:生成的语音音频
运行要求
推荐使用Python 3.12环境。建议使用独立、隔离的环境以避免依赖冲突。推荐安装FlashAttention 2以减少GPU显存占用。需使用兼容FlashAttention 2的硬件,且模型需以torch.float16或torch.bfloat16加载。若机器RAM少于96GB且CPU核心较多,可考虑使用CPU推理。
基本用法
安装:通过pip安装qwen-tts包,或从源码安装
自定义语音生成:调用generate_custom_voice函数,传入文本、语言、说话者标识及可选指令
语音设计:调用generate_voice_design函数,传入目标文本和自然语言指令描述
语音克隆:调用generate_voice_clone函数,传入参考音频及其转写文本;或使用create_voice_clone_prompt创建可复用的提示
Tokenizer编码/解码:使用Qwen3TTSTokenizer进行音频编码和解码
本地Web UI演示:安装包后运行qwen-tts-demo命令启动
限制
模型性能受限于输入音频质量和文本清晰度。语音克隆质量可能受参考音频时长和清晰度影响。某些语言和方言的支持程度可能有所不同。
许可证
请参阅模型发布页面获取具体的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
