模型介绍
中文整理Qwen3-TTS
模型用途
Qwen3-TTS是一款文本转语音模型,支持十种主要语言(中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语)以及多种方言语音配置。该模型可用于语音合成、声音克隆、声音设计和自定义语音生成。
主要能力
模型具备以下核心能力:基于自研Qwen3-TTS-Tokenizer-12Hz实现高效语音声学压缩和高维语义建模;采用离散多码本语言模型架构实现全信息端到端语音建模;支持Dual-Track混合流式生成架构,端到端合成延迟最低可达97毫秒;支持自然语言指令驱动的语音生成,可灵活控制音色、情感和韵律等声学属性。
已发布的模型包括:Qwen3-TTS-12Hz-1.7B-VoiceDesign(声音设计)、Qwen3-TTS-12Hz-1.7B-CustomVoice(自定义语音)、Qwen3-TTS-12Hz-1.7B-Base(基础模型,支持3秒快速声音克隆)、Qwen3-TTS-12Hz-0.6B-CustomVoice和Qwen3-TTS-12Hz-0.6B-Base。
输入输出
自定义语音生成需要输入文本、语言、说话者ID及可选的指令控制参数。声音设计需要输入目标文本和自然语言描述的指令。声音克隆需要提供参考音频和对应文本,也可仅使用参考音频提取说话者嵌入。输出为合成语音。
运行要求
建议使用Python 3.12环境。从PyPI安装qwen-tts包即可使用。推荐使用FlashAttention 2以降低GPU显存占用,该功能仅在模型以torch.float16或torch.bfloat16加载时可用。若机器RAM少于96GB且CPU核心较多,需运行特定配置命令。
基本用法
安装完成后,可导入Qwen3TTSModel进行自定义语音、声音设计和声音克隆。模型权重可通过Hugging Face模型ID或本地目录路径指定。
自定义语音:调用generate_custom_voice函数,传入文本、语言、说话者ID和可选指令。可通过get_supported_speakers和get_supported_languages查看支持的说话者和语言。
声音设计:调用generate_voice_design函数,传入目标文本和自然语言指令描述。
声音克隆:调用generate_voice_clone函数,传入参考音频和文本。若需复用参考提示符,可使用create_voice_clone_prompt构建后重复使用。
分词器编解码:使用Qwen3TTSTokenizer的encode/decode功能处理音频。
本地Web界面演示:安装qwen-tts后运行qwen-tts-demo命令启动。
vLLM离线推理:vLLM-Omni已支持Qwen3-TTS本地离线推理。
限制
目前仅支持离线推理,在线服务将在后续支持。
许可证
(原文未提供许可证信息)
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
