模型介绍
中文整理Qwen3-TTS-12Hz-0.6B-CustomVoice
模型用途
Qwen3-TTS是一款先进的多语言、可控、稳健的流式文本转语音模型。该特定版本为0.6B CustomVoice变体,基于12Hz分词器,支持9种优质音色,并可通过自然语言指令对目标语音进行细粒度风格控制。
主要能力
多语言合成:支持中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。
智能控制:可根据自然语言指令调整语调、节奏和情感表达,例如"用非常开心的语气说话"。
低延迟:针对流式生成进行优化,使用Qwen3-TTS-Tokenizer-12Hz,端到端合成延迟最低可达97毫秒。
支持的说话人
以下为Qwen3-TTS-12Hz-0.6B-CustomVoice支持的说话人。建议使用每位说话人的母语以获得最佳效果:
Vivian:明亮的年轻女性声音,中文
Serena:温暖、温柔的年轻女性声音,中文
Uncle Fu:成熟的男性声音,音色醇厚,中文
Dylan:充满活力的北京男性声音,中文(普通话)
Eric:活泼的成都男性声音,中文(四川话)
Ryan:富有节奏感的动态男性声音,英语
Aiden:阳光的美国男性声音,英语
Ono Anna:活泼的日本女性声音,日语
Sohee:温暖的韩国女性声音,韩语
基本用法
使用Qwen3-TTS时,可安装qwen-tts软件包进行调用。
许可证
原文未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
