模型介绍
中文整理# Qwen3-TTS-Tokenizer-12Hz
模型用途
Qwen3-TTS-Tokenizer-12Hz 是一个语音分词器模型,用于将输入语音编码为离散token进行存储或传输,并可将token解码回语音。该模型出自 Qwen3-TTS 技术报告。
## 主要能力
极端比特率压缩:采用12.5 Hz、16层多码本设计,实现高效声学压缩和高维语义建模。
超低延迟流式生成:基于创新双轨混合流式生成架构,输入单个字符后即可立即输出首个音频数据包,端到端合成延迟最低可达97毫秒。
语音保真:完整保留副语言信息(如语调、情感)和声学环境特征。
## 输入输出
输入:原始语音信号
输出:离散token(编码模式)或语音(解码模式)
运行要求
需要安装 qwen-tts Python包(从PyPI获取)。
基本用法
通过 qwen-tts 包提供的接口进行分词器编码和解码操作。具体用法请参考官方GitHub仓库。
## 支持语言
支持10种主要语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语,以及多种方言语音档案。
## 评估信息
关于语音生成一致性、说话人相似度及分词器基准测试(ASR任务、PESQ、STOI、UTMOS)的详细评估结果,请参阅技术报告或GitHub仓库。
许可证
原始文档中未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
