模型介绍
中文整理# Qwen3-ASR 模型卡片
## 概述
Qwen3-ASR系列包含**Qwen3-ASR-1.7B**和**Qwen3-ASR-0.6B**两个版本,支持52种语言和方言的语音识别与语言识别。两个模型均基于大规模语音训练数据构建,并继承了基础模型Qwen3-Omni强大的音频理解能力。1.7B版本在开源ASR模型中达到领先水平,性能可与最强的商业闭源API相媲美。
## 主要能力
- *全能识别**:支持30种语言和22种中文方言的语音识别,包括多国和地区的英语口音。
- *高效快速**:在复杂声学环境下具有高质量且鲁棒的识别能力。Qwen3-ASR-0.6B在并发128时达到2000倍吞吐量。两个模型均支持流式/离线统一推理,可处理长音频。
- *强制对齐**:Qwen3-ForcedAligner-0.6B支持11种语言、最长5分钟语音的任意单位时间戳预测,精度超越基于端到端的强制对齐模型。
## 支持的语言和方言
- *语言**:中文、英语、粤语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、匈牙利语、马其顿语、罗马尼亚语
- *中文方言**:安徽话、东北话、福建话、甘肃话、贵州话、河北话、河南话、湖北话、湖南话、江西话、宁夏话、山东话、陕西话、山西话、四川话、天津话、云南话、浙江话、粤语(香港)、粤语(广东)、吴语、闽南语
## 输入输出
- *输入**:音频(语音、歌唱、带背景音乐的歌曲)
- *输出**:文字转录、词级时间戳(使用强制对齐模型)
运行要求
- 依赖Transformers库,版本需为v5.13.0或更高
- 日语时间戳预测需安装nagisa:pip install nagisa
- 韩语时间戳预测需安装soynlp:pip install soynlp
- 支持torch.compile加速(A100 GPU上强制对齐模型提速约2.5倍,ASR生成提速约2.4倍,批量大小为4)
基本用法
- *转录**:使用Transformers库提供的转录接口
- *强制语言指定**:可强制指定转录语言
- *上下文/热词**:可通过提示传入自由形式的上下文信息(如领域特定词汇、姓名或背景信息)以优化转录效果
- *批量推理**:支持传入音频路径列表和可选语言参数,一次调用转录多个文件
- *聊天模板**:支持聊天模板输入
- *训练/微调**:可使用模型输出的损失进行训练,将目标转录文本放入助手回合并设置output labels=True
- *强制对齐**:使用Qwen3ASRForTokenClassification获取词级时间戳,需先使用ASR模型转录,再使用强制对齐模型进行对齐
## 性能评估
在HuggingFace Open ASR Leaderboard上的词错误率(WER)表现:
| 模型 | 平均WER | AMI | Earnings22 | GigaSpeech | LS Clean | LS Other | SPGISpeech | VoxPopuli |
|------|---------|-----|------------|------------|----------|----------|------------|-----------|
| Qwen3-ASR-1.7B | 5.59 | 9.26 | 9.88 | 7.25 | 1.24 | 2.92 | 2.58 | 5.99 |
| Qwen3-ASR-0.6B | 6.31 | 10.57 | 10.72 | 7.65 | 1.69 | 3.97 | 2.74 | 6.80 |
限制
- 强制对齐功能仅支持11种语言:中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语
- 强制对齐功能最长支持5分钟语音
许可证
请参考模型在HuggingFace Hub上的具体许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
