模型介绍
中文整理Qwen3-ASR(Transformers原生)
概述
Qwen3-ASR系列包含Qwen3-ASR-1.7B和Qwen3-ASR-0.6B两款模型,支持52种语言和方言的语言识别与语音转写。两款模型均基于大规模语音训练数据和基础模型Qwen3-Omni的强大音频理解能力构建。1.7B版本在开源ASR模型中达到先进水平,性能可与最强的商业API相竞争。
主要能力
一体化识别:支持30种语言和22种中文方言的识别,包括多国和地区的英语口音。
高效快速:在复杂声学环境下实现高质量且鲁棒的识别。Qwen3-ASR-0.6B在128并发下达到2000倍吞吐量。两款模型均支持流式/离线统一推理,单模型即可处理长音频。
强制对齐:Qwen3-ForcedAligner-0.6B支持11种语言、最长5分钟语音的任意单位时间戳预测,精度超越基于端到端的强制对齐模型。
输入输出
支持的模型:Qwen3-ASR-1.7B-hf、Qwen3-ASR-0.6B-hf、Qwen3-ForcedAligner-0.6B-hf
支持的语言:中文、英语、粤语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、匈牙利语、马其顿语、罗马尼亚语
支持的中文方言:安徽话、东北话、福建话、甘肃话、贵州话、河北话、河南话、湖北话、湖南话、江西话、宁夏话、山东话、陕西话、山西话、四川话、天津话、云南话、浙江话、粤语(香港)、粤语(广东)、吴语、闽南语
音频类型:语音、歌声、带背景音乐的歌曲
推理模式:离线/流式(ASR模型)、非自回归(强制对齐模型)
运行要求
Transformers版本:v5.13.0及以上原生支持
依赖库:日语处理需要nagisa,韩语处理需要soynlp
加速支持:ASR和强制对齐模型均支持torch.compile。在A100上,强制对齐模型加速约2.5倍,ASR生成在批量大小为4时加速约2.4倍。
基本用法
基础转录:使用apply_transcription_request函数处理音频转录请求,该函数会自动处理聊天模板格式。
强制语言指定:通过参数强制指定转录语言。
上下文/热词:通过提示词传递自由形式的上下文信息(如领域特定词汇、姓名或背景信息)以优化转录结果。
批量推理:传入音频路径列表和可选语言参数,一次调用可转录多个文件。
聊天模板:Qwen3 ASR也接受聊天模板输入。apply_transcription_request是apply_chat_template的便捷封装。
训练与微调:可将目标转写本放在助手轮次中,传递output_labels=True进行训练。音频和填充位置会自动掩码。
强制对齐(词级时间戳):使用Qwen3ASRForTokenClassification从转录结果获取词级时间戳。先用ASR模型转录,再与强制对齐器对齐。
评估结果
在HuggingFace Open ASR排行榜上的词错误率(WER):
Qwen3-ASR-1.7B-hf平均WER:5.59
Qwen3-ASR-0.6B-hf平均WER:6.31
限制
强制对齐功能仅支持11种语言:中文、英语、粤语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语。
许可证
原始模型卡片中未包含许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
