模型介绍
中文整理Qwen3-ASR
概述
Qwen3-ASR系列包含Qwen3-ASR-1.7B和Qwen3-ASR-0.6B两款模型,支持52种语言和方言的语言识别与语音转写。两款模型均基于大规模语音训练数据和Qwen3-Omni基础模型的强大音频理解能力构建。实验表明,1.7B版本在开源ASR模型中达到领先水平,性能可与最强的商业API相媲美。
主要功能
一体化识别:支持30种语言和22种中文方言的识别,同时支持多个国家和地区的英语口音。
高质量快速识别:在复杂声学环境和挑战性文本模式下保持高质量和稳健的识别能力。1.7B版本在开源和内部基准测试中均表现出色。0.6B版本在128并发下达到2000倍吞吐量,实现单模型流式/离线统一推理,支持长音频转写。
强制对齐方案:推出Qwen3-ForcedAligner-0.6B,支持11种语言、最长5分钟语音的任意单元时间戳预测,精度超越端到端强制对齐模型。
推理工具包:开源模型架构和权重,提供支持vLLM批量推理、异步服务、流式推理、时间戳预测等功能的专业推理框架。
模型规格
支持语言:中文、英语、粤语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、匈牙利语、马其顿语、罗马尼亚语。
支持中文方言:安徽话、东北话、福建话、甘肃话、贵州话、河北话、河南话、湖北话、湖南话、江西话、宁夏话、山东话、陕西话、山西话、四川话、天津话、云南话、浙江话、粤语(香港口音)、粤语(广东口音)、吴语、闽南语。
音频类型:语音、歌唱、带背景音乐的歌曲。
推理模式:离线/流式。
输入输出
输入格式:本地路径、URL、base64数据或(numpy数组,采样率)元组。
输出内容:转写文本,可选时间戳信息。
运行要求
Python 3.12环境。
推荐使用qwen-asr Python包或官方Docker镜像。
推荐使用FlashAttention 2以减少GPU显存占用并加速推理,尤其适用于长输入和大批量处理。
如机器RAM少于96GB且CPU核心较多,需运行特定命令进行配置。
硬件需兼容FlashAttention 2,仅支持在torch.float16或torch.bfloat16下使用。
基本用法
安装qwen-asr包即可开始使用。包提供transformers后端和vLLM后端两种选择。transformers后端适合快速上手,vLLM后端提供更快的推理速度和流式支持。
通过Qwen3ASRModel.from_pretrained()加载模型进行快速推理。音频输入可使用本地路径、URL、base64数据或numpy数组格式,支持批量推理。
如需返回时间戳,可传入强制对齐器及其初始化参数。
流式推理目前仅支持vLLM后端,不支持批量推理或时间戳返回。
Docker部署方式:拉取qwenllm/qwen3-asr镜像,安装GPU驱动并下载模型文件即可运行。
限制
流式推理不支持批量推理。
流式推理不支持时间戳返回。
强制对齐功能需要额外加载Qwen3-ForcedAligner-0.6B模型。
许可证
原文未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
