模型介绍
中文整理# Qwen3-ASR 模型卡片
模型用途
Qwen3-ASR 是阿里云推出的自动语音识别(ASR)模型系列,包含两个规格:Qwen3-ASR-1.7B(17亿参数)和 Qwen3-ASR-0.6B(6亿参数)。该系列模型支持52种语言和方言的语音识别与语言识别功能。此外还提供 Qwen3-ForcedAligner-0.6B 强制对齐模型,用于预测语音中任意单元的时间戳。
## 主要能力
- *语音识别能力**
支持30种语言(包括中文、英语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、匈牙利语、马其顿语、罗马尼亚语)以及22种中文方言(安徽话、东北话、福建话、甘肃话、贵州话、河北话、河南话、湖北话、湖南话、江西话、宁夏话、山东话、陕西话、山西话、四川话、天津话、云南话、浙江话、粤语香港口音、粤语广东口音、吴语、闽南语)。同时支持多种英语口音识别。
- *功能特性**
支持语音、歌唱声音以及带背景音乐的歌曲识别。采用单一模型实现流式推理与离线推理统一架构,可转录长音频。强制对齐功能支持最长5分钟语音的任意单元时间戳预测,覆盖11种语言。
- *推理框架**
提供基于transformers和vLLM两种后端,支持批量推理、异步服务、流式推理、时间戳预测等功能。
## 输入输出
- *输入格式**
支持本地文件路径、URL链接、base64编码数据或Python元组(numpy数组,采样率)形式的音频输入。
- *输出内容**
输出识别后的文本转录结果。使用强制对齐器时可返回词级或字符级时间戳。
运行要求
- *环境要求**
推荐使用Python 3.12独立环境。transformers后端为最小化安装;vLLM后端需额外安装vLLM相关依赖。建议安装FlashAttention 2以减少GPU显存占用并加速推理,尤其适用于长输入和大批量处理。
- *硬件要求**
若机器RAM少于96GB且CPU核心数较多,需调整配置。需使用与FlashAttention 2兼容的硬件。模型需以torch.float16或torch.bfloat16精度加载才能使用FlashAttention 2。
- *安装方式**
可通过pip从PyPI安装qwen-asr包,或使用官方Docker镜像 qwenllm/qwen3-asr。模型权重在加载时自动下载,也可手动下载到本地目录。
基本用法
- *快速开始**
安装transformers后端:pip install qwen-asr
安装vLLM后端:pip install -U qwen-asr[vllm]
- *推理方式**
使用transformers后端:Qwen3ASRModel.from_pretrained("模型名称")
使用vLLM后端:Qwen3ASRModel.LLM(...)
- *流式推理**
流式推理仅支持vLLM后端,不支持批量推理和时间戳输出。
- *强制对齐**
加载Qwen3-ForcedAligner-0.6B可获取词级或字符级时间戳。
- *部署方式**
支持通过vLLM进行高效推理部署,提供OpenAI兼容API和cURL调用方式。Docker部署需确保NVIDIA Container Toolkit正确配置。
限制
流式推理模式不支持批量推理功能。流式推理不支持时间戳输出。时间戳功能仅在提供aligner-checkpoint时可用。模型评估时使用dtype=torch.bfloat16、max new tokens=1024、greedy搜索,且未指定语言参数。
许可证
原始模型权重遵循阿里云开源许可证协议。具体许可证信息请参阅项目官方仓库。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
