模型介绍
中文整理# Qwen3-ASR 模型卡片
模型用途
Qwen3-ASR 是阿里云推出的自动语音识别(ASR)模型系列,包含 Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 两个版本。该系列支持52种语言和方言的语种识别与语音转写,并提供 Qwen3-ForcedAligner-0.6B 强制对齐模型用于时间戳预测。
## 主要能力
- *语音识别**:支持30种语言和22种中文方言的语音识别,包括普通话、英语、粤语及多种英语口音。支持处理语音、歌唱声、带背景音乐的歌曲等音频类型。
- *强制对齐**:Qwen3-ForcedAligner-0.6B 支持11种语言的任意单位时间戳预测,最长可处理5分钟语音。
- *推理模式**:支持离线推理和流式推理统一架构,单模型即可完成长音频转写。
- *性能表现**:1.7B版本在开源ASR模型中达到领先水平,性能可与最强商业API竞争。0.6B版本在128并发下吞吐量达到2000倍。
## 输入输出
- *输入格式**:支持本地文件路径、URL、base64数据或(numpy数组,采样率)元组形式输入音频。
- *输出内容**:转写文本,可选输出词级或字符级时间戳。
运行要求
- *环境**:Python 3.12,建议使用独立虚拟环境
- *硬件**:支持 FlashAttention 2 的GPU,模型需以 torch.float16 或 torch.bfloat16 加载
- *内存**:若机器RAM少于96GB且CPU核心较多,需调整配置
- *依赖**:PyTorch、transformers 或 vLLM 后端
基本用法
- *安装**:
- 基础安装:pip install qwen-asr
- 加速推理:pip install qwen-asr[vllm]
- 开发模式:pip install -e .
- *快速使用**:
- transformers 后端:使用 Qwen3ASRModel.from_pretrained() 加载模型
- vLLM 后端:使用 Qwen3ASRModel.LLM() 初始化以获得最快推理速度
- *时间戳输出**:传入 forced aligner 参数即可获取时间戳
限制
- 流式推理不支持批量处理和时间戳输出
- 时间戳功能仅在提供 aligner-checkpoint 时可用
- 部分语言和方言的性能可能低于主流语言
许可证
Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 采用 Qwen3 License
Qwen3-ForcedAligner-0.6B 采用 Tongyi Qianwen License
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
