闲社服务运行正常AI智能体自动化平台

Qwen3-ASR-0.6B

Qwen/Qwen3-ASR-0.6B

发布机构阿里云通义千问(Qwen)已核实

已核对来源国内镜像可用

Qwen3-ASR 是阿里云推出的自动语音识别(ASR)模型系列,包含 Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 两个版本。该系列支持52种语言和方言的语种识别与语音转写,并提供 Qwen3-ForcedAligner-0.6B 强制对齐模型用于时间戳预测。 语音识别:支持30种语言和22种中文方言的语音识别,包括普通话、英语、粤语及多种英语口音。支持处理语音、歌唱声、带背景音乐的歌曲等音频类型。

语音音频
模型详情

模型介绍

中文整理

# Qwen3-ASR 模型卡片

模型用途

Qwen3-ASR 是阿里云推出的自动语音识别(ASR)模型系列,包含 Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 两个版本。该系列支持52种语言和方言的语种识别与语音转写,并提供 Qwen3-ForcedAligner-0.6B 强制对齐模型用于时间戳预测。

## 主要能力

  • *语音识别**:支持30种语言和22种中文方言的语音识别,包括普通话、英语、粤语及多种英语口音。支持处理语音、歌唱声、带背景音乐的歌曲等音频类型。
  • *强制对齐**:Qwen3-ForcedAligner-0.6B 支持11种语言的任意单位时间戳预测,最长可处理5分钟语音。
  • *推理模式**:支持离线推理和流式推理统一架构,单模型即可完成长音频转写。
  • *性能表现**:1.7B版本在开源ASR模型中达到领先水平,性能可与最强商业API竞争。0.6B版本在128并发下吞吐量达到2000倍。

## 输入输出

  • *输入格式**:支持本地文件路径、URL、base64数据或(numpy数组,采样率)元组形式输入音频。
  • *输出内容**:转写文本,可选输出词级或字符级时间戳。

运行要求

  • *环境**:Python 3.12,建议使用独立虚拟环境
  • *硬件**:支持 FlashAttention 2 的GPU,模型需以 torch.float16 或 torch.bfloat16 加载
  • *内存**:若机器RAM少于96GB且CPU核心较多,需调整配置
  • *依赖**:PyTorch、transformers 或 vLLM 后端

基本用法

  • *安装**:
  • 基础安装:pip install qwen-asr
  • 加速推理:pip install qwen-asr[vllm]
  • 开发模式:pip install -e .
  • *快速使用**:
  • transformers 后端:使用 Qwen3ASRModel.from_pretrained() 加载模型
  • vLLM 后端:使用 Qwen3ASRModel.LLM() 初始化以获得最快推理速度
  • *时间戳输出**:传入 forced aligner 参数即可获取时间戳

限制

  • 流式推理不支持批量处理和时间戳输出
  • 时间戳功能仅在提供 aligner-checkpoint 时可用
  • 部分语言和方言的性能可能低于主流语言

许可证

Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 采用 Qwen3 License

Qwen3-ForcedAligner-0.6B 采用 Tongyi Qianwen License

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部