闲社服务运行正常AI智能体自动化平台

Qwen3-ForcedAligner-0.6B

Qwen/Qwen3-ForcedAligner-0.6B

发布机构阿里云通义千问(Qwen)已核实

已核对来源国内镜像可用

Qwen3-ASR 是阿里云推出的自动语音识别(ASR)模型系列,包含两个规格:Qwen3-ASR-1.7B(17亿参数)和 Qwen3-ASR-0.6B(6亿参数)。该系列模型支持52种语言和方言的语音识别与语言识别功能。此外还提供 Qwen3-ForcedAligner-0.6B 强制对齐模型,用于预测语音中任意单元的时间戳。 支持30种语言(包括中文、英语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来

语音音频
模型详情

模型介绍

中文整理

# Qwen3-ASR 模型卡片

模型用途

Qwen3-ASR 是阿里云推出的自动语音识别(ASR)模型系列,包含两个规格:Qwen3-ASR-1.7B(17亿参数)和 Qwen3-ASR-0.6B(6亿参数)。该系列模型支持52种语言和方言的语音识别与语言识别功能。此外还提供 Qwen3-ForcedAligner-0.6B 强制对齐模型,用于预测语音中任意单元的时间戳。

## 主要能力

  • *语音识别能力**

支持30种语言(包括中文、英语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、匈牙利语、马其顿语、罗马尼亚语)以及22种中文方言(安徽话、东北话、福建话、甘肃话、贵州话、河北话、河南话、湖北话、湖南话、江西话、宁夏话、山东话、陕西话、山西话、四川话、天津话、云南话、浙江话、粤语香港口音、粤语广东口音、吴语、闽南语)。同时支持多种英语口音识别。

  • *功能特性**

支持语音、歌唱声音以及带背景音乐的歌曲识别。采用单一模型实现流式推理与离线推理统一架构,可转录长音频。强制对齐功能支持最长5分钟语音的任意单元时间戳预测,覆盖11种语言。

  • *推理框架**

提供基于transformers和vLLM两种后端,支持批量推理、异步服务、流式推理、时间戳预测等功能。

## 输入输出

  • *输入格式**

支持本地文件路径、URL链接、base64编码数据或Python元组(numpy数组,采样率)形式的音频输入。

  • *输出内容**

输出识别后的文本转录结果。使用强制对齐器时可返回词级或字符级时间戳。

运行要求

  • *环境要求**

推荐使用Python 3.12独立环境。transformers后端为最小化安装;vLLM后端需额外安装vLLM相关依赖。建议安装FlashAttention 2以减少GPU显存占用并加速推理,尤其适用于长输入和大批量处理。

  • *硬件要求**

若机器RAM少于96GB且CPU核心数较多,需调整配置。需使用与FlashAttention 2兼容的硬件。模型需以torch.float16或torch.bfloat16精度加载才能使用FlashAttention 2。

  • *安装方式**

可通过pip从PyPI安装qwen-asr包,或使用官方Docker镜像 qwenllm/qwen3-asr。模型权重在加载时自动下载,也可手动下载到本地目录。

基本用法

  • *快速开始**

安装transformers后端:pip install qwen-asr

安装vLLM后端:pip install -U qwen-asr[vllm]

  • *推理方式**

使用transformers后端:Qwen3ASRModel.from_pretrained("模型名称")

使用vLLM后端:Qwen3ASRModel.LLM(...)

  • *流式推理**

流式推理仅支持vLLM后端,不支持批量推理和时间戳输出。

  • *强制对齐**

加载Qwen3-ForcedAligner-0.6B可获取词级或字符级时间戳。

  • *部署方式**

支持通过vLLM进行高效推理部署,提供OpenAI兼容API和cURL调用方式。Docker部署需确保NVIDIA Container Toolkit正确配置。

限制

流式推理模式不支持批量推理功能。流式推理不支持时间戳输出。时间戳功能仅在提供aligner-checkpoint时可用。模型评估时使用dtype=torch.bfloat16、max new tokens=1024、greedy搜索,且未指定语言参数。

许可证

原始模型权重遵循阿里云开源许可证协议。具体许可证信息请参阅项目官方仓库。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部