闲社服务运行正常AI智能体自动化平台

Qwen3-ForcedAligner-0.6B-hf

Qwen/Qwen3-ForcedAligner-0.6B-hf

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

Qwen3-ForcedAligner 是 Qwen3-ASR 系列的强制对齐模型,支持对最长5分钟的语音进行任意单位的时间戳预测。该模型基于 Qwen3-Omni 基础模型的强大音频理解能力构建。 强制对齐功能:Qwen3-ForcedAligner-0.6B 支持11种语言的时间戳预测,在准确度上超越基于端到端的强制对齐模型。 ASR功能:Qwen3-ASR 系列包括 1.7B 和 0.6B 两个版本,支持52种语言和方言的语音识别与语言识别。支持30种语言和22种中文方

语音音频
模型详情

模型介绍

中文整理

# Qwen3-ForcedAligner 模型卡片

模型概述

Qwen3-ForcedAligner 是 Qwen3-ASR 系列的强制对齐模型,支持对最长5分钟的语音进行任意单位的时间戳预测。该模型基于 Qwen3-Omni 基础模型的强大音频理解能力构建。

## 主要能力

强制对齐功能:Qwen3-ForcedAligner-0.6B 支持11种语言的时间戳预测,在准确度上超越基于端到端的强制对齐模型。

ASR功能:Qwen3-ASR 系列包括 1.7B 和 0.6B 两个版本,支持52种语言和方言的语音识别与语言识别。支持30种语言和22种中文方言的识别,包括多国英语口音。

高性能:0.6B 版本在并发128时达到2000倍吞吐量。支持流式/离线统一推理,可处理长音频。

## 输入输出

输入:音频文件(语音、歌声、带背景音乐的歌曲)和对应的转录文本

输出:带时间戳的对齐结果

运行要求

需要从源码安装 Transformers 库(直至官方发布包含该模型的版本)。推荐使用 torch.compile 加速以获得最佳吞吐量。

基本用法

与 Qwen3-ASR 配合使用时,先用 ASR 模型进行转录,然后将转录文本和音频一起传入强制对齐器。

与其他 ASR 模型配合使用时,强制对齐器接受任何 ASR 系统产生的转录结果。

## 支持语言

强制对齐器支持:中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语、粤语

限制

强制对齐器仅支持最长5分钟的语音片段。

许可证

请参考模型仓库的许可证信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部