模型介绍
中文整理# Qwen3-ForcedAligner 模型卡片
模型概述
Qwen3-ForcedAligner 是 Qwen3-ASR 系列的强制对齐模型,支持对最长5分钟的语音进行任意单位的时间戳预测。该模型基于 Qwen3-Omni 基础模型的强大音频理解能力构建。
## 主要能力
强制对齐功能:Qwen3-ForcedAligner-0.6B 支持11种语言的时间戳预测,在准确度上超越基于端到端的强制对齐模型。
ASR功能:Qwen3-ASR 系列包括 1.7B 和 0.6B 两个版本,支持52种语言和方言的语音识别与语言识别。支持30种语言和22种中文方言的识别,包括多国英语口音。
高性能:0.6B 版本在并发128时达到2000倍吞吐量。支持流式/离线统一推理,可处理长音频。
## 输入输出
输入:音频文件(语音、歌声、带背景音乐的歌曲)和对应的转录文本
输出:带时间戳的对齐结果
运行要求
需要从源码安装 Transformers 库(直至官方发布包含该模型的版本)。推荐使用 torch.compile 加速以获得最佳吞吐量。
基本用法
与 Qwen3-ASR 配合使用时,先用 ASR 模型进行转录,然后将转录文本和音频一起传入强制对齐器。
与其他 ASR 模型配合使用时,强制对齐器接受任何 ASR 系统产生的转录结果。
## 支持语言
强制对齐器支持:中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语、粤语
限制
强制对齐器仅支持最长5分钟的语音片段。
许可证
请参考模型仓库的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
