闲社服务运行正常AI智能体自动化平台

Qwen3-Omni-30B-A3B-Instruct

Qwen/Qwen3-Omni-30B-A3B-Instruct

发布机构Qwen

下载访问条件魔搭来源

Qwen3-Omni 是原生端到端的多语言多模态基础模型。该模型能够处理文本、图像、音频和视频,并以文本和自然语音形式提供实时流式响应。 多模态领先性能:通过早期文本优先预训练和混合多模态训练提供原生多模态支持。在保持文本和图像单模态性能不退化的情况下,在音频和音视频任务上取得优异表现。在36个音频/视频基准测试中取得22项SOTA,在开源模型中取得32项SOTA。语音识别、音频理解和语音对话性能与Gemini 2.5 Pro相当。

多模态
模型详情

模型介绍

中文整理

Qwen3-Omni 模型卡片

概述

Qwen3-Omni 是原生端到端的多语言多模态基础模型。该模型能够处理文本、图像、音频和视频,并以文本和自然语音形式提供实时流式响应。

主要能力

多模态领先性能:通过早期文本优先预训练和混合多模态训练提供原生多模态支持。在保持文本和图像单模态性能不退化的情况下,在音频和音视频任务上取得优异表现。在36个音频/视频基准测试中取得22项SOTA,在开源模型中取得32项SOTA。语音识别、音频理解和语音对话性能与Gemini 2.5 Pro相当。

多语言支持:支持119种文本语言、19种语音输入语言和10种语音输出语言。语音输入支持英语、中文、韩语、日语、德语、俄语、意大利语、法语、西班牙语、葡萄牙语、马来语、荷兰语、印尼语、土耳其语、越南语、粤语、阿拉伯语、乌尔都语。语音输出支持英语、中文、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语。

创新架构:采用基于MoE的Thinker-Talker设计,配合AuT预训练获得强大的通用表征能力,辅以多码本设计将延迟降至最低。

实时音视频交互:低延迟流式响应,支持自然的对话轮换,可即时返回文本或语音回复。

灵活控制:可通过系统提示词自定义行为,实现细粒度控制和平滑适配。

详细音频描述器:Qwen3-Omni-30B-A3B-Captioner已开源,这是一个通用、高细节、低幻觉的音频描述模型,填补了开源社区的关键空白。

输入输出

输入格式:支持文本、图像、音频、视频等多种模态的单独或混合输入。

输出格式:支持文本输出和自然语音输出。

运行要求

GPU显存要求(BF16精度,flash attention 2):

15秒视频:Instruct模型78.85GB,Thinking模型68.74GB

30秒视频:Instruct模型88.52GB,Thinking模型77.79GB

60秒视频:Instruct模型107.74GB,Thinking模型95.76GB

120秒视频:Instruct模型144.81GB,Thinking模型131.65GB

硬件要求:需要兼容FlashAttention 2的硬件,模型需以torch.float16或torch.bfloat16格式加载。

基本用法

模型下载:提供三个版本可选。Qwen3-Omni-30B-A3B-Instruct是指令微调版本,包含thinker和talker,支持音视频文本输入,输出音频和文本。Qwen3-Omni-30B-A3B-Thinking是思考者版本,仅含thinker组件,支持链式推理,支持音视频文本输入,输出文本。Qwen3-Omni-30B-A3B-Captioner是基于Instruct微调的音频描述模型,支持音频输入和文本输出。

推理框架:支持Hugging Face Transformers和vLLM两种推理方式。推荐使用vLLM进行推理和部署。使用Transformers时建议安装FlashAttention 2以降低显存占用。

音频输出设置:模型支持文本和音频双模输出。如不需要音频输出,可在初始化后调用model.disable_talker(),可节省约10GB显存。也可在generate函数调用时通过return_audio参数控制。

语音类型选择:Instruct模型支持三种语音类型:Ethan(男声,明亮活力)、Chelsie(女声,柔和丝滑)、Aiden(男声,温暖随性)。默认使用Ethan。

使用建议:对于音视频多模态交互场景,建议使用指定的系统提示词以保持高推理能力并更好扮演智能助手角色。对于Thinking模型,建议在每轮对话中明确包含文本指令或任务描述,以帮助模型发挥推理能力。

限制

vLLM serve目前仅支持thinker模型,不支持use_audio_in_video参数,需单独传入视频和音频输入。Instruct模型的音频输出推理支持即将发布。

许可证

Apache 2.0开源许可证

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部