模型介绍
中文整理Qwen3-Omni
模型用途
Qwen3-Omni 是原生端到端的多语言多模态基础模型,能够处理文本、图像、音频和视频,并以文本和自然语音形式提供实时流式响应。
主要能力
- *跨模态领先性能**:通过早期文本优先预训练和混合多模态训练提供原生多模态支持。在音频和音视频任务上取得优异成绩的同时,单模态文本和图像性能不退化。在36个音频/视频基准测试中取得22项SOTA,在开源模型中取得32项SOTA;语音识别、音频理解和语音对话性能与Gemini 2.5 Pro相当。
- *多语言支持**:支持119种文本语言、19种语音输入语言和10种语音输出语言。语音输入支持英语、中文、韩语、日语、德语、俄语、意大利语、法语、西班牙语、葡萄牙语、马来语、荷兰语、印尼语、土耳其语、越南语、粤语、阿拉伯语、乌尔都语。语音输出支持英语、中文、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语。
- *创新架构**:基于MoE的Thinker-Talker设计,配合AuT预训练获得强大的通用表征能力,辅以多码本设计将延迟降至最低。
- *实时音视频交互**:低延迟流式响应,支持自然的对话轮换,可即时返回文本或语音回复。
- *灵活控制**:可通过系统提示词自定义行为,实现细粒度控制和轻松适配。
- *详细音频描述器**:Qwen3-Omni-30B-A3B-Captioner已开源,是一个通用、高细节、低幻觉的音频描述模型,填补了开源社区的关键空白。
输入输出
支持输入:文本、图像、音频、视频
输出形式:文本、自然语音
运行要求
- *GPU显存最低要求**(BF16精度,使用flash attention 2):
| 视频时长 | 15秒 | 30秒 | 60秒 | 120秒 |
|---------|------|------|------|-------|
| Qwen3-Omni-30B-A3B-Instruct | 78.85 GB | 88.52 GB | 107.74 GB | 144.81 GB |
| Qwen3-Omni-30B-A3B-Thinking | 68.74 GB | 77.79 GB | 95.76 GB | 131.65 GB |
Instruct模型包含thinker和talker两部分,Thinking模型仅包含thinker部分。
硬件要求:需支持FlashAttention 2的GPU硬件,仅在模型以torch.float16或torch.bfloat16加载时可用。
软件环境:需创建新的Python环境以避免运行时冲突;需安装ffmpeg处理音频输入。
基本用法
- *模型选择**:
- Qwen3-Omni-30B-A3B-Instruct:包含thinker和talker,支持音视频文本输入,输出音频和文本
- Qwen3-Omni-30B-A3B-Thinking:包含thinker,具备思维链推理能力,支持音视频文本输入,输出文本
- Qwen3-Omni-30B-A3B-Captioner:从Instruct微调的音频描述模型,支持音频输入和文本输出
- *使用方式**:可通过Hugging Face Transformers或vLLM进行推理。推荐使用vLLM以获得更优的推理和部署性能。
- *音频输出控制**:如无需音频输出,可在模型初始化后调用model.disable_talker(),可节省约10GB GPU显存。也可在generate函数调用时通过return_audio参数控制。
- *语音类型选择**:Instruct模型支持三种语音类型:Ethan(男声,明亮活力)、Chelsie(女声,柔和丝滑)、Aiden(男声,温暖随和)。可通过generate函数的speaker参数指定,默认使用Ethan。
- *Thinking模型使用建议**:建议在每轮对话中明确包含文本指令或任务描述,配合多模态输入使用,可显著提升模型的推理能力。
限制
- vLLM serve目前仅支持thinker模型
- vLLM serve中不支持use_audio_in_video参数,需单独传入视频和音频
- Instruct模型的音频输出推理支持即将推出
许可证
Qwen3-Omni的模型权重采用Qwen的许可协议,具体许可证信息请参阅模型权重页面。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
