模型介绍
中文整理Qwen2.5-Omni
概述
Qwen2.5-Omni 是一个端到端多模态模型,能够感知文本、图像、音频和视频等多种模态,同时以流式方式生成文本和自然语音回复。
主要能力
Thinker-Talker 架构:提出一种创新的端到端多模态架构,同时处理多种输入模态并流式输出文本和语音。
TMRoPE 位置编码:提出时间对齐的多模态位置编码方法,同步视频输入与音频的时间戳。
实时语音视频交互:支持分块输入和即时输出,实现全实时交互。
自然稳健的语音生成:在语音生成的自然度和稳健性方面优于现有流式和非流式方案。
跨模态强大性能:在所有模态上与同规模单模态模型相比表现优异,音频能力超越 Qwen2-Audio,视觉能力与 Qwen2.5-VL-7B 相当。
端到端语音指令跟随:语音指令跟随性能接近文本输入表现。
输入输出
支持输入:文本、图像、音频、视频
输出形式:文本、流式语音
运行要求
GPU 显存最低要求(推理):
Qwen2.5-Omni-3B:BF16 精度下,15秒视频需 18.38GB,30秒视频需 22.43GB,60秒视频需 28.22GB
Qwen2.5-Omni-7B:BF16 精度下,15秒视频需 31.11GB,30秒视频需 41.85GB,60秒视频需 60.19GB
实际显存使用通常至少为上述值的 1.2 倍。
视频 URL 兼容性:torchvision >= 0.19.0 支持 HTTP 和 HTTPS,decord 支持 HTTP 但不支持 HTTPS。
硬件要求:使用 Flash Attention 2 需要兼容的 GPU。
基本用法
音频输出提示词:若需音频输出,系统提示词必须设为"You are Qwen, a virtual human developed by the Qwen Team, Alibaba Group, capable of perceiving auditory and visual inputs, as well as generating text and speech."
视频音频使用:多模态交互中,用户提供的视频通常伴随音频,有助于模型提供更好的交互体验。用户可选择是否使用视频中的音频。多轮对话中,各轮此参数需保持一致。
音频输出开关:模型支持文本和音频两种输出。若无需音频输出,可在模型初始化后调用 model.disable_talker(),可节省约 2GB 显存,但 generate 函数的 return_audio 参数只能设为 False。
语音类型切换:Qwen2.5-Omni-3B 支持两种语音类型:Chelsie(女声,柔和温暖)和 Ethan(男声,明亮活力)。可通过 generate 函数的 speaker 参数指定,未指定时默认使用 Chelsie。
批量推理:设置 return_audio=False 时,模型可批量处理包含文本、图像、音频、视频的混合输入。
许可证
模型权重和代码可用于研究和商业目的。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
