闲社服务运行正常AI智能体自动化平台

Qwen2.5-Omni-7B-AWQ

Qwen/Qwen2.5-Omni-7B-AWQ

发布机构Qwen

下载访问条件魔搭来源

Qwen2.5-Omni-7B-AWQ Qwen2.5-Omni是一款端到端多模态模型,能够感知文本、图像、音频和视频等多种模态,同时以流式方式生成文本和自然语音响应。 Thinker-Talker架构:创新性的端到端多模态架构,同时处理多种输入模态并生成文本和语音输出。

多模态
模型详情

模型介绍

中文整理

Qwen2.5-Omni-7B-AWQ

概述

Qwen2.5-Omni是一款端到端多模态模型,能够感知文本、图像、音频和视频等多种模态,同时以流式方式生成文本和自然语音响应。

主要能力

Thinker-Talker架构:创新性的端到端多模态架构,同时处理多种输入模态并生成文本和语音输出。

TMRoPE位置嵌入:新型时间对齐多模态位置嵌入技术,同步视频输入与音频的时间戳。

实时语音和视频交互:支持完全实时的交互能力,接受分块输入并即时输出。

自然语音生成:在语音生成的自然度和鲁棒性方面优于多数现有流式和非流式方案。

跨模态性能:在各项模态的基准测试中表现优异,音频能力超越同规模Qwen2-Audio,视觉能力与Qwen2.5-VL-7B相当。

端到端语音指令跟随:语音指令跟随能力接近文本输入水平,在MMLU和GSM8K等基准上得到验证。

输入输出

输入:文本、图像、音频、视频(支持混合输入)

输出:文本、流式语音

运行要求

GPU内存需求(AWQ版本):

15秒视频:约11.77GB

30秒视频:约17.84GB

60秒视频:约30.31GB

优化特性:

Thinker权重采用4位AWQ量化,显著降低GPU显存占用

推理管道支持按需加载模块权重,推理完成后卸载至CPU,避免显存峰值

token2wav模块支持流式推理,避免预分配过多GPU内存

ODE求解器从二阶RK4降为一阶Euler方法,进一步降低计算开销

推荐硬件:RTX 3080、4080、5070等显存有限的GPU设备

基本用法

使用autoawq库加载模型。需要安装ffmpeg系统依赖。可选安装qwen-omni-utils工具包处理各类音视频输入。

限制

AWQ版本推理速度略慢于原生FP32/BF16版本,原因在于量化技术和CPU卸载机制。

许可证

原始文档未提供许可证相关信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部