模型介绍
中文整理Qwen2.5-Omni-7B-AWQ
概述
Qwen2.5-Omni是一款端到端多模态模型,能够感知文本、图像、音频和视频等多种模态,同时以流式方式生成文本和自然语音响应。
主要能力
Thinker-Talker架构:创新性的端到端多模态架构,同时处理多种输入模态并生成文本和语音输出。
TMRoPE位置嵌入:新型时间对齐多模态位置嵌入技术,同步视频输入与音频的时间戳。
实时语音和视频交互:支持完全实时的交互能力,接受分块输入并即时输出。
自然语音生成:在语音生成的自然度和鲁棒性方面优于多数现有流式和非流式方案。
跨模态性能:在各项模态的基准测试中表现优异,音频能力超越同规模Qwen2-Audio,视觉能力与Qwen2.5-VL-7B相当。
端到端语音指令跟随:语音指令跟随能力接近文本输入水平,在MMLU和GSM8K等基准上得到验证。
输入输出
输入:文本、图像、音频、视频(支持混合输入)
输出:文本、流式语音
运行要求
GPU内存需求(AWQ版本):
15秒视频:约11.77GB
30秒视频:约17.84GB
60秒视频:约30.31GB
优化特性:
Thinker权重采用4位AWQ量化,显著降低GPU显存占用
推理管道支持按需加载模块权重,推理完成后卸载至CPU,避免显存峰值
token2wav模块支持流式推理,避免预分配过多GPU内存
ODE求解器从二阶RK4降为一阶Euler方法,进一步降低计算开销
推荐硬件:RTX 3080、4080、5070等显存有限的GPU设备
基本用法
使用autoawq库加载模型。需要安装ffmpeg系统依赖。可选安装qwen-omni-utils工具包处理各类音视频输入。
限制
AWQ版本推理速度略慢于原生FP32/BF16版本,原因在于量化技术和CPU卸载机制。
许可证
原始文档未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
