闲社服务运行正常AI智能体自动化平台

Qwen2.5-Omni-7B-GPTQ-Int4

Qwen/Qwen2.5-Omni-7B-GPTQ-Int4

发布机构Qwen

下载访问条件魔搭来源

Qwen2.5-Omni-7B-GPTQ-Int4 Qwen2.5-Omni是一个端到端多模态模型,设计用于感知多种模态(包括文本、图像、音频和视频),同时以流式方式生成文本和自然语音响应。 Thinker-Talker架构:采用创新的Thinker-Talker双组件设计,Thinker负责理解多模态输入,Talker负责生成语音输出。

多模态
模型详情

模型介绍

中文整理

Qwen2.5-Omni-7B-GPTQ-Int4

模型用途

Qwen2.5-Omni是一个端到端多模态模型,设计用于感知多种模态(包括文本、图像、音频和视频),同时以流式方式生成文本和自然语音响应。

主要能力

Thinker-Talker架构:采用创新的Thinker-Talker双组件设计,Thinker负责理解多模态输入,Talker负责生成语音输出。

TMRoPE位置嵌入:提出名为TMRoPE的时间对齐多模态位置嵌入,用于同步视频输入与音频的时间戳。

实时语音和视频聊天:架构支持全实时交互,支持分块输入和即时输出。

自然且稳健的语音生成:在语音生成的自然度和稳健性方面优于多数现有流式和非流式方案。

跨模态强大性能:在所有模态上展现出卓越性能,音频能力优于同尺寸的Qwen2-Audio,视觉能力与Qwen2.5-VL-7B相当。

端到端语音指令跟随:语音指令跟随性能接近文本输入效果,在MMLU和GSM8K等基准测试中得到验证。

输入输出

输入:文本、图像、音频、视频(支持base64、URL以及交错的音频、图像和视频格式)

输出:文本和自然语音(流式输出)

运行要求

GPU内存需求(GPTQ-Int4量化版本):

15秒视频:约11.64 GB

30秒视频:约17.43 GB

60秒视频:约29.51 GB

推荐硬件:RTX 3080、4080、5070等具有较低GPU内存的设备

系统依赖:需安装ffmpeg

基本用法

使用gptqmodel库加载模型进行推理。

提供qwen-omni-utils工具包处理各类音频和视觉输入,支持base64、URL和交错的多模态输入格式。

如在非Linux系统上无法安装decord,可使用pip install qwen-omni-utils -U,回退使用torchvision处理视频。

限制

GPTQ-Int4量化版本相比原生FP32/BF16版本,推理速度略慢。

量化导致部分任务性能略有下降:LibriSpeech测试WER从3.4升至3.71,WenetSpeech从5.9升至6.62,Seed-TTS从8.7升至10.3,MMLU-Pro准确率从47.0%降至43.76%,OmniBench从56.13%降至53.59%,VideoMME从72.4%降至68.0%。

许可证

原文未提供许可证相关信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部