模型介绍
中文整理Qwen2.5-Omni-7B-GPTQ-Int4
模型用途
Qwen2.5-Omni是一个端到端多模态模型,设计用于感知多种模态(包括文本、图像、音频和视频),同时以流式方式生成文本和自然语音响应。
主要能力
Thinker-Talker架构:采用创新的Thinker-Talker双组件设计,Thinker负责理解多模态输入,Talker负责生成语音输出。
TMRoPE位置嵌入:提出名为TMRoPE的时间对齐多模态位置嵌入,用于同步视频输入与音频的时间戳。
实时语音和视频聊天:架构支持全实时交互,支持分块输入和即时输出。
自然且稳健的语音生成:在语音生成的自然度和稳健性方面优于多数现有流式和非流式方案。
跨模态强大性能:在所有模态上展现出卓越性能,音频能力优于同尺寸的Qwen2-Audio,视觉能力与Qwen2.5-VL-7B相当。
端到端语音指令跟随:语音指令跟随性能接近文本输入效果,在MMLU和GSM8K等基准测试中得到验证。
输入输出
输入:文本、图像、音频、视频(支持base64、URL以及交错的音频、图像和视频格式)
输出:文本和自然语音(流式输出)
运行要求
GPU内存需求(GPTQ-Int4量化版本):
15秒视频:约11.64 GB
30秒视频:约17.43 GB
60秒视频:约29.51 GB
推荐硬件:RTX 3080、4080、5070等具有较低GPU内存的设备
系统依赖:需安装ffmpeg
基本用法
使用gptqmodel库加载模型进行推理。
提供qwen-omni-utils工具包处理各类音频和视觉输入,支持base64、URL和交错的多模态输入格式。
如在非Linux系统上无法安装decord,可使用pip install qwen-omni-utils -U,回退使用torchvision处理视频。
限制
GPTQ-Int4量化版本相比原生FP32/BF16版本,推理速度略慢。
量化导致部分任务性能略有下降:LibriSpeech测试WER从3.4升至3.71,WenetSpeech从5.9升至6.62,Seed-TTS从8.7升至10.3,MMLU-Pro准确率从47.0%降至43.76%,OmniBench从56.13%降至53.59%,VideoMME从72.4%降至68.0%。
许可证
原文未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
