模型介绍
中文整理# Qwen2-VL-7B-Instruct-GPTQ-Int4
模型概述
Qwen2-VL-7B-Instruct-GPTQ-Int4是阿里云发布的指令微调视觉语言模型,采用GPTQ Int4量化技术,参数规模为70亿。该模型是Qwen2-VL系列中的7B版本,支持图像、视频和文本的多模态理解与推理。
## 主要能力
- *视觉理解**:在多种分辨率和比例的图像理解任务上达到领先水平,支持任意图像分辨率的动态处理,将图像映射为可变数量的视觉token,模拟人类视觉处理方式。
- *视频理解**:能够理解20分钟以上的长视频,支持基于视频的高质量问答、对话和内容创作。
- *设备操作**:具备复杂推理和决策能力,可集成到手机、机器人等设备中,根据视觉环境和文本指令实现自动化操作。
- *多语言支持**:除英语和中文外,还支持图像中多种语言的文本理解,包括日语、韩语、阿拉伯语、越南语及大部分欧洲语言。
- *位置编码**:采用多模态旋转位置嵌入(M-ROPE),将位置嵌入分解为1D文本、2D视觉和3D视频位置信息,增强多模态处理能力。
## 输入输出
- *输入格式**:支持本地图像文件、Base64编码图像、图像URL以及本地视频文件(当前仅支持本地文件)。可处理交错的多图像和视频输入。
- *输出格式**:文本回复
运行要求
- *硬件环境**:NVIDIA A100 80GB GPU
- *软件环境**:
- CUDA 11.8
- PyTorch 2.2.1+cu118
- Flash Attention 2.6.1
- Transformers 4.38.2
- AutoGPTQ 0.6.0+cu118
- AutoAWQ 0.2.5+cu118
- *安装要求**:需从源码安装最新版本Hugging Face Transformers,建议使用命令pip install git+https://github.com/huggingface/transformers
## 性能基准
- *量化模型精度(MMMU/DocVQA/MMBench/MathVista)**:
GPTQ-Int4量化版本:52.55 / 93.16 / 81.27 / 60.30
- *推理速度与显存**(输入长度1,批量大小1):
速度:42.76 tokens/s
GPU显存:7.20 GB
基本用法
- *图像输入**:支持本地文件、Base64和URL三种方式。可通过设置min_pixels和max_pixels参数控制图像分辨率范围(如256-1280 tokens),平衡速度与内存使用。也可直接指定调整后的高度和宽度(会自动调整为28的倍数)。
- *视频输入**:当前仅支持本地视频文件。
- *图像分辨率**:默认使用原生分辨率,更高分辨率可提升性能但增加计算开销。用户可通过参数配置优化性能。
限制
- 不支持音频理解:当前模型无法理解视频中的音频信息
- 数据时效性:图像数据集更新至2023年6月,之后的信息可能未覆盖
- 人物与知识产权识别:识别特定人物或品牌的能力有限
- 复杂指令理解:面对复杂多步骤指令时,理解与执行能力有待提升
- 计数准确性:在复杂场景中目标计数精度不高
- 空间推理能力:尤其在3D空间中,对物体位置关系的推断能力不足,难以精确判断物体相对位置
许可证
模型权重采用阿里云通义千问许可协议。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
