模型介绍
中文整理Qwen2.5-VL-72B-Instruct-AWQ
模型简介
Qwen2.5-VL是阿里云通义千问团队推出的最新视觉语言模型系列,包含30亿、70亿和720亿参数三个规模。本模型是720亿参数的指令微调版本,采用AWQ量化技术。
主要能力
视觉识别:能够识别常见物体如花卉、鸟类、鱼类和昆虫,并擅长分析图像中的文本、图表、图标、图形和布局。
视觉代理:可直接作为视觉代理进行推理和动态调用工具,支持电脑和手机使用。
长视频理解:能够理解超过1小时的视频,并具备通过精确定位相关视频片段来捕获事件的能力。
视觉定位:可在图像中准确定位物体,生成边界框或点坐标,并提供稳定的JSON格式坐标和属性输出。
结构化输出:支持对发票、表格、表单等扫描件进行结构化内容输出,适用于金融、商业等领域。
模型架构
采用动态分辨率和帧率训练,支持不同采样率理解视频。视觉编码器引入window attention优化,并使用SwiGLU和RMSNorm,与Qwen2.5语言模型结构对齐。
输入输出
支持图像和视频输入。图像支持本地文件、base64编码和URL;视频目前仅支持本地文件。输出为文本和结构化JSON格式。
运行要求
需要安装最新版本的HuggingFace Transformers,建议从源码编译安装以确保兼容性。
基本用法
支持通过HuggingFace Transformers和ModelScope使用。模型支持广泛的分辨率范围,默认使用原生分辨率,更高分辨率可提升性能但增加计算开销。用户可通过设置最小和最大像素数来平衡速度和内存占用,例如将token数量范围设为256-1280。
处理长文本时,当前配置支持最高32768个token。超过此长度的输入可使用YaRN技术扩展,但会影响时空定位任务性能。对于长视频,可直接修改最大位置嵌入值至更大数值如64k。
性能基准
以下为量化模型的测试结果:
MMMU验证集准确率:69.1%
DocVQA验证集准确率:96.0%
MMBench英文开发集准确率:87.9%
MathVista MINI准确率:73.8%
许可证
请参考模型官方发布页面获取完整的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
