模型介绍
中文整理Qwen2.5-VL-72B-Instruct
模型用途
Qwen2.5-VL-72B-Instruct是阿里云发布的指令微调视觉语言模型,拥有720亿参数。该模型能够理解和处理图像与视频内容,适用于视觉问答、图像分析、视频理解、文档处理等场景。
主要能力
视觉理解:能够识别常见物体如花鸟鱼虫,并具备分析图像中文本、图表、图标、图形和布局的高能力。
代理能力:可作为视觉代理进行推理和动态调用工具,支持电脑和手机操作。
长视频理解:能够理解超过1小时的视频内容,并具备通过精确定位相关视频片段来捕捉事件的能力。
视觉定位:支持通过边界框或点坐标对图像中的物体进行精确定位,可输出JSON格式的坐标和属性信息。
结构化输出:支持对发票、表格、表单等扫描件进行结构化内容提取,适用于金融、商业等场景。
输入输出
输入:支持本地文件、Base64编码、URL形式的图像和视频输入;支持图像与视频混合输入。
输出:文本回复;结构化JSON格式的坐标和属性信息。
运行要求
需要安装最新的HuggingFace Transformers库。建议从源码安装以确保兼容性。
基本用法
可通过ModelScope或HuggingFace Transformers加载模型。支持多图像推理、视频推理和批量推理。
图像分辨率设置:模型支持广泛的分辨率输入。可通过设置最小和最大像素数来平衡速度和内存使用,例如将token数量范围设置为256-1280。也可直接指定调整后的高度和宽度(会被四舍五入到28的倍数)。
长文本处理:当前配置支持最高32768个token的上下文长度。处理更长输入时可使用YaRN技术来增强模型的长度外推能力,但该方法会对时空定位任务性能产生显著影响,不建议在此类任务中使用。对于长视频输入,可直接修改最大位置嵌入到更大值如64k。
许可证
该模型仅可应用于研究目的。商业使用需获得阿里云授权许可。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
