闲社服务运行正常AI智能体自动化平台

Qwen2.5-VL-32B-Instruct-AWQ

Qwen/Qwen2.5-VL-32B-Instruct-AWQ

发布机构Qwen

下载访问条件魔搭来源

Qwen2.5-VL-32B-Instruct-AWQ Qwen2.5-VL是一款视觉语言模型,能够理解图像和视频内容,支持物体识别、文本分析、图表理解、视觉定位等任务。该模型经过强化学习微调,在数学、逻辑推理和知识问答等客观查询方面表现更优,响应风格更符合人类偏好。 视觉理解:能够识别常见物体如花、鸟、鱼、昆虫,并分析图像中的文本、图表、图标、图形和布局。

图文理解推理思考
模型详情

模型介绍

中文整理

Qwen2.5-VL-32B-Instruct-AWQ

模型用途

Qwen2.5-VL是一款视觉语言模型,能够理解图像和视频内容,支持物体识别、文本分析、图表理解、视觉定位等任务。该模型经过强化学习微调,在数学、逻辑推理和知识问答等客观查询方面表现更优,响应风格更符合人类偏好。

主要能力

视觉理解:能够识别常见物体如花、鸟、鱼、昆虫,并分析图像中的文本、图表、图标、图形和布局。

代理能力:可作为视觉代理进行推理和动态调用工具,支持电脑使用和手机使用。

长视频理解:能够理解超过1小时的视频内容,并具备通过精确定位相关视频片段来捕捉事件的能力。

视觉定位:支持通过边界框或点精确定位图像中的对象,输出稳定的JSON格式坐标和属性。

结构化输出:支持对发票、表格、文档扫描件等内容进行结构化输出,适用于金融、商业等场景。

输入输出

输入:支持图像(本地文件、base64编码、URL)、视频(本地文件)以及多图像和视频混合输入。

输出:文本响应、JSON格式的坐标和属性、结构化数据。

运行要求

需要使用最新版本的Hugging Face Transformers,建议从源码安装以避免兼容性问题。

基本用法

支持通过ModelScope或Transformers库加载模型。使用时可通过设置最小和最大像素值来平衡处理速度和内存占用。模型默认使用原生分辨率输入,更高分辨率可提升性能但会增加计算成本。

对于长文本处理,配置支持最高32,768个token的上下文长度。超过此长度的输入可通过YaRN技术扩展,但可能影响时空定位任务的性能。

限制

使用YaRN技术扩展上下文长度会显著影响时空定位任务的性能,不建议在此类任务中使用。

长视频输入时,MRoPE本身对ID较为节省,可直接将最大位置嵌入值修改为更大数值如64k。

许可证

原文未提供许可证相关信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部