闲社服务运行正常AI智能体自动化平台

QVQ-72B-Preview

Qwen/QVQ-72B-Preview

发布机构Qwen

下载访问条件魔搭来源

QVQ-72B-Preview是由Qwen团队开发的实验性研究模型,专注于增强视觉推理能力。 MMMU(多任务多模态理解)基准测试得分70.3% MathVista(数学视觉)基准测试得分71.4%

图文理解推理思考编程开发
模型详情

模型介绍

中文整理

QVQ-72B-Preview

模型用途

QVQ-72B-Preview是由Qwen团队开发的实验性研究模型,专注于增强视觉推理能力。

主要能力

该模型在多项基准测试中表现出色:

  • MMMU(多任务多模态理解)基准测试得分70.3%
  • MathVista(数学视觉)基准测试得分71.4%
  • MathVision(数学视觉)基准测试得分35.9%
  • OlympiadBench(奥赛级基准)得分20.4%

模型在多学科理解和推理方面展现出强大的能力,在数学推理任务方面有显著进步,同时在解决具有挑战性的问题方面能力也有所提升。

输入输出

  • 支持的输入格式:base64编码的图片、图片URL、交错图像
  • 输出:图片输出
  • 当前限制:仅支持单轮对话,不支持视频输入

运行要求

需要安装transformers库和qwen vl utils工具包以处理各种类型的视觉输入。

基本用法

用户可以使用提供的工具包来处理视觉输入,包括base64、URL和交错图像等格式。

限制

  • 语言混合和代码切换:模型可能会偶尔混合不同语言或在语言间意外切换,可能影响回答的清晰度
  • 递归推理循环:模型可能陷入递归推理循环,导致冗长的回答甚至无法得出最终答案
  • 安全和伦理考量:需要强有力的安全措施以确保可靠和安全的性能,部署时需谨慎
  • 性能和基准限制:
  • 尽管视觉推理有所改进,但QVQ并不能完全取代Qwen2-VL-72B的能力
  • 在多步视觉推理过程中,模型可能逐渐失去对图像内容的关注,导致幻觉
  • 在基础识别任务(如识别人、动物或植物)方面,QVQ相比Qwen2-VL-72B没有显著改进

许可证

如需引用该工作,请按相关学术规范进行引用。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部