模型详情
模型介绍
中文整理QVQ-72B-Preview
模型用途
QVQ-72B-Preview是由Qwen团队开发的实验性研究模型,专注于增强视觉推理能力。
主要能力
该模型在多项基准测试中表现出色:
- MMMU(多任务多模态理解)基准测试得分70.3%
- MathVista(数学视觉)基准测试得分71.4%
- MathVision(数学视觉)基准测试得分35.9%
- OlympiadBench(奥赛级基准)得分20.4%
模型在多学科理解和推理方面展现出强大的能力,在数学推理任务方面有显著进步,同时在解决具有挑战性的问题方面能力也有所提升。
输入输出
- 支持的输入格式:base64编码的图片、图片URL、交错图像
- 输出:图片输出
- 当前限制:仅支持单轮对话,不支持视频输入
运行要求
需要安装transformers库和qwen vl utils工具包以处理各种类型的视觉输入。
基本用法
用户可以使用提供的工具包来处理视觉输入,包括base64、URL和交错图像等格式。
限制
- 语言混合和代码切换:模型可能会偶尔混合不同语言或在语言间意外切换,可能影响回答的清晰度
- 递归推理循环:模型可能陷入递归推理循环,导致冗长的回答甚至无法得出最终答案
- 安全和伦理考量:需要强有力的安全措施以确保可靠和安全的性能,部署时需谨慎
- 性能和基准限制:
- 尽管视觉推理有所改进,但QVQ并不能完全取代Qwen2-VL-72B的能力
- 在多步视觉推理过程中,模型可能逐渐失去对图像内容的关注,导致幻觉
- 在基础识别任务(如识别人、动物或植物)方面,QVQ相比Qwen2-VL-72B没有显著改进
许可证
如需引用该工作,请按相关学术规范进行引用。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。