模型介绍
中文整理模型名称
Aquila-VL-2B
模型类型
视觉语言模型(Vision-Language Model,VLM)
训练数据
基于开源数据集 Infinity-MM 训练
模型用途
用于视觉理解与多模态推理任务
主要能力
该模型能够处理图像和文本输入,进行视觉问答、视觉推理等任务。在多个视觉语言基准测试中进行了评估,包括 MMMU、MMStar、MMBench、MathVista、HallusionBench、OCRBench、AI2D、MMVet 等。
评估结果
以下为不同训练阶段的评估数据:
- MMMU 验证集:47.4
- MMStar:54.9
- MMBench V1.1 测试集:75.2
- MathVista 测试集:59.0
- HallusionBench:43.0
- OCRBench:77.2
- AI2D 测试集:75.0
- MMVet:44.3
- 平均分:59.51
输入格式
支持图像和文本联合输入
输出格式
文本回复
运行要求
未提供具体硬件要求信息
基本用法
本仓库用于发布不同训练阶段的中期检查点,可用于分析和实验。
许可证
未明确说明
致谢
本项目受新一代人工智能国家科技重大专项(No. 2022ZD0116300)支持。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
