闲社服务运行正常AI智能体自动化平台

BGE-VL-MLLM-S1

BAAI/BGE-VL-MLLM-S1

发布机构北京智源人工智能研究院(BAAI)已核实

已核对来源国内镜像可用

MegaPairs是一种新型数据合成方法,利用开放域图像创建异构KNN三元组,用于通用多模态检索。配套训练的多模态检索模型BGE-VL包括BGE-VL-CLIP(base和large版本)和BGE-VL-MLLM。 零样本组合图像检索:在CIRCO基准测试中,BGE-VL-base仅用1.49亿参数就超越了所有先前模型(这些模型参数多至50倍)。BGE-VL-MLLM在CIRCO上相比先前最优模型提升8.1%。 大规模多模态嵌入基准(MMEB)表现:BGE-VL-MLLM在零

图文理解向量检索
模型详情

模型介绍

中文整理

# MegaPairs 模型卡片

模型用途

MegaPairs是一种新型数据合成方法,利用开放域图像创建异构KNN三元组,用于通用多模态检索。配套训练的多模态检索模型BGE-VL包括BGE-VL-CLIP(base和large版本)和BGE-VL-MLLM。

## 主要能力

零样本组合图像检索:在CIRCO基准测试中,BGE-VL-base仅用1.49亿参数就超越了所有先前模型(这些模型参数多至50倍)。BGE-VL-MLLM在CIRCO上相比先前最优模型提升8.1%。

大规模多模态嵌入基准(MMEB)表现:BGE-VL-MLLM在零样本条件下达到最优性能,仅使用ImageText-to-Image范式训练即展现出优秀的泛化能力。微调后,在MMEB分布外(OOD)数据集上超越先前最优模型7.1%。

可扩展性与效率:BGE-VL-base随训练数据增加持续提升。仅用50万训练样本即可显著超越使用3670万样本训练的MagicLens(两者使用相同的CLIP-base骨干网络)。

## 输入输出

支持三种输入类型:纯文本、纯图像、文本与图像组合输入。图像需调整为512x512分辨率。查询输入可附加任务指令提示,候选输入则无需提示。

运行要求

使用Sentence Transformers框架。需安装Sentence Transformers库。

基本用法

基于Sentence Transformers加载模型。具体用法可参考官方演示示例。

许可证

MegaPairs数据集注释和BGE-VL模型采用MIT许可证。数据集中图像来源于Recap-Datacomp,该数据集采用CC BY 4.0许可证。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部