闲社服务运行正常AI智能体自动化平台

EVE-7B-v1.0

BAAI/EVE-7B-v1.0

发布机构BAAI

下载访问条件魔搭来源

EVE是一种无编码器(encoder-free)的纯视觉语言模型,能够同时处理图像和文本输入,执行各类视觉语言任务。该模型摒弃了传统VLM中的视觉编码器,直接接受无缝整合的视觉和语言输入。 该模型可在多个视觉语言基准测试中达到与同类规模基于编码器的VLM相当的水平。仅使用3500万公开可访问数据进行训练,性能显著优于Fuyu-8B模型。模型采用纯解码器架构,具有较高的透明度和效率。 输入:无缝整合的视觉图像和自然语言文本。输出:针对视觉语言任务的响应结果。

文字对话图文理解推理思考
模型详情

模型介绍

中文整理

EVE:无编码器视觉语言模型

模型用途

EVE是一种无编码器(encoder-free)的纯视觉语言模型,能够同时处理图像和文本输入,执行各类视觉语言任务。该模型摒弃了传统VLM中的视觉编码器,直接接受无缝整合的视觉和语言输入。

主要能力

该模型可在多个视觉语言基准测试中达到与同类规模基于编码器的VLM相当的水平。仅使用3500万公开可访问数据进行训练,性能显著优于Fuyu-8B模型。模型采用纯解码器架构,具有较高的透明度和效率。

输入输出

输入:无缝整合的视觉图像和自然语言文本。输出:针对视觉语言任务的响应结果。

运行要求

模型权重文件大小约为14GB,需要具备相应存储空间和GPU计算资源以支持推理运行。

基本用法

模型提供预训练版本和指令微调版本。EVE-7B-HD-v1.0为高分辨率指令微调版本;EVE-7B-v1.0为标准分辨率指令微调版本;EVE-7B-Pretrain-v1.0为预训练版本。用户可根据需求选择相应版本加载使用。

限制

无编码器架构的训练存在收敛较慢和性能差距的挑战,需要采用特定的训练策略才能达到理想效果。

许可证

原始论文未明确说明许可证相关信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部