闲社服务运行正常AI智能体自动化平台

tipsv1-l14

google/tipsv1-l14

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

TIPS(Text-Image Pre-training with Spatial awareness,ICLR 2025)是一个对比学习视觉语言模型系列,能够生成与文本嵌入对齐的空间丰富图像特征。这是原始 L/14 版本, vision 参数 304M,text 参数 184M,由官方检查点转换而来。 | 变体 | Vision 参数 | Text 参数 | 嵌入维度 | 分辨率 | | S/14 | 22M | 34M | 384 | 448 |

图文理解向量检索
模型详情

模型介绍

中文整理

TIPS — L/14 (v1)

模型用途

TIPS(Text-Image Pre-training with Spatial awareness,ICLR 2025)是一个对比学习视觉语言模型系列,能够生成与文本嵌入对齐的空间丰富图像特征。这是原始 L/14 版本, vision 参数 304M,text 参数 184M,由官方检查点转换而来。

变体参数

| 变体 | Vision 参数 | Text 参数 | 嵌入维度 | 分辨率 |

| ---- | ----------- | --------- | -------- | ------ |

| S/14 | 22M | 34M | 384 | 448 |

| B/14 | 86M | 110M | 768 | 448 |

| L/14 | 304M | 184M | 1024 | 448 |

| So400m/14 | 413M | 448M | 1152 | 448 |

| g/14 | 1.1B | 389M | 1536 | 448 |

| g/14 low-res | 1.1B | 389M | 1536 | 224 |

主要能力

  • 生成空间丰富的图像特征,与文本嵌入对齐
  • 支持零样本图像分类
  • 支持可视化空间特征

输入输出

图像输入:图像应为张量,数值范围 [0, 1],仅使用 ToTensor() 转换,无需 ImageNet 标准化。

文本输入:SentencePiece 分词器,小写处理,最大 64 个 token。

输出:模型输出两个 CLS token。第二个 CLS token(out.register_tokens)使用合成caption训练;第一个 CLS token(out.cls_token)使用网络 alt-text 训练,与文本编码器对齐的为第一个。

运行要求

  • ViT-L/14 vision 编码器:24 层,patch 大小 14,两个 CLS token
  • 12 层 transformer 文本编码器
  • 原生分辨率 448;其他 patch 倍数的分辨率可通过位置嵌入插值实现
  • 预处理:图像转为 [0, 1],无需标准化

基本用法

加载模型

编码图像

编码文本

零样本分类

可视化空间特征

模型详情

ViT-L/14 vision 编码器(24 层,patch 大小 14,两个 CLS token)+ 12 层 transformer 文本编码器

原生分辨率 448;其他 patch 倍数分辨率通过位置嵌入插值工作

预处理:图像转至 [0, 1],无标准化;SentencePiece 分词器,小写,最大 64 token

许可证

Apache 2.0

引用

TIPS (Text-Image Pre-training with Spatial awareness, ICLR 2025)

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部