模型介绍
中文整理TIPS — L/14 (v1)
模型用途
TIPS(Text-Image Pre-training with Spatial awareness,ICLR 2025)是一个对比学习视觉语言模型系列,能够生成与文本嵌入对齐的空间丰富图像特征。这是原始 L/14 版本, vision 参数 304M,text 参数 184M,由官方检查点转换而来。
变体参数
| 变体 | Vision 参数 | Text 参数 | 嵌入维度 | 分辨率 |
| ---- | ----------- | --------- | -------- | ------ |
| S/14 | 22M | 34M | 384 | 448 |
| B/14 | 86M | 110M | 768 | 448 |
| L/14 | 304M | 184M | 1024 | 448 |
| So400m/14 | 413M | 448M | 1152 | 448 |
| g/14 | 1.1B | 389M | 1536 | 448 |
| g/14 low-res | 1.1B | 389M | 1536 | 224 |
主要能力
- 生成空间丰富的图像特征,与文本嵌入对齐
- 支持零样本图像分类
- 支持可视化空间特征
输入输出
图像输入:图像应为张量,数值范围 [0, 1],仅使用 ToTensor() 转换,无需 ImageNet 标准化。
文本输入:SentencePiece 分词器,小写处理,最大 64 个 token。
输出:模型输出两个 CLS token。第二个 CLS token(out.register_tokens)使用合成caption训练;第一个 CLS token(out.cls_token)使用网络 alt-text 训练,与文本编码器对齐的为第一个。
运行要求
- ViT-L/14 vision 编码器:24 层,patch 大小 14,两个 CLS token
- 12 层 transformer 文本编码器
- 原生分辨率 448;其他 patch 倍数的分辨率可通过位置嵌入插值实现
- 预处理:图像转为 [0, 1],无需标准化
基本用法
加载模型
编码图像
编码文本
零样本分类
可视化空间特征
模型详情
ViT-L/14 vision 编码器(24 层,patch 大小 14,两个 CLS token)+ 12 层 transformer 文本编码器
原生分辨率 448;其他 patch 倍数分辨率通过位置嵌入插值工作
预处理:图像转至 [0, 1],无标准化;SentencePiece 分词器,小写,最大 64 token
许可证
Apache 2.0
引用
TIPS (Text-Image Pre-training with Spatial awareness, ICLR 2025)
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
