闲社
标题:
Google上线TIPS v1六款视觉文本编码器:强化空间特征对齐
[打印本页]
作者:
yuanyu1982
时间:
昨天 09:06
标题:
Google上线TIPS v1六款视觉文本编码器:强化空间特征对齐
Google 将 TIPS v1 六款模型接入 Hugging Face Transformers
Google 官方 Hugging Face 账号于 2026 年 8 月 19 日集中上线六款
TIPS v1
视觉—文本编码器,包括 S/14、B/14、L/14、So400m/14、g/14 和 g/14 low-res。需要区分的是:TIPS 方法来自 Google DeepMind 团队的 ICLR 2025 研究,本次新闻事件是官方检查点被转换为可通过 Hugging Face Transformers 加载的模型仓库,并不是 TIPS 算法在 2026 年首次提出。
模型与关键能力
同时输出全局与空间特征:
模型不仅能生成整张图片的 CLS 嵌入,还能输出逐图块的 patch tokens。后者保留图像中的空间结构,可用于可视化、分割、深度和表面法线等下游任务。
图文对比式编码:
图像特征与文本嵌入处在可比较的空间中,可通过相似度完成零样本图像分类,也能作为检索或多模态系统的视觉编码前端。
六种规模选择:
官方模型卡列出的视觉编码器规模从 S/14 的 22M 参数到 g/14 的 1.1B 参数;同时配套文本编码器。g/14 另有 224 分辨率低清版,其余主要版本原生分辨率为 448。
So400m/14 版本:
本文主要来源仓库的视觉编码器为 413M 参数、文本编码器为 448M 参数,嵌入维度 1152,原生输入分辨率 448。
开放许可证:
Hugging Face 模型仓库标注 Apache 2.0,可用于符合许可证条款的研究、集成和二次开发。
适合哪些用户
这组模型适合计算机视觉、多模态检索和视觉 Agent 团队:可以直接提取图像与文本向量,构建零样本分类、图文检索、空间特征分析,或为分割、深度估计等任务接入专用解码头。它也适合希望在不同模型规模、输入分辨率和下游任务之间做对照实验的研究者。
实际影响与限制
不是生成式多模态聊天模型:
TIPS 的核心输出是图像和文本特征,不会像视觉语言大模型那样直接生成长文本回答,也不自带工具调用或完整 Agent 能力。
新的是 Hugging Face 转换版本:
原始 TIPS v1 研究发表于 ICLR 2025。Google DeepMind 官方代码库明确表示目前更推荐 TIPSv2,继续提供 v1 主要是为了完整性与复现实验。
加载涉及自定义代码:
官方示例使用 trust_remote_code=True。生产环境应先审查仓库代码并固定具体版本或提交,不能无条件执行远程更新后的代码。
预处理要求不同:
模型卡要求图片张量保持在 [0,1],不使用常见的 ImageNet 标准化;文本采用 SentencePiece、转小写,最大长度 64 token。沿用其他视觉模型的预处理流程可能导致结果偏差。
下游能力需要额外组件:
分割、深度和法线等应用通常还需要线性头或专用解码器;模型提供空间特征并不等于开箱即用地完成所有密集预测任务。
本文不引用排行榜结论:
官方项目提供多任务评测,但版本、数据集和评测设置会影响比较,实际项目仍应在自己的数据和硬件上验证精度、延迟和显存。
官方来源
Google 官方模型页与使用说明:
google/tipsv1-so400m14
其他 TIPS v1 版本可从模型页中的家族表进入:
google/tipsv1-g14
、
google/tipsv1-b14
Google DeepMind 官方代码与版本说明:
google-deepmind/tips
TIPS v1 论文:
Text-Image Pretraining with Spatial Awareness
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0