模型介绍
中文整理STELLAR: 通过空间-语义分解学习稀疏视觉表示
模型用途
STELLAR是一种自监督视觉模型,用于学习紧凑的稀疏视觉表示。模型将图像的“内容”与“位置”分离,表示为定位矩阵和语义矩阵的低秩乘积。
主要能力
通过空间-语义分解的表示方法,16个语义标记配合显式空间图即可实现图像识别和重建。模型支持特征提取、图像重建、分类、分割和检索任务。
性能表现
STELLAR-H在ImageNet上达到2.60重建FID和79.10%线性探测准确率,使用约90%更少的潜在值(相比密集网格)。
输入输出
输入为RGB图像,尺寸224x224,像素值范围[0,1],ImageNet均值/标准差归一化在模型内部自动应用。输出包括:稀疏概念标记(分类、检索用)、空间图(分割、可视化用)、密集补丁特征(分割用)、重组密集图(重建用)、全局分类表示。
运行要求
Python 3.10,PyTorch框架。需从GitHub仓库加载代码。使用仓库加载器而非transformers库。重建任务需额外下载MaskGIT-VQGAN tokenizer。存储需求:B16约0.5GB,L16约1.4GB,H16约2.7GB。
可用模型
stellar-b16:ViT-B/16 backbone,16个语义标记,768维特征。stellar-l16:ViT-L/16 backbone,16个语义标记,1024维特征。stellar-h16:ViT-H/14 backbone,16个语义标记,1280维特征。stellar-b8和stellar-b24为消融实验变体,分别使用8和24个语义标记。
基本用法
特征提取无需额外依赖账户或预训练权重。使用仓库加载器下载并验证权重。输入需为浮点型RGB张量[0,1],不要自行应用ImageNet归一化。重建时需同时传入稀疏特征和空间特征。B/L模型输出224x224像素,H模型输出256x256像素。
限制
压缩不等于编码器加速,ViT仍处理密集补丁。语义标记是学习到的概念,不保证对应具体对象、类别、时间身份或语言对齐嵌入。ImageNet预训练特征在医疗、卫星或其他差异较大领域可能需要适配。这些是研究工件,非生产环境安全测试模型。
许可证
MIT许可证。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
