闲社服务运行正常AI智能体自动化平台

STELLAR

microsoft/STELLAR

发布机构微软(Microsoft)已核实

下载访问条件国内镜像可用

STELLAR: 通过空间-语义分解学习稀疏视觉表示 STELLAR是一种自监督视觉模型,用于学习紧凑的稀疏视觉表示。模型将图像的“内容”与“位置”分离,表示为定位矩阵和语义矩阵的低秩乘积。 通过空间-语义分解的表示方法,16个语义标记配合显式空间图即可实现图像识别和重建。模型支持特征提取、图像重建、分类、分割和检索任务。

图文理解向量检索
模型详情

模型介绍

中文整理

STELLAR: 通过空间-语义分解学习稀疏视觉表示

模型用途

STELLAR是一种自监督视觉模型,用于学习紧凑的稀疏视觉表示。模型将图像的“内容”与“位置”分离,表示为定位矩阵和语义矩阵的低秩乘积。

主要能力

通过空间-语义分解的表示方法,16个语义标记配合显式空间图即可实现图像识别和重建。模型支持特征提取、图像重建、分类、分割和检索任务。

性能表现

STELLAR-H在ImageNet上达到2.60重建FID和79.10%线性探测准确率,使用约90%更少的潜在值(相比密集网格)。

输入输出

输入为RGB图像,尺寸224x224,像素值范围[0,1],ImageNet均值/标准差归一化在模型内部自动应用。输出包括:稀疏概念标记(分类、检索用)、空间图(分割、可视化用)、密集补丁特征(分割用)、重组密集图(重建用)、全局分类表示。

运行要求

Python 3.10,PyTorch框架。需从GitHub仓库加载代码。使用仓库加载器而非transformers库。重建任务需额外下载MaskGIT-VQGAN tokenizer。存储需求:B16约0.5GB,L16约1.4GB,H16约2.7GB。

可用模型

stellar-b16:ViT-B/16 backbone,16个语义标记,768维特征。stellar-l16:ViT-L/16 backbone,16个语义标记,1024维特征。stellar-h16:ViT-H/14 backbone,16个语义标记,1280维特征。stellar-b8和stellar-b24为消融实验变体,分别使用8和24个语义标记。

基本用法

特征提取无需额外依赖账户或预训练权重。使用仓库加载器下载并验证权重。输入需为浮点型RGB张量[0,1],不要自行应用ImageNet归一化。重建时需同时传入稀疏特征和空间特征。B/L模型输出224x224像素,H模型输出256x256像素。

限制

压缩不等于编码器加速,ViT仍处理密集补丁。语义标记是学习到的概念,不保证对应具体对象、类别、时间身份或语言对齐嵌入。ImageNet预训练特征在医疗、卫星或其他差异较大领域可能需要适配。这些是研究工件,非生产环境安全测试模型。

许可证

MIT许可证。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部