闲社服务运行正常AI智能体自动化平台

Mage-ViT

microsoft/Mage-ViT

发布机构微软(Microsoft)已核实

下载访问条件国内镜像可用

Mage-ViT是一个从零训练的Codec-Native视觉编码器,是Mage-VL模型的核心组件。它采用Codec-ViT架构,主要设计用于视频处理,单帧图像可视为单帧视频的退化情况。 Codec对齐的稀疏性:视觉token的分配遵循视频编码器的比特分配策略,因为编码器的比特分配是时空重要性的自然代理。在共享的16×16 patch网格上,模型保留每个关键帧(I-frame)的所有patch,仅保留运动显著的目标帧(P-frame)patch。

图文理解向量检索
模型详情

模型介绍

中文整理

# Mage-ViT 模型卡片

## 模型类型与用途

Mage-ViT是一个从零训练的Codec-Native视觉编码器,是Mage-VL模型的核心组件。它采用Codec-ViT架构,主要设计用于视频处理,单帧图像可视为单帧视频的退化情况。

## 主要能力

  • *Codec对齐的稀疏性**:视觉token的分配遵循视频编码器的比特分配策略,因为编码器的比特分配是时空重要性的自然代理。在共享的16×16 patch网格上,模型保留每个关键帧(I-frame)的所有patch,仅保留运动显著的目标帧(P-frame)patch。
  • *Codec驱动的Patch选择器**:Patch选择基于编码器导出的per-patch重要性图。对于HEVC/H.265,使用运动向量和P-frame残差能量;对于神经编码器DCVC-RT,使用学习到的率映射。在64帧clip中,模型在4096-token预算内保留所有I-frame patch和top-k个P-frame patch,实现约75%的token压缩。
  • *Codec无关性**:同一接口支持传统编码器(HEVC/H.265)和神经编码器(DCVC-RT),无需修改架构或重新训练。
  • *3D旋转位置编码**:共享的3D旋转位置编码在大量grid被丢弃后仍保留时空结构,编码在时间、高度、宽度维度上按4:6:6比例分配。
  • *从零训练**:未使用十亿级图像-文本ViT初始化,而是在约1亿张未标注图像/视频上使用大规模聚类判别目标进行优化。

## 架构规格

24层pre-norm Vision Transformer,主干隐藏尺寸1024,16个注意力头,GELU MLP扩展比例为4倍。包含多头像注意力池化头。参数总量约3.16亿。Patch大小为16。预训练采用两阶段流程:首先进行可变分辨率图像预训练(224-448像素),然后进行图像和视频联合预训练(视频分辨率256,每clip 64帧,4096-token预算)。权重数据类型为bfloat16。

## 输入输出

  • *图像输入**:像素值(以及可选的patch位置)
  • *视频输入**:预处理帧堆叠为[B, C, T, H, W]形状,配合patch位置张量[B, T * tokens per frame, 3],给出每个patch的(t, h, w)网格坐标
  • *输出**:
  • last hidden state:[B, num patches, 1024],经最后一层归一化后的per-patch特征
  • pooler output:[B, 1024],来自多头像注意力池化头的全局特征

运行要求

模型内置三种注意力实现策略:默认sdpa → flash attention 2 → eager。Flash-attn为可选依赖,模型可在CPU或GPU上直接运行。

基本用法

该仓库仅提供ViT预训练检查点,未经过与语言模型的联合VLM训练。可作为数据高效的codec-native视觉编码器使用,也可作为即插即用的ViT用于自定义多模态训练。使用时需在上游的Mage-VL数据pipeline中应用codec驱动的patch选择。

许可证

MIT许可证

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部