模型介绍
中文整理# Mage-ViT 模型卡片
## 模型类型与用途
Mage-ViT是一个从零训练的Codec-Native视觉编码器,是Mage-VL模型的核心组件。它采用Codec-ViT架构,主要设计用于视频处理,单帧图像可视为单帧视频的退化情况。
## 主要能力
- *Codec对齐的稀疏性**:视觉token的分配遵循视频编码器的比特分配策略,因为编码器的比特分配是时空重要性的自然代理。在共享的16×16 patch网格上,模型保留每个关键帧(I-frame)的所有patch,仅保留运动显著的目标帧(P-frame)patch。
- *Codec驱动的Patch选择器**:Patch选择基于编码器导出的per-patch重要性图。对于HEVC/H.265,使用运动向量和P-frame残差能量;对于神经编码器DCVC-RT,使用学习到的率映射。在64帧clip中,模型在4096-token预算内保留所有I-frame patch和top-k个P-frame patch,实现约75%的token压缩。
- *Codec无关性**:同一接口支持传统编码器(HEVC/H.265)和神经编码器(DCVC-RT),无需修改架构或重新训练。
- *3D旋转位置编码**:共享的3D旋转位置编码在大量grid被丢弃后仍保留时空结构,编码在时间、高度、宽度维度上按4:6:6比例分配。
- *从零训练**:未使用十亿级图像-文本ViT初始化,而是在约1亿张未标注图像/视频上使用大规模聚类判别目标进行优化。
## 架构规格
24层pre-norm Vision Transformer,主干隐藏尺寸1024,16个注意力头,GELU MLP扩展比例为4倍。包含多头像注意力池化头。参数总量约3.16亿。Patch大小为16。预训练采用两阶段流程:首先进行可变分辨率图像预训练(224-448像素),然后进行图像和视频联合预训练(视频分辨率256,每clip 64帧,4096-token预算)。权重数据类型为bfloat16。
## 输入输出
- *图像输入**:像素值(以及可选的patch位置)
- *视频输入**:预处理帧堆叠为[B, C, T, H, W]形状,配合patch位置张量[B, T * tokens per frame, 3],给出每个patch的(t, h, w)网格坐标
- *输出**:
- last hidden state:[B, num patches, 1024],经最后一层归一化后的per-patch特征
- pooler output:[B, 1024],来自多头像注意力池化头的全局特征
运行要求
模型内置三种注意力实现策略:默认sdpa → flash attention 2 → eager。Flash-attn为可选依赖,模型可在CPU或GPU上直接运行。
基本用法
该仓库仅提供ViT预训练检查点,未经过与语言模型的联合VLM训练。可作为数据高效的codec-native视觉编码器使用,也可作为即插即用的ViT用于自定义多模态训练。使用时需在上游的Mage-VL数据pipeline中应用codec驱动的patch选择。
许可证
MIT许可证
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
