闲社服务运行正常AI智能体自动化平台

Mage-VL

microsoft/Mage-VL

发布机构微软(Microsoft)已核实

下载访问条件国内镜像可用

Mage-VL 高效编解码器原生流式多模态基础模型 Mage-VL 是一个编解码器原生、主动流式多模态基础模型,用于图像和视频理解。其视觉编码器从零开始训练,规模为 4B 参数。该模型针对现代 VLMs 的莫拉维克悖论:擅长复杂的离线推理,但在简单的实时流式感知上速度慢且计算量大。 视频理解:支持帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频

文字对话图文理解推理思考
模型详情

模型介绍

中文整理

Mage-VL 高效编解码器原生流式多模态基础模型

模型用途

Mage-VL 是一个编解码器原生、主动流式多模态基础模型,用于图像和视频理解。其视觉编码器从零开始训练,规模为 4B 参数。该模型针对现代 VLMs 的莫拉维克悖论:擅长复杂的离线推理,但在简单的实时流式感知上速度慢且计算量大。

主要能力

图像理解:支持静态图像的问答和描述

视频理解:支持帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频

主动流式感知:内置轻量级认知门控,仅在检测到值得响应的事件时触发生成,无需多智能体管道

空间智能:支持 2D/3D 空间推理、视觉定位、目标跟踪

时序理解:支持视频问答、时间定位、事件检测

输入输出

输入:图像文件、视频文件(支持帧采样和编解码器原生格式)

输出:文本描述、问答回答、事件触发的实时评论

运行要求

硬件:单个 8×B200 节点

软件:Python 环境、Transformers 库

编解码器视频推理需要 ffmpeg 和 ffprobe 已安装并加入 PATH

在线推理需要 SGLang 服务器

基本用法

图像理解:inference.py --mode offline --image

帧采样视频:inference.py --mode offline --video --video-backend frames

传统编解码器视频:inference.py --mode offline --video --video-backend codec --codec-engine traditional

神经编解码器视频:inference.py --mode offline --video --video-backend codec --codec-engine neural

在线推理:inference.py --mode online ... --base-url

流式推理:inference streaming.py

限制

模型在 SoccerNet 等特定数据集上训练,流式门控对非训练分布数据可能表现不同

编解码器原生模式需要使用 --video-backend codec 参数以获得最佳效果

模型性能受限于token预算和分辨率设置

许可证

Apache-2.0 许可证

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部