模型介绍
中文整理Mage-VL 高效编解码器原生流式多模态基础模型
模型用途
Mage-VL 是一个编解码器原生、主动流式多模态基础模型,用于图像和视频理解。其视觉编码器从零开始训练,规模为 4B 参数。该模型针对现代 VLMs 的莫拉维克悖论:擅长复杂的离线推理,但在简单的实时流式感知上速度慢且计算量大。
主要能力
图像理解:支持静态图像的问答和描述
视频理解:支持帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频
主动流式感知:内置轻量级认知门控,仅在检测到值得响应的事件时触发生成,无需多智能体管道
空间智能:支持 2D/3D 空间推理、视觉定位、目标跟踪
时序理解:支持视频问答、时间定位、事件检测
输入输出
输入:图像文件、视频文件(支持帧采样和编解码器原生格式)
输出:文本描述、问答回答、事件触发的实时评论
运行要求
硬件:单个 8×B200 节点
软件:Python 环境、Transformers 库
编解码器视频推理需要 ffmpeg 和 ffprobe 已安装并加入 PATH
在线推理需要 SGLang 服务器
基本用法
图像理解:inference.py --mode offline --image
帧采样视频:inference.py --mode offline --video --video-backend frames
传统编解码器视频:inference.py --mode offline --video --video-backend codec --codec-engine traditional
神经编解码器视频:inference.py --mode offline --video --video-backend codec --codec-engine neural
在线推理:inference.py --mode online ... --base-url
流式推理:inference streaming.py
限制
模型在 SoccerNet 等特定数据集上训练,流式门控对非训练分布数据可能表现不同
编解码器原生模式需要使用 --video-backend codec 参数以获得最佳效果
模型性能受限于token预算和分辨率设置
许可证
Apache-2.0 许可证
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
