模型介绍
中文整理Keye-VL-2.0-30B-A3B
模型用途
Keye-VL-2.0-30B-A3B是Keye系列中首款30B级别的旗舰基础模型,专为长视频理解而设计,旨在解锁Keye系列第一代Agent能力。
主要能力
- *卓越的视频理解与时序定位**:在五个视频基准测试中,Keye-VL-2.0-30B-A3B领先于开源竞品,在时序定位任务上与Gemini-3-Flash持平或超越。
- *DSA原生长上下文架构**:稀疏注意力机制和针对性特征聚合可实现精确的小时级视频理解,同时保持计算效率。
- *高效推理与训练栈**:DSA(DeepSeek稀疏注意力)、ExtraIO、异构ViT-LM并行、激活优化和自定义内核降低了长序列预填充成本并提升了训练吞吐量。
- *以数据为中心的多模态预训练**:精心设计的数据流程、Keye-VL-1.5视觉编码器和合成思维链数据增强了感知、OCR/图表/表格理解和推理连续性。
- *稳健的后训练提升可靠推理**:MOPD、桶优势缩放、Context-RL和高信噪比数据过滤改善了跨模态专家融合,减少幻觉并稳定长上下文决策。
- *面向Agent的多模态能力**:内置Code、Tool和Search Agent能力,支持仓库任务、API风格工具使用、网页检索和视觉自纠正工作流。
作为首款将DSA投入生产的多模态模型,Keye-VL-2.0-30B-A3B在256K超长上下文中实现近乎无损的推理。在其规模下,该模型在视频理解基准测试中名列前茅,在细粒度时序感知方面与顶级闭源模型相当或更优。更重要的是,它是首款内置Agent协作机制的Keye基础模型,在Search、Tool和Code场景中展现出稳健的系统级编排能力。
基准测试表现
在七个能力维度上对比Keye-VL-2.0-30B-A3B与领先的开源和闭源模型:Video、Coding、Agent、Math & Reasoning、STEM、Instruction Following和General VQA。
细粒度时序理解(TimeLens):
Charades-TimeLens:58.4 mIoU,与测试中最强的闭源视频基线(Gemini 3 Flash 61.19)持平。
ActivityNet-TimeLens:58.5 mIoU,超越Gemini 3 Flash(56.95)。
QVHighlights-TimeLens:70.1 mIoU,与官方排行榜上顶级闭源模型持平,远超Gemini 3 Flash(49.45)。
长上下文扩展(VideoMME V2):大多数竞品的准确率随输入帧数增加而下降,而该模型准确率从64帧的35.3%提升至512帧的42.4%;非线性推理分数从18.5升至24.2。
综合长视频理解:LongVideoBench得分74.1,超越Qwen3.5-35B-A3B和规模更大的Qwen3-VL-235B-A22B,展现出30B规模下的强大长视频理解能力。
在30B规模下,Keye-VL-2.0-30B-A3B不仅在时序理解上超越200B+参数的开源模型(如Qwen3-VL-235B),还能与顶级闭源巨头正面竞争并在部分领域超越。
输入输出
支持图像和视频输入。通过标准OpenAI兼容客户端调用SGLang服务进行推理。
运行要求
推荐配置:H800 GPU。环境可通过预构建Docker镜像或从源码安装搭建。
基本用法
启动标准SGLang服务后,使用任意标准OpenAI兼容客户端调用。采样参数(如temperature、top k等)仅供演示,用户可根据需求自行调整。视频帧采样相关参数也可自定义:min pixels和max pixels用于设置每帧的令牌下限和上限,video total pixels用于限制整个视频输入的令牌预算。未指定fps时默认值为2.0。
许可证
请参阅模型仓库获取许可信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
