闲社服务运行正常AI智能体自动化平台

Video-XL-2

BAAI/Video-XL-2

发布机构北京智源人工智能研究院(BAAI)已核实

已核对来源国内镜像可用

Video-XL-2 是一款视频理解大模型。 提供两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层键值状态解码(bi-level kvs decoding)。用户可根据需求灵活选择。 推理代码仍在更新中。可通过 huggingface-cli 使用 "--include '*.py'" 参数仅更新推理代码,避免下载整个模型。

文字对话图文理解推理思考编程开发
模型详情

模型介绍

中文整理

# Video-XL-2

模型用途

Video-XL-2 是一款视频理解大模型。

## 主要能力

提供两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层键值状态解码(bi-level kvs decoding)。用户可根据需求灵活选择。

## 输入输出

输入:视频数据

输出:视频理解结果

运行要求

推理代码仍在更新中。可通过 huggingface-cli 使用 "--include '*.py'" 参数仅更新推理代码,避免下载整个模型。

基本用法

### 模式一:无效率优化的推理

### 模式二:基于分块的预填充

该模式通过流式编码视频输入,显著降低内存需求和响应延迟,对长视频效果尤为明显。

启用方式:设置 enable chunk prefill 为 True,并配置以下参数:

  • *chunk prefill mode(分块预填充模式)**:
  • streaming(流式):流式编码视频块
  • mask(掩码):使用注意力掩码实现等效效果,但目前缺乏底层优化操作符,暂不提供效率提升。建议使用 streaming 模式
  • *chunk size(分块大小)**:指定每次前向传播处理的块大小,单位为 4 帧(例如 chunk size = 4 表示一次处理 4×4 = 16 帧的视觉 token)。较大的分块大小会逐渐接近完整注意力,导致更高的内存峰值
  • *step size(步长)**:控制块之间的步长。较小的步长带来更连续的信息传递,但可能略微降低推理速度
  • *offload(卸载)**:布尔参数,决定在前向传播时是否将每个块的键值状态(KVs)卸载到 CPU。可降低内存使用,但会降低推理速度
  • *chunk size for vision tower(视觉塔的分块大小)**:对于较长的视频输入,视觉塔可能成为前向传播的内存瓶颈。该参数控制视觉塔的流式模式,单位为 1 帧,且值必须是 4 的倍数

注意:目前基于分块的预填充仅支持 'sdpa' 注意力实现。

### 模式三:基于分块预填充和双层 KVs 解码

即将推出。

限制

  • mask 模式目前不提供效率改进
  • 基于分块的预填充仅支持 sdpa 注意力实现
  • 双层 KVs 解码功能尚未发布

许可证

(原文未提供许可证信息)

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部