模型介绍
中文整理# Video-XL-2
模型用途
Video-XL-2 是一款视频理解大模型。
## 主要能力
提供两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层键值状态解码(bi-level kvs decoding)。用户可根据需求灵活选择。
## 输入输出
输入:视频数据
输出:视频理解结果
运行要求
推理代码仍在更新中。可通过 huggingface-cli 使用 "--include '*.py'" 参数仅更新推理代码,避免下载整个模型。
基本用法
### 模式一:无效率优化的推理
### 模式二:基于分块的预填充
该模式通过流式编码视频输入,显著降低内存需求和响应延迟,对长视频效果尤为明显。
启用方式:设置 enable chunk prefill 为 True,并配置以下参数:
- *chunk prefill mode(分块预填充模式)**:
- streaming(流式):流式编码视频块
- mask(掩码):使用注意力掩码实现等效效果,但目前缺乏底层优化操作符,暂不提供效率提升。建议使用 streaming 模式
- *chunk size(分块大小)**:指定每次前向传播处理的块大小,单位为 4 帧(例如 chunk size = 4 表示一次处理 4×4 = 16 帧的视觉 token)。较大的分块大小会逐渐接近完整注意力,导致更高的内存峰值
- *step size(步长)**:控制块之间的步长。较小的步长带来更连续的信息传递,但可能略微降低推理速度
- *offload(卸载)**:布尔参数,决定在前向传播时是否将每个块的键值状态(KVs)卸载到 CPU。可降低内存使用,但会降低推理速度
- *chunk size for vision tower(视觉塔的分块大小)**:对于较长的视频输入,视觉塔可能成为前向传播的内存瓶颈。该参数控制视觉塔的流式模式,单位为 1 帧,且值必须是 4 的倍数
注意:目前基于分块的预填充仅支持 'sdpa' 注意力实现。
### 模式三:基于分块预填充和双层 KVs 解码
即将推出。
限制
- mask 模式目前不提供效率改进
- 基于分块的预填充仅支持 sdpa 注意力实现
- 双层 KVs 解码功能尚未发布
许可证
(原文未提供许可证信息)
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
