模型介绍
中文整理Marlin:用于从视频中提取结构化信息的微型视觉语言模型
模型用途
Marlin 是一个 20 亿参数的视觉语言模型,专为开发者实际关心的两个视频问题设计:发生了什么,以及什么时候发生?它生成结构化的场景和事件描述,包含精确到秒的时间戳,并将自然语言查询解析为基于时间跨度(起始、结束)的视频范围。
主要能力
密集字幕生成:在 20 亿参数级别达到最优水平,登上 CaReBench 排行榜榜首,在 DREAM-1K 上介于 Tarsier-34B 和 Gemini-1.5-Pro 之间。
时间定位:在 20 亿参数级别表现最佳。在 Tencent 的 TimeLens-Bench(Charades / ActivityNet / QVHighlights)上,Marlin 以 +6.4 mIoU 超越 Qwen2.5-VL-7B,并与 Gemini-2.0-Flash 持平。
易于部署:20 亿参数,兼容 vLLM 和 swift-deploy,可在单张消费级 GPU 上运行。推理时使用与训练时相同的规范提示词,无需特殊封装。
开发者友好:使用标准 Hugging Face Transformers API,提供两个便捷方法(.caption 和 .find)返回解析后的字典,支持原始 .generate() 调用以实现自定义提示词,开箱即用 Gradio 演示。
输入输出
输入:视频文件
输出模式一(Caption):生成 Scene: + Events: 格式的结构化描述,包含场景信息和带时间戳的事件列表。
输出模式二(Find):给定自然语言事件查询,返回 From X.X to Y.Y. 格式的时间范围。
运行要求
依赖库:transformers >= 5.7.0、torch >= 2.11.0、torchcodec、qwen-vl-utils >= 0.0.14、av、pillow
硬件:单张消费级 GPU
环境变量(可选配置):FORCE_QWENVL_VIDEO_READER(默认 torchcodec)、VIDEO_MAX_PIXELS(默认 200704)、FPS(默认 2.0)、FPS_MAX_FRAMES(默认 240)、FPS_MIN_FRAMES(默认 4)
基本用法
加载模型:使用 trust_remote_code=True 加载,返回可直接使用的实例。
Caption 模式:调用 marlin.caption() 生成密集视频描述。可选参数包括 max_new_tokens(默认 2048)、prompt(默认 None)、do_sample(默认 False)、temperature(默认 1.0)、top_p(默认 1.0)。
Find 模式:调用 marlin.find() 进行时间定位查询。根据自然语言描述返回对应的时间范围。
限制
多片段推理能力在此版本中有限:不支持通过 .caption() 或 .find() 直接调用,需要使用原始提示词。
在 20 亿参数级别是最强的通用模型,但专门的 70 亿以上参数模型(如 TimeLens-7B/8B、MiMo-VL、Time-R1)仍保持优势,因为它们在训练时使用了任务特定数据。
许可证
原始内容中未包含许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
