闲社

标题: Google为Gemini上线智能体视频理解:按需扫描视频片段 [打印本页]

作者: meteor1982    时间: 2026-9-4 10:02
标题: Google为Gemini上线智能体视频理解:按需扫描视频片段
【事件概述】
Google DeepMind 于 2026 年 9 月 1 日为 Gemini API 推出智能体视频理解(Agentic Video Understanding)。与默认按固定帧率提取整段视频的静态处理不同,新模式让模型根据问题主动搜索时间线,按需读取画面、音频和转录,并动态调整检查片段的帧率与分辨率。

【涉及模型与开发者】
功能:Gemini 智能体视频理解
开发者:Google DeepMind
官方发布日期:2026 年 9 月 1 日
首发支持模型:Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite
当前开发者文档列出的支持模型:Gemini 3.8 Flash、3.7 Flash、3.6 Flash、3.5 Flash-Lite

日期核对说明:Google 官方发布文章明确标注 2026 年 9 月 1 日,并列出当时首发的三款模型。Gemini 3.8 Flash 于其后发布,当前官方开发者文档已经把 3.8 Flash 加入支持列表;本文没有把 3.8 的后续兼容误写为 9 月 1 日首发内容。

【关键能力与改动】
1. 从静态采样转向目标驱动:默认静态模式以固定 1 FPS 抽帧并一次性放入上下文;智能体模式会先理解问题,再在视频时间线上搜索、扫描和重新查看相关区段,只加载回答所需的信息。
2. 多模态联合检查:模型可在视觉帧、音频和转录文本之间选择需要的信号,并对快速动作或关键片段自适应提高采样帧率。
3. 精确定位短暂事件:适用于查找不到一秒的状态变化、镜头切点或快速动作,减少固定低帧率采样遗漏关键画面的概率。
4. 长视频检索:面对课程、访谈、操作指南和多小时录像,模型可先缩小范围再深入检查,避免把整段视频全部以高密度 token 填入上下文。
5. 异常与计数任务:可以反复查看可疑时间窗,用于动作次数、不同物体、异常行为和视觉瑕疵的辅助检测。
6. 可观察的处理步骤:官方文档说明,启用后响应的 interaction.steps 中会出现 processing_call 与 processing_result,可用于确认模型确实动态加载了视频片段。

【官方评测说明】
Google 表示,在其标准视频分析基准上,智能体视频理解最多减少 88% token 消耗、降低 66% 分析成本,并将质量提高最多 7%。官方还称 Gemini 3.7 Flash 在测试模型中取得较好的质量与成本平衡。

这些数字是厂商在指定模型、视频、问题、采样方式和计价条件下得到的“最高”结果,不代表每个请求都能达到相同比例。短视频、需要全帧审查的任务,或目标分散在整段视频中的问题,节省幅度可能明显降低。

【可用范围与使用方式】
该功能可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 中使用,支持上传的视频文件和公共 YouTube 视频。调用时需要在视频输入对象中设置 processing 为 agentic;若不设置,仍会使用默认静态处理。

官方表示智能体处理使用标准 Gemini API token 价格,不额外收取功能费。但最终费用仍取决于所选模型、实际加载的视频内容、输入输出 token、存储方式和平台政策。

【适用对象】
适合开发长视频问答、课程检索、会议与访谈分析、素材定位、自动剪辑辅助、安防录像初筛、体育动作统计和工业异常检测的团队。对于几分钟以内的短视频、极低延迟请求,或要求逐帧覆盖全部内容的质量检查,静态模式可能更直接。

【实际影响】
传统视频大模型应用通常要在“多抽帧提高细节”和“少抽帧降低 token 成本”之间手工取舍。智能体视频理解把这个取舍交给模型在运行时完成:先定位相关时间窗,再根据任务加密查看。这让长视频检索更接近工具调用式智能体,而不只是把预先抽好的帧一次性送进上下文。

对开发者而言,接入改动较小,但评估方法需要改变。除了最终答案,还应检查模型查看了哪些片段、是否遗漏关键证据,以及 processing_call 和 processing_result 是否按预期出现。

【限制与使用提醒】
智能体模式会进行规划、搜索和多次加载,复杂长视频可能耗时更久。Google 建议长任务使用流式返回或后台执行,以降低连接或身份验证超时风险。延迟敏感的短片处理,以及要求固定帧级覆盖的任务,仍可选择 static 模式。

公共 YouTube URL 功能仍属于预览能力,只支持公开内容,不能处理私密或不公开视频,价格和限额也可能变化。上传文件还受免费版、付费版、文件大小、视频数量和存储方式限制,部署前应查阅最新开发者文档。

模型按需检查不等于完整看过每一帧,异常检测、人数或物体计数、合规审查和安全监控仍可能出现漏检或误判。涉及执法、医疗、工业安全、版权或个人隐私的视频,必须设置数据权限、人工复核、审计记录和明确的保留策略。

【官方来源】
Google 官方发布:https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
Gemini API 视频理解文档:https://ai.google.dev/gemini-api/docs/video-understanding




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0