|
【事件概述】Google Research于2026年9月24日发布一项长视频生成研究,提出统一的多智能体框架,让AI在多镜头叙事中持续跟踪角色、场景和物体状态,减少角色漂移与错误级联。
【对象与发布方】对象是Google Research的AI video co-director及配套的CANVAS、A²RD和VQQA框架,研究作者为Google研究科学家Yale Song和Yiwen Song。系统以Gemini和Veo为基础模型,但编排层设计为可适配其他生成模型。
【关键能力】AI video co-director用分层智能体和多臂老虎机搜索创作方向;CANVAS通过持久视觉记忆维护角色、地点和物体状态;A²RD按片段生成并在外推与插值之间切换;VQQA用视觉问答反馈反复优化提示词。研究展示了持续约十分钟的视频,并报告多镜头一致性和角色保持方面的改进,生成内容继承Veo等模型的SynthID水印能力。
【适用对象】适合影视、广告、教育内容创作者和视频生成研究者,用于长叙事分镜规划、素材编排和一致性评估。
【实际影响与限制】该方法把长视频制作从线性提示链转为全局规划、状态跟踪和闭环评审,有望减少人工维护镜头连续性的工作。但目前仍是研究框架,依赖Gemini、Veo等生成模型和多轮测试时优化;论文中的指标来自特定基准,不能直接等同于商业成片质量,实际项目仍需人工审片与安全审核。
【官方来源】https://research.google/blog/coherent-long-form-video-generation/ |
0