|
Google Research于2026年9月24日公布一套面向长篇视频生成的多智能体研究框架,目标是减少多镜头制作中的人物身份漂移、场景变化和错误级联。该系统以Gemini和Veo为基础模型,通过编排层把高层创意要求转成分镜、素材生成、镜头衔接和闭环修订流程。
研究包含四个相互配合的框架:AI video co-director用层级化多智能体和多臂老虎机搜索创作策略;CANVAS维护角色、地点和物体状态的结构化视觉记忆;A²RD以分段生成和多模态视频记忆推进分钟级叙事;VQQA通过视觉语言模型生成问题,把自然语言反馈作为提示词优化信号。系统还设置编排、前期制作、制作和评审角色,由多模态模型对成片进行评估,再把结果反馈到下一轮生成。
适用对象包括需要连续角色和场景的广告、课程、短片、游戏过场与实验性长视频创作者,也适合研究人员探索多智能体视频制作和测试时优化。官方报告称,框架在多镜头叙事一致性、角色持续性和长时段环境稳定性上较现有流水线有改进,并展示了持续约十分钟的视频生成案例。
这项工作的实际意义是把“保持世界状态”和“检查成片质量”纳入视频生成主循环,减少人工反复修提示词的工作量;但它目前仍是研究框架,Co-Director和CANVAS分别计划在COLM 2026与EMNLP 2026亮相,并非一个已承诺商业化交付的独立产品。论文和官方页面也提醒,生成质量、推理成本、模型调用可用性以及长视频中的安全与事实一致性仍需在具体项目中验证。Google表示其框架继承Gemini和Veo的SynthID水印,生产流程仍可叠加额外安全分类器。
官方发布日期:2026年9月24日。官方来源:https://research.google/blog/coherent-long-form-video-generation/ |
0