【对象与发布方】对象是Google Research的AI video co-director及配套的CANVAS、A²RD和VQQA框架,研究作者为Google研究科学家Yale Song和Yiwen Song。系统以Gemini和Veo为基础模型,但编排层设计为可适配其他生成模型。
【关键能力】AI video co-director用分层智能体和多臂老虎机搜索创作方向;CANVAS通过持久视觉记忆维护角色、地点和物体状态;A²RD按片段生成并在外推与插值之间切换;VQQA用视觉问答反馈反复优化提示词。研究展示了持续约十分钟的视频,并报告多镜头一致性和角色保持方面的改进,生成内容继承Veo等模型的SynthID水印能力。