AI VIDEO · MULTI-SHOT CONTINUITY

AI 视频会拍镜头
为什么还拍不好故事

今天的模型已经很会制造瞬间,但一切镜头,人物、房间和动作经常一起漂移。 问题不只是模型记不住,而是系统没有持续比较剧本希望发生什么与画面实际发生什么。

更新于 2026-09-29 · 论文与系统机制整理

同一位蓝衣女性在两个连续镜头中出现细微身份与道具漂移的概念画面
AI 生成概念图:同一人物、同一道具、相邻镜头,细小偏差足以让故事断裂。人物为虚构形象。
TL;DR
  • 生成画面和维持一个世界,是两种能力。
  • 可靠系统要维护两本账:叙事意图与画面事实。
  • 真正可用的长视频系统,不要求每次都生成正确,而要尽早发现错误、限制错误传播,并知道什么时候重拍。

漂亮片段为什么连不成故事

一束光穿过窗户,一个人回头,风吹动衣角。单看几秒,画面已经很像电影。可镜头一切,魔法经常就散了。

同一个人换了脸,外套多了一排扣子;刚才还在右手的杯子,下一镜头跑到左手;人物明明已经走到门边,切过去却又站回桌旁。每一段都像电影,连起来却不像同一个故事。

身份漂移、空间漂移和动作漂移三类连续性错误
自绘问题示意:连续性错误至少发生在身份、空间和动作状态三个层面;图中不是真实模型输出。

一句“同一个女人穿着蓝色外套走进厨房”,只能描述语义,不能唯一确定她的脸、外套剪裁、房间几何,也不能说明上一镜头真正生成到了哪里。

生成画面,和维持一个世界,是两种能力。文字告诉模型“发生什么”,但故事还需要一套系统保存“这个世界现在是什么样”。

真正难的不是记住 而是纠正偏差

剧本要求人物走到门口,模型却只让她走到沙发边。下一步并不是机械地“记住末帧”,而要做一个制作决定:

接受

让下一镜头从沙发边继续,随后重写动作。

修正

增加一个从沙发到门口的过渡镜头。

重拍

把当前位置作为失败原因,重新生成当前镜头。

因此,多镜头生成更像一个状态控制问题。系统同时维护两本账:一本记录叙事意图,一本记录画面事实。导演判断两者允许偏离多少,场记发现偏离,生成模型负责重拍或接下去。

六个 Agent 到底各自做什么

还是用“蓝衣女人右手拿杯子,从沙发走到门口”这个镜头。Agent 不是六个会聊天的小人,而是六个职责明确的制作模块。

01

导演 Agent

把剧情变成验收条件:人物、蓝色外套、右手杯子不能变,最后必须停在门边。

02

分镜 Agent

固定人物脸、外套剪裁、沙发和门的位置,并画出镜头起点与终点。

03

生成 Agent

根据分镜产生多个候选。它负责交作业,不负责证明作业正确。

04

场记 Agent

从成片末帧读取人物位置、朝向、道具和服装,记录实际结果而不是照抄剧本。

05

审片 Agent

比较两本账,指出是身份、道具还是关键动作失败,给出可执行的返工意见。

06

接戏 Agent

把验收后的末态交给下一镜头;若接受偏差,就同步修改后续分镜。

六个 Agent 依次处理同一条镜头的循环动画
原创动态示意:用同一个镜头展示六种职责。这是帮助理解工作流的抽象,不表示下述论文采用完全相同的模块名称。

最重要的分工,是把生成和验收拆开。让同一个模型既交作业又给自己打分,很容易把“看起来不错”误当成“满足了剧情”。

五项研究分别补上哪一环

Co-Director、CANVAS、A²RD、VQQA 和 MVAgent 在多镜头视频控制回路中的位置
自绘研究地图:五项研究可以理解为同一个控制回路中的不同部件——确定意图、保存状态、观察结果、判断误差,再决定继续还是返工。

Co-Director:守住全片方向

先确定创意策略、叙事模式和审美方向,让故事线、关键帧、视频和音频共享同一目标。论文主实验仍是四镜头、12 秒虚构广告,不能外推成任意长片已经能够一键生成。

CANVAS:保存角色、背景和道具

给人物、地点和道具建立视觉锚点。故事再次回到同一地点时,系统检索原来的世界,而不是重新想象一间“差不多的房间”。

A²RD:处理长时记忆

在推动剧情的“外推”和保持人物环境的“插值”之间选择,并在每一段后检索、生成、修正、更新。它用额外候选和测试时计算换取更长的状态维持。

VQQA:审片和返工

先让视觉语言模型判断哪里没有满足目标,再修改条件、重新采样并从候选中选择。上限同时受审片模型和基础视频模型影响。

MVAgent:从真实末态接下一镜

观察上一镜头真正结束时的人物位置、朝向、动作与转场条件,再构造下一镜头输入,重点解决黑盒视频生成器之间不共享内部状态的问题。

论文图里能看到什么

CANVAS 与 AutoStudio、Gemini 的博物馆盗窃故事板连续性对比

CANVAS Figure 1。作者用同一段博物馆盗窃故事对比 AutoStudio、Gemini 与 CANVAS:前两者分别出现帽子消失、房间变化和道具外观变化,CANVAS 在这组作者实验中保持了角色、背景与道具的一致。图片来自 Ishani Mondal、Yiwen Song、Mihir Parmar、Palash Goyal、Jordan Boyd-Graber、Tomas Pfister、Yale Song,按 CC BY 4.0 引用;这是论文作者示例,不是本站实测。查看原论文

论文在故事板任务上报告,相对最佳基线,背景、角色和道具连续性分别提升 21.6%、9.6% 和 7.6%。它首先证明的是故事板与关键帧更稳定,并没有证明完整视频里的运动、表演和物理接触都已经解决。

连续性变好 为什么成本也会上升

连续性不是模型顺手得到的能力。系统需要角色参考图、场景多视角、道具状态、上一镜头末帧和故事长期记忆;还要生成多个候选,让视觉模型评分,再进行返工。

记忆本身也会犯错。如果观察模块误以为杯子在右手,错误就会作为“事实”传给下一镜头;如果评分模型过度关注局部瑕疵,反复优化后还可能偏离原来的故事目标。

竞争点正在变化。关键不只是生成更高清的几秒钟,而是谁能更便宜地发现偏差,并在错误扩散之前把世界拉回正轨。

今天做多镜头视频 可以先改什么

不要只保存每个镜头的提示词。为项目建立两列记录:左边是镜头必须完成的叙事意图,右边是实际生成结果。再记录角色、服装、道具、场景布局和镜头结束时的人物状态。

  1. 下一镜头从上一镜头的真实结尾开始。
  2. 把错误分成身份、空间、道具和动作,再决定补参考、改条件还是重拍。
  3. 预先写清哪些偏差必须重做,哪些偏差可以被后续剧情吸收。

AI 视频正在从生成问题变成控制问题。 模型负责提出镜头,系统负责判断镜头是否仍然属于这个故事。

来源与边界

  1. Google Research:Automating coherent long-form video generation,2026-09-24。
  2. Co-Director:全局创意搜索与多阶段生产。
  3. CANVAS:视觉故事板中的角色、背景和道具连续性。
  4. A²RD:分段长视频与多模态记忆。
  5. VQQA:生成后视频评价与条件迭代。
  6. MVAgent:跨镜头条件构造与策略优化。

本站未对上述系统进行同输入复现。所有数字均为论文作者在各自任务、模型和指标下报告的结果,不用于横向排名。