← 最新论文
💻 computer science

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

本文介绍了锚定树采样(ATS),这是一种无需训练的推理调度器,它通过以分层、锚点约束的插补策略取代序列自回归 rollout,来缓解长时程视频漂移与连贯性问题,从而在静态相机视频到视频生成中实现了更优的质量与稳定性。

原作者: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图绘制一幅长达 40 分钟的宏大故事壁画,但每次只能使用一块仅能容纳 10 秒画面的小画布。

旧方法(自回归生成):“多米诺效应”
目前,大多数 AI 视频生成器的工作原理就像一排多米诺骨牌。要制作长视频,AI 先绘制前 10 秒的画面,然后利用这幅画来推测接下来 10 秒的样子,再基于那幅推测再下一段,如此循环往复。

论文将这种现象称为“漂移”。就像“传话游戏”一样,每个 10 秒片段中都会出现微小的错误。等到 AI 生成到第 30 分钟时,角色的脸可能已变形为怪物,背景可能改变了颜色,或者故事可能已偏离了原本的情节。此外,AI 必须等待前一个片段完成后才能开始下一个,这使得整个过程非常缓慢。

新方法(锚定树采样):“施工脚手架”
来自 Descript, Inc. 的作者们提出了一种更聪明的方法,称为锚定树采样(Anchored Tree Sampling, ATS)。他们不再像以前那样一次只绘制一小条壁画,而是搭建一个脚手架。

以下是其工作原理,借用建筑类比来说明:

  1. 根调用(设立支柱): 首先,AI 一次性审视整个 40 分钟的故事。它并不试图绘制每一帧,而是在关键时刻放置几个“锚点支柱”(稀疏帧):开头、结尾以及中间的几个位置。你可以将这些视为主干,如同支撑桥梁的主要桥墩。
  2. 细化(填补空隙): 接下来,AI 查看第一根支柱和第二根支柱之间的空隙。它知道起点和终点的确切样貌,因此可以绘制它们之间的空间。它对第二根和第三根支柱之间的空隙也进行同样的操作。
  3. 叶节点(最终细节): 最后,它填充那些新绘制部分之间的微小空隙,直到整个视频完成。

为何这是游戏规则的改变者

  • 不再漂移: 由于视频的每个部分都由已知的起点和终点“锚定”,AI 不会偏离轨道。如果你要求它在开头画一辆红色的车,在结尾也画一辆红色的车,它就会在中间保持车辆为红色。它无需基于模糊且充满错误的上一帧进行猜测。
  • 超快速度: 旧方法就像一个人从左到右粉刷墙壁。新方法则像一支粉刷团队。一旦“支柱”设定好,不同的团队就可以同时粉刷墙壁的不同部分。这使得生成长视频的速度大大提升。
  • 一致性: 视频从头到尾都能忠实于原始指令(如特定的姿势或边缘绘制),角色不会突然换衣服,背景也不会发生偏移。

其最佳适用场景(及局限性)
论文表明,该方法在静态摄像机视频中表现极佳(即摄像机不会剧烈移动,例如人物对着镜头说话,或固定拍摄某个场景)。在这些情况下,AI 可以轻易预测“锚点支柱”,因为背景变化不大。

然而,作者承认目前它仍存在局限:

  • 动态摄像机: 如果摄像机在城市中穿梭或旋转,AI 有时难以正确猜测“锚点支柱”,因为视角变化过大。
  • 新角色: 如果视频中间出现了开头或结尾“锚点”中未包含的新物体或人物,AI 绘制的样子可能与它若较早出现时略有不同。
  • 文生视频: 目前,该方法在提供视频供 AI 修改(视频转视频)时效果最好。如果仅输入文本提示,使用难度较大,因为 AI 需要那些“锚点支柱”作为起点。

核心结论
该论文引入了一种“树”状结构,将长视频分解为可管理且相互连接的片段。通过在特定点锚定视频并并行填充空白,他们解决了视频随时间推移变得“潦草”的问题,并显著加快了生成过程。他们成功生成了长达 40 分钟且保持一致性和高质量的视频,而以往的方法在没有错误的情况下很难做到这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →