← 最新论文
💻 computer science

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

本文介绍了上下文强制(In-Context Forcing),这是一种用于视频扩散的渐进式自回归范式,它利用噪声水平递减的上下文来平衡时间一致性与帧间动态,同时实现跨帧并行去噪以显著加速推理。

原作者: Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机只需通过阅读一段文本提示,就能逐帧地构思出电影。这就是**视频生成(video generation)的魔力——在这个领域,人工智能正在学习如何绘制流动的图像。为了实现这一目标,许多现代 AI 模型使用了一种被称为扩散(diffusion)的技术。可以将扩散想象成一位雕塑家,从一块充满噪声和静电感的粘土块开始,通过慢慢凿去噪声,最终显现出一尊清晰、光滑的雕像。在视频中,这个过程是逐帧发生的。然而,一次性制作整部电影既缓慢又耗费计算资源。因此,科学家们经常使用一种称为自回归(autoregression)**的“流式”方法,即 AI 生成一帧,将其作为引导,然后再制作下一帧,就像一场接力赛,每个跑者都将接力棒传递给下一个跑者。面临的巨大挑战始终是如何在速度与质量之间取得平衡:如果 AI 观察得太近,它会过度依赖前一帧(导致视频看起来像是冻结了);如果观察得太远,角色可能会出现闪烁或消失。

这篇论文解决了这个接力赛中的一个特定问题:AI 手中的“接力棒”太干净了。目前的方法传递的是一个完美、无噪声的清晰帧,这会意外地泄露过多的微小细节。这会导致 AI 走捷径,仅仅是复制前一幅图像,而不是想象它应该如何运动,从而导致视频显得僵硬、枯燥。作者杨灵霄及其团队提出了一种巧妙的新策略,称为上下文强制(In-Context Forcing)。他们不再传递一张晶莹剔透的照片,而是传递一个“有噪声”的版本的前一帧。通过调整引导帧中的噪声量——让紧邻的过去保持模糊(以迫使 AI 想象运动),让较远的过去保持清晰(以保持故事的一致性)——他们创造出了流动自然的视频。他们还发现了一种方法,可以让 AI 同时生成多个帧,而不是等待一个完成后再开始下一个,这使得整个过程显著加快。

“太干净”的问题

想象一下,你正试图通过观察一位朋友来学习跳舞。如果你的朋友站得纹丝不动,而你盯着他们看得太仔细,你可能只会机械地模仿他们的精确姿势,而没有真正学会舞蹈的节奏。这就是当前视频 AI 模型发生的情况。它们观察前一帧,而那一帧是“完全去噪的”(完美清晰的),由于它拥有如此锐利的细节,AI 会过度依赖前一帧。它会想:“噢,我完全看到了上一帧长什么样,我直接复制就好了,”而不是去思考场景应该如何演变。这导致视频中的角色看起来像是陷入了循环,或者动作带有僵硬、不自然的抽动。论文指出,这种“捷径”破坏了时序动态(temporal dynamics)——即时间流逝感和事物平滑运动的感觉。

“噪声引导”的解决方案

为了修复这个问题,作者引入了上下文强制(In-Context Forcing)。他们改变了接力赛的规则。他们不再向下一步传递一张完美的、清晰的照片,而是传递一个仍然有些模糊的版本。

  • 类比: 将 AI 想象成一位正在画连环画的艺术家。如果前一个分镜是完美完成的,艺术家可能会直接在上面描摹。但如果前一个分镜是一个带有污迹的粗略草图(噪声),艺术家就必须动脑筋去构思角色如何移动到下一个分镜。
  • 运作方式: 该系统对引导帧应用不同程度的“噪声”。紧邻当前帧之前的帧会被保持得相当多噪(模糊),从而迫使 AI 生成新的运动而非复制细节。更久远的过去帧则会被保持得更清晰,以便 AI 记住整体故事和角色形状。这创造了一个“渐进式”的引导,告诉 AI 在每一步需要创造多少细节。

“并行”的力量加持

通常,自回归模型就像是一条单车道公路:第一帧必须结束,然后第二帧才开始,接着是第三帧。这很慢。论文表明,由于他们的新方法不依赖于完美清晰的前一帧,它解锁了一条秘密车道。他们引入了跨帧因果注意力(cross-frame causal attention),允许 AI 同时处理多个帧。

  • 类比: 想象一支画家团队。在旧方法中,他们必须等待第一位画家完成一面墙后,第二位才能开始。有了“上下文强制”,团队可以同时绘制整个房间,因为他们拥有一个共享的、略显模糊的蓝图,大家可以达成共识,而无需等待前一堵墙变得完美。
  • 结果: 这种并行处理显著提高了视频生成的速度。论文报告称,在标准测试中,该方法比之前的先进方法将视频生成的总时间减少了 45.1%,同时也让视频看起来效果更好。

测试展示了什么

作者在各种视频生成任务上测试了他们的方法,从短片到长达 30 秒的序列。他们使用名为 VBench 的工具将自己的结果与其他顶尖模型进行了对比,该工具会对视频的视觉质量、与文本描述的匹配度以及运动的动态程度进行评分。

  • 发现: “上下文强制”在这些测试中得分高于所有其他模型。具体而言,它在短视频上的“动态程度(Dynamic Degree)”得分达到了 72(相比之下,次优模型为 63),并在长视频上达到了 86.40,远超名为“滚动强制(Rolling Forcing)”的方法(其得分仅为 40.63)。
  • 为什么这对长视频很重要: 论文指出,随着视频变长,旧方法的效果会变差,因为它们的“训练-测试差距(train-test gap)”(即学习方式与表现方式之间的差异)会导致误差累积。由于“上下文强制”从不让 AI 对复制过去感到过于安逸,因此即使在长序列中也能保持运动的多样性和自然感。

核心结论

这篇论文并不声称已经解决了视频 AI 的所有问题,但它表明,通过将“噪声”视为一种有用的工具而非仅仅是要消除的东西,我们可以教会 AI 变得更有创意且减少对捷径的依赖。通过强迫模型在“有噪声”的上下文中工作,他们防止了模型采取捷径,从而使生成的视频运动更加自然,且生成速度更快。作者证明了这种方法不仅在理论上可行,在实践中也同样有效,为构建更快、更聪明、感觉更生动的视频生成器提供了一种新途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →