← 最新论文
💻 computer science

Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning

本文引入了平衡强制(Equilibrium Forcing, EqF),这是一种用于自回归视频生成的创新框架,它通过消除噪声水平调节以实现去噪学习与采样的解耦,从而实现能够显著提升视频质量和一致性的自适应闭环推理,其效果优于标准方法。

原作者: Hansen Jin Lillemark, Alex Rojas, Zachary Novack, Runqian Wang, Yilun Du, Yian Ma, Taylor Berg-Kirkpatrick, Rose Yu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Hansen Jin Lillemark, Alex Rojas, Zachary Novack, Runqian Wang, Yilun Du, Yian Ma, Taylor Berg-Kirkpatrick, Rose Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

逐帧生成随时间演进的视频,是人工智能最艰巨的任务之一。它要求模型不仅要生成单张图像,还要想象出一个序列,其中每一帧都必须逻辑严密地承接上一帧,从而保持一致的世界观、光影和运动。这就是自回归视频生成(autoregressive video generation)的领域,这项技术驱动着从交互式模拟到下一代数字叙事的一切内容。多年来,完成这一任务最成功的方法一直依赖于一种特定的、僵化的策略:它们从纯粹的静态噪声开始,并逐步将其移除,以揭示最终图像。为了保持这一过程的稳定性,这些系统传统上被迫遵循一个严格的、预先写好的计划,即无论当前的图像实际呈现出什么样,都要精确地告诉计算机在每一个时刻应该移除多少噪声。

来自加州大学圣迭戈分校、麻省理工学院和哈佛大学的研究团队挑战了这一长期存在的假设。他们提出,强迫计算机遵循固定的剧本实际上是许多错误(尤其是生成长视频时)的根源。在他们的新工作中,他们引入了一种称为“平衡强制”(Equilibrium Forcing)的方法。该系统不再遵循僵化的计划,而是学会了“倾听”它正在创建的图像。它会根据观察到的内容来估算图像中还残留多少噪声,并据此调整下一步的动作。这创造了一个闭环,使生成过程能够适应自身的进度,就像驾驶员根据前方的路况调整车速,而不是死板地遵守预设的限速值一样。其结果是一个能够生成比以往方法更长、更连贯视频的系统。

研究人员发现的核心问题在于,旧有的视频生成方式在“计划”与“现实”之间造成了脱节。在标准方法中,计算机被告知在第一步要移除特定量的噪声,然后在第二步移除不同量的噪声,以此类推。这个计划在视频生成开始之前就已经固定下来了。然而,随着计算机生成帧的过程,微小的误差不可避免地会悄然潜入。它正在处理的图像所拥有的噪声量,可能并不符合计划中的预测。由于计算机盲目地遵循计划,它会继续应用错误的修正量,导致误差不断累积。在一段长视频中,这种偏差会变得非常严重,导致画面闪烁、形状扭曲或场景逻辑的彻底崩溃。研究人员发现,计划中的噪声水平与图像中实际的噪声水平之间的差距随着每一帧的增加而扩大,最终毁掉了生成的质量。

为了解决这个问题,该团队开发了一个完全移除噪声计划的框架。他们训练了一种新型模型,该模型不需要被告知存在多少噪声。相反,模型学习了一种统一的清理图像的方法,无论图像当前的噪声程度如何。在生成过程中,模型观察当前图像,并在内部估算剩余的噪声量。然后,它利用这一估算值来决定下一步如何改变图像。这使得系统能够在一个闭环中运行,不断检查自己的进度,并调整速度和方向。如果图像仍有很多噪声,它就会采取较大的步幅;如果图像接近清晰,它就会采取更小、更谨慎的步幅。这种灵活性防止了误差的累积,使视频能够保持稳定长达数百帧。

研究人员在多个具有挑战性的数据集上测试了这种方法,包括机器人手臂执行任务的视频、房地产展示视频以及来自《我的世界》(Minecraft)的游戏画面。在每种情况下,他们的新方法都优于标准方法。例如,在《我的世界》数据集中,新系统生成的 300 帧序列在视觉质量和一致性方面显著高于之前的最佳方法。这种改进在长序列中尤为明显,而在旧方法中,长序列通常会开始出现退化现象。研究人员还展示了这种新方法甚至可以应用于非常庞大的现有模型。通过将一个最初使用旧有的、僵化计划训练的庞大视频模型进行重新训练,并应用他们新的、灵活的目标函数,他们能够解锁这种高质量、自适应的行为,而无需从头构建一个新模型。

这一成功的关键在于能够根据可用的计算能力来调整生成过程。因为系统知道图像中还剩多少噪声,它可以决定在图像已经足够清晰时提前停止生成,或者在需要移除大量噪声时加速过程。这种“预算自适应”(budget-adaptive)的能力意味着该系统即使在计算资源较少的情况下也能生成高质量的视频,使这项技术在实际应用中更具实用性。研究人员还证明,这种方法能更有效地从错误中恢复。如果系统生成的某一帧略有偏差,它可以检测到错误并在下一步进行纠正,而不是被迫沿着由预设计划所引导的错误路径继续走下去。

研究结果表明,统治视频生成多年的僵化计划并非必要。事实上,它们可能是限制我们所能创建的视频质量和长度的瓶颈。通过让模型倾听自身的进度并进行实时调整,研究人员为创建更长、更连贯且更可靠的视频内容开辟了一条新路径。这种从固定的“开环过程”向灵活的“闭环过程”的转变,代表了我们思考如何教机器想象未来的方式的根本性变化。它推动该领域从遵循剧本转向一种更动态、更具响应性的创作形式,在这种形式下,计算机学会了根据自己的规则在复杂的视频生成景观中进行航行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →