← 最新论文
🤖 machine learning

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

本文介绍了ABC,这是一个新颖的框架,它利用非马尔可夫扩散桥和连续随机微分方程来生成以任意观测子集为条件的随机过程,从而克服了现有扩散模型在视频生成和天气预报等任务中的结构和动态局限性。

原作者: Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试填补一部用坏掉的相机拍摄的电影中缺失的页面。你拥有第一帧、最后一帧,也许还有中间的一些随机帧,但其余部分都是空白的。你的目标是猜测空白处发生了什么,以便故事能够流畅地衔接。

这就是论文ABC(通过非马尔可夫扩散桥实现任意子集自回归)试图解决的问题。这是一种让计算机生成连续内容(如视频或天气预报)的新方法,尤其适用于数据混乱、不规则或缺失片段的情况。

以下是论文如何用简单的类比来解释它:

问题:旧方法就像“跳跃”

当前的方法(如标准扩散模型)运作起来有点像一位笨拙的画家。

  1. “从噪声到数据”的跳跃:为了生成视频的下一帧,这些旧方法通常从一块覆盖着静态(随机噪声)的空白画布开始,试图从头绘制新图像。
    • 缺陷:在真实视频中,第 1 帧和第 2 帧之间的差异微乎其微(比如一只手稍微移动)。但从“静态噪声”开始,就像试图通过将该手从完全不同的房间瞬移过来移动它一样。这忽略了新帧应该与旧帧非常相似的事实。这导致视频出现生硬、闪烁的问题。
  2. “一刀切”的计时器:这些旧方法将时间视为通用的秒表。它们假设为了生成下一帧而添加的“噪声”量是相同的混乱程度,无论你是跳跃到 1 秒后还是 1 小时后。
    • 缺陷:实际上,1 秒的视频变化很小,而 1 小时的视频变化很大。如果对两者使用相同量的“混乱”,短期视频会显得抖动,而长期视频会显得不真实。
  3. “严格顺序”规则:大多数模型只允许你基于过去来预测未来。它们无法轻易利用“剧透”(如电影的最后一帧)来帮助填补中间部分。

解决方案:"ABC"方法

作者提出了ABC,它像一个智能的连续桥梁建造者,而不是跳跃者。

1. “数据到数据”的桥梁

ABC 不是从随机噪声开始,而是确切地从最后一个已知帧结束的地方开始。

  • 类比:想象你在遛狗。如果你想知道 5 秒后狗会在哪里,你不会从公园里的随机地点猜测;而是从狗鼻子此刻所在的位置开始。ABC 就是这样做的。它将生成过程视为从一个已知状态到下一个状态的连续行走,进行微小、自然的调整,而不是巨大、突兀的跳跃。

2. “物理时间”时钟

ABC 理解时间具有物理权重。

  • 类比:想象一条河流。如果你扔下一片叶子,它在短距离内(1 秒)移动缓慢,但在长距离内(1 小时)会行进很远。
    • 旧方法将河流视为无论你看多远,水流速度都相同。
    • ABC 根据实际经过的时间调整“水流速度”(波动性)。如果间隔很小,它只添加极少的“晃动”。如果间隔很大,它会添加更多的“晃动”以解释更大的变化。这使得运动看起来在物理上是真实的。

3. “任意子集”超能力

ABC 可以查看过去、未来或两者的混合来填补空白。

  • 类比:想象你在填字谜。
    • 旧方法只能查看空白方格左侧的字母。
    • ABC 可以查看左侧的字母、右侧的字母,甚至是你已经推断出的单词中间的字母。它利用所有可用的线索(时间线上的任意子集)来猜测缺失的部分,无论它们是在过去还是未来。

工作原理(魔术技巧)

这篇论文使用了一些复杂的数学(随机微分方程和“测度变换”),但其核心思想很简单:
他们构建了一条单一的、连续的数学“道路”(一个 SDE),用于追踪真实时间。他们不是为每一步都建造一座新桥(这会导致“抖动”问题),而是建造了一条连接所有已知点的长而平滑的道路。然后,他们使用神经网络来学习“漂移”(即转向的方向),以便在这条道路上行驶的汽车能够自然地经过所有特定的检查点(已知帧)而不发生碰撞。

结果

作者在以下方面测试了该方法:

  • 视频:填补人脸视频(CelebV-HQ)和天空延时摄影(Sky-Timelapse)中缺失的帧。
  • 天气:预测风暴模式(SEVIR 数据集)。

结论
在他们的测试中,与之前的方法相比,ABC 生成了更平滑、更逼真的视频和天气预报。

  • 它的闪烁更少(更好的时间一致性)。
  • 它能更好地处理不规则的间隔(如缺失的帧)。
  • 它能够利用“未来”帧来帮助填补过去,而旧模型在这方面很吃力。

总结

ABC就像是从一个试图从头猜测下一步的“跳跃机器人”,升级为一个“平滑的滑翔机”,它从一个已知点自然流向另一个已知点,根据经过的时间调整速度,并利用所有可用的线索(过去或未来)来保持航向。论文声称,这导致了像视频和天气这样的基于时间的数据生成更加真实和灵活。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →