← 最新论文
🤖 machine learning

A Unified Measure-Theoretic View of Diffusion, Score-Based, and Flow Matching Generative Models

本文提出了一个统一的测度论框架,将扩散模型、基于分数的生成模型和流匹配揭示为学习时变向量场以将参考分布输运至数据分布的实例,从而阐明了它们共享的数学结构、实际权衡以及理论联系。

原作者: Aditya Ranganath, Mukesh Singhal

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditya Ranganath, Mukesh Singhal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一堆杂乱无章、错综复杂的数据(比如一张高分辨率的猫的照片),而你希望教会计算机从零开始创作出新的、逼真的猫照片。为此,计算机需要学习如何从纯粹的混乱状态(随机噪声)过渡到有序的结构状态(猫的照片)。

本文认为,三种流行的教会计算机完成此任务的方法——扩散模型(Diffusion Models)基于分数的模型(Score-Based Models)流匹配(Flow Matching)——实际上只是描述同一段根本旅程的不同方式:将概率质量从混乱输送到有序。

以下是使用简单类比进行的分解说明:

1. 核心理念:概率之河

想象数据(猫的照片)是河流起点(t=0t=0)处平静的湖泊,而随机噪声是河流终点(t=1t=1)处湍急的海洋。

  • 目标:计算机需要学习如何驾驶船只从海洋逆流返回湖泊。
  • 路径:本文指出,所有这些方法都定义了一条特定的“河流”(一系列中间状态的路径),连接着海洋与湖泊。
  • 地图:为了在这条河上航行,计算机需要一张地图。本文表明,这张地图可以用两种不同的方式绘制,但它们通向同一个目的地。

2. 两种类型的地图(分数 vs. 速度)

本文解释,计算机学习一个“场”来引导船只。绘制这个场有两种方式:

  • “气味”地图(基于分数)
    想象船只是一艘在迷雾森林中穿行的徒步者。徒步者看不见目的地,但能闻到一股微弱的气味,随着他们越接近目标,气味就越浓。

    • 工作原理:计算机学习概率的“梯度”或“斜率”。它学习将船只指向数据“更有可能”被发现的方向。
    • 方法:这被用于扩散基于分数的模型中。它们训练计算机预测河流中每一点的这种“气味”(数学上称为分数)。
    • 旅程:船只可以通过两种方式移动:
      1. 随机(SDE):船只随波逐流,但会被随机的波浪(噪声)推来推去。这就像在森林中行走时,一阵微风会将你推离路线,但你根据气味不断修正路径。
      2. 确定性(ODE):船只沿着一条完美平滑、笔直的轨道移动。本文证明,如果你移除随机的波浪,船只仍然遵循完全相同的“气味”地图,最终到达同一个湖泊,只是没有了颠簸。
  • “速度”地图(基于速度)
    想象船只不是靠闻气味,而是由一位船长掌舵,他知道在每一刻为了沿直线到达目的地,应该以多快的速度和什么方向行驶。

    • 工作原理:计算机学习一个速度场。它不问“数据在哪里?”(气味),而是问“我现在应该以多快的速度、朝哪个方向走?”(速度)。
    • 方法:这就是流匹配。流匹配的设计者不是从一条充满噪声的河流开始并试图逆转它,而是先选择一条河流路径(例如,噪声与数据之间的一条直线),然后训练计算机学习沿该特定路径行进所需的速度。

3. 大统一

本文的主要贡献在于表明,这些并非相互竞争的技术,而是完成同一项工作的不同工具:

  • 扩散/分数模型:从一条充满噪声的河流开始,学习“气味”以逆转它,并可以选择随波逐流(SDE)或在平滑轨道上航行(ODE)。
  • 流匹配:首先绘制一条特定的河流路径(如直线),然后学习沿其行进的“速度”。
  • 联系:如果你取一个扩散模型,移除波浪,并观察它创建的平滑轨道,那么该轨道在数学上与流匹配路径完全相同。它们只是计算同一种运动的不同方式。

4. 这为何重要?(本文的“为什么”)

作者认为,通过将所有这些方法视为“概率传输”,我们可以停止将它们视为独立的孤岛。

  • 更好的导航:如果你想要一艘沿直线移动的船(快速生成),流匹配非常出色。如果你想要一艘能探索不同路径的船(多样性),充满噪声的扩散方法则更好。
  • 修正地图:本文强调,错误发生在三个地方:
    1. 地图错了:计算机没有完美地学会气味或速度。
    2. 船错了:计算机没有足够的数据来学习地图。
    3. 引擎错了:计算机试图让船开得太快(步长太大)从而导致失控。

5. “逆问题”(修复模糊照片)

本文提到,这些模型非常适合“逆问题”,例如将模糊的照片变清晰。

  • 类比:想象你有一张模糊的照片(数据),想要修复它。你可以利用“气味”地图来指导修复过程。你从一个猜测(噪声)开始,让“清晰度”的气味将像素拉回原位。本文指出,无论你使用颠簸的船(SDE)还是平滑的船(ODE),都会改变修复过程的稳定性和准确性。

总结

扩散基于分数流匹配想象成三个不同的 GPS 应用程序。

  • **应用 A(扩散)**说:“这是一条充满噪声的路径。跟随目的地的气味,你可以选择在有微风或无微风的情况下行走。”
  • **应用 B(流匹配)**说:“让我们先画一条笔直的高速公路,然后教你如何驾驶它。”
  • 本文说:“这实际上是同一条路。无论你称之为‘气味’还是‘速度’,你只是将概率从混乱移动到杰作。将它们理解为一个统一的系统,有助于我们构建更好、更快、更可靠的 AI。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →