想象你有一堆杂乱无章、错综复杂的数据(比如一张高分辨率的猫的照片),而你希望教会计算机从零开始创作出新的、逼真的猫照片。为此,计算机需要学习如何从纯粹的混乱状态(随机噪声)过渡到有序的结构状态(猫的照片)。
本文认为,三种流行的教会计算机完成此任务的方法——扩散模型(Diffusion Models)、基于分数的模型(Score-Based Models)和流匹配(Flow Matching)——实际上只是描述同一段根本旅程的不同方式:将概率质量从混乱输送到有序。
以下是使用简单类比进行的分解说明:
1. 核心理念:概率之河
想象数据(猫的照片)是河流起点(t=0)处平静的湖泊,而随机噪声是河流终点(t=1)处湍急的海洋。
- 目标:计算机需要学习如何驾驶船只从海洋逆流返回湖泊。
- 路径:本文指出,所有这些方法都定义了一条特定的“河流”(一系列中间状态的路径),连接着海洋与湖泊。
- 地图:为了在这条河上航行,计算机需要一张地图。本文表明,这张地图可以用两种不同的方式绘制,但它们通向同一个目的地。
2. 两种类型的地图(分数 vs. 速度)
本文解释,计算机学习一个“场”来引导船只。绘制这个场有两种方式:
3. 大统一
本文的主要贡献在于表明,这些并非相互竞争的技术,而是完成同一项工作的不同工具:
- 扩散/分数模型:从一条充满噪声的河流开始,学习“气味”以逆转它,并可以选择随波逐流(SDE)或在平滑轨道上航行(ODE)。
- 流匹配:首先绘制一条特定的河流路径(如直线),然后学习沿其行进的“速度”。
- 联系:如果你取一个扩散模型,移除波浪,并观察它创建的平滑轨道,那么该轨道在数学上与流匹配路径完全相同。它们只是计算同一种运动的不同方式。
4. 这为何重要?(本文的“为什么”)
作者认为,通过将所有这些方法视为“概率传输”,我们可以停止将它们视为独立的孤岛。
- 更好的导航:如果你想要一艘沿直线移动的船(快速生成),流匹配非常出色。如果你想要一艘能探索不同路径的船(多样性),充满噪声的扩散方法则更好。
- 修正地图:本文强调,错误发生在三个地方:
- 地图错了:计算机没有完美地学会气味或速度。
- 船错了:计算机没有足够的数据来学习地图。
- 引擎错了:计算机试图让船开得太快(步长太大)从而导致失控。
5. “逆问题”(修复模糊照片)
本文提到,这些模型非常适合“逆问题”,例如将模糊的照片变清晰。
- 类比:想象你有一张模糊的照片(数据),想要修复它。你可以利用“气味”地图来指导修复过程。你从一个猜测(噪声)开始,让“清晰度”的气味将像素拉回原位。本文指出,无论你使用颠簸的船(SDE)还是平滑的船(ODE),都会改变修复过程的稳定性和准确性。
总结
将扩散、基于分数和流匹配想象成三个不同的 GPS 应用程序。
- **应用 A(扩散)**说:“这是一条充满噪声的路径。跟随目的地的气味,你可以选择在有微风或无微风的情况下行走。”
- **应用 B(流匹配)**说:“让我们先画一条笔直的高速公路,然后教你如何驾驶它。”
- 本文说:“这实际上是同一条路。无论你称之为‘气味’还是‘速度’,你只是将概率从混乱移动到杰作。将它们理解为一个统一的系统,有助于我们构建更好、更快、更可靠的 AI。”
技术摘要:扩散、基于分数与流匹配生成模型的统一测度论视角
问题陈述
生成建模旨在学习一种机制,以从 Rd 上的复杂数据分布 ρdata 中生成样本。尽管过去十年出现了多种不同的范式——包括变分自编码器(VAEs)、生成对抗网络(GANs)和归一化流(Normalizing Flows)——但最近的进展已汇聚于通过时间依赖动力学将简单参考分布(例如高斯分布)演化为数据分布的方法。
该领域已分化为几个密切相关但符号表示不同的家族:
- 扩散模型:通常通过离散时间马尔可夫链(DDPM)或连续时间随机微分方程(SDEs)引入。
- 基于分数的模型:通过 SDE 的时间反演来表述,依赖于对分数函数(∇logρt)的估计。
- 流匹配:一种通过回归预设概率路径来直接学习速度场的方法,通常绕过显式的分数估计。
本综述解决的主要挑战是缺乏一个统一的框架来阐明这些方法之间的关系、等价性和区别。现有文献存在符号碎片化、推导相互竞争(离散与连续、随机与确定性)的问题,且缺乏关于设计选择(路径、场、采样器)如何影响理论保证和实际性能(稳定性、采样速度和似然计算)的清晰度。
方法论:统一的测度论框架
作者提出了一种统一的技术视角,将扩散、基于分数和流匹配模型解释为概率传输的实例。该框架建立在三个核心设计选择之上:
1. 概率路径 (μt)t∈[0,1]
所有方法都定义了一族中间分布,将目标数据分布 μ0 连接到可处理的参考分布 μ1(通常为高斯分布)。
- 扩散/基于分数:该路径被隐式定义为前向加噪过程(离散马尔可夫链或连续 SDE)的边缘分布。
- 流匹配:该路径通过耦合 π(x0,x1) 和插值规则(例如仿射插值)显式定义,使得路径成为直接的设计选择,而非固定扩散过程的副产品。
2. 学习场
这些方法在学习用于驱动传输的向量场方面有所不同:
- 分数场 (sθ):用于基于分数和扩散模型。分数定义为 st(x)=∇xlogρt(x)。该场通过去噪分数匹配(DSM)或噪声预测目标进行学习。
- 速度场 (vθ):用于流匹配和连续归一化流(CNFs)。该场通过连续性方程定义确定性传输。在流匹配中,速度是通过对给定端点的条件路径导数 x˙t 进行回归来学习的。
3. 采样动力学
生成过程通过从 t=1 到 t=0 逆转传输来进行。
- 反向时间 SDE:一种源自时间反演理论的随机采样器,需要分数场。
- 概率流 ODE:一种确定性采样器,构造为与前向 SDE 共享相同的一时边缘分布。它诱导一个速度场 vPF(x,t)=f(x,t)−21g(t)2st(x)。
- 直接 ODE:在流匹配中,学习到的速度场直接定义了 ODE 采样器。
数学统一
本文使用测度论语言建立了形式等价性:
- 边缘等价性:概率流 ODE 和前向 SDE 诱导相同的一时边缘分布族 (μt),尽管它们诱导不同的路径测度(轨迹上的分布)。
- 目标等价性:DDPM 噪声预测损失、去噪分数匹配(DSM)和连续时间分数-SDE 目标被证明是加权分数回归问题。它们估计相同的统计对象(扰动边缘分布的分数),但在参数化(预测噪声与预测分数)和时间依赖加权方面有所不同。
- 流匹配最优性:条件流匹配损失(对端点条件路径导数进行回归)的总体最小化器是边际速度场 v∗(x,t)=E[x˙t∣xt=x,t],该场满足预设路径的连续性方程。
主要贡献
本文做出了四项主要贡献:
- 统一的传输视角:它在概率传输的共同框架内呈现了扩散、基于分数和流匹配方法,利用了 SDE/ODE 动力学及其相关的偏微分方程(Fokker–Planck 方程和连续性方程)。
- 采样器的等价映射:它阐明了反向时间 SDE 采样与确定性概率流 ODE 采样之间的关系。它指出,虽然它们共享相同的一时边缘分布(因此具有相同的目标分布),但它们在路径空间行为和数值特性(例如刚性、离散化误差)方面存在差异。
- 训练目标的统一视角:它将 DDPM 风格的损失、去噪分数匹配和连续时间分数-SDE 目标联系起来,视为加权分数回归问题。它进一步将这些目标与流匹配联系起来,将其视为预设概率路径下的速度回归,证明了众多“不同”的损失实际上是同一底层估计问题的重参数化。
- 理论与实践的桥梁:作者将近似、估计、离散化和路径失配效应组织为统一的误差分解。这一视角突出了路径设计、鲁棒性、条件约束和快速采样中的开放性问题。
结果与理论见解
本文未提出新的实验结果,而是综合了现有的理论结果以得出结构性结论:
- 分数与速度:分数参数化对于扩散的时间反演是自然的,而速度参数化对于确定性传输是自然的,并提供更直接的数值控制。
- 路径设计作为调节旋钮:概率路径的选择(扩散中的噪声调度,流匹配中的耦合/插值)是数值稳定性和采样效率的主要决定因素。“拉直”的路径(如整流流 Rectified Flow 中)可以减少刚性并允许粗略离散化。
- 误差来源:生成误差被分解为:
- 近似误差:神经网络表示真实场的能力。
- 估计误差:有限数据和优化限制。
- 离散化误差:求解 SDE/ODE 带来的数值偏差。
- 路径失配:训练路径与采样动力学之间的不一致性。
- 似然计算:概率流 ODE 通过瞬时变量变换公式实现似然计算,将扩散模型与基于似然的归一化流联系起来,尽管在实际应用中,由于分数近似和数值积分误差,这通常是近似的。
意义与主张
作者声称,由于这些领域的方法论收敛,即扩散、基于分数和基于流的方法之间的界限变得模糊,因此进行统一综述是及时的。这项工作的意义在于:
- 解决碎片化:它解决了文献中“符号碎片化和推导竞争”的问题,表明许多技术主要差异在于路径的选择、学习场(分数与速度)以及采样动力学(SDE 与 ODE)。
- 实际利害关系:它强调将方法视为学习动力学使得数值分析至关重要。离散化偏差、刚性和求解器选择会实质性影响样本质量和成本,特别是在逆问题中,条件约束可能会放大误差。
- 理论清晰度:通过采用测度论视角,本文区分了端点律的相等性、一时边缘分布的相等性以及路径测度的相等性。这防止了对形式相似性的过度解读(例如,承认 SDE 和 ODE 采样器共享边缘分布但不共享路径测度)。
- 未来方向:统一视角表明,开放性问题——如原则性的路径设计、耦合的学习 - 采样分析以及推广到非欧几里得或离散空间——是所有这些范式共同面临的挑战,而非特定方法的孤立问题。
本文结论认为,扩散、基于分数的模型和流匹配是概率传输的互补参数化。只要在一个共同的场、路径和求解器语言中进行分析,一个领域的进展(例如流匹配中的路径拉直)很可能为其他领域提供借鉴。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。