A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models
本教程通过从微分方程推导扩散模型的前向与反向动力学,展示了标准训练目标与得分匹配之间的等价性,并阐明了包括 DDPM、DDIM 和引导生成在内的各种采样方法之间的理论联系,从而为扩散模型提供了一个统一的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一张精美的高分辨率猫咪照片。现在,想象慢慢调高老式电视机的噪点,直到那张照片完全淹没在一片白噪声的海洋中。这就是前向过程。
现在,想象你有一位超级聪明的侦探,他能盯着那片噪点说:“如果我从这个特定位置移除一点点噪声,猫咪的耳朵就会开始显露出来。”如果这位侦探能一步步、反复地做到这一点,他就能将噪点还原成一张清晰的猫咪照片。这就是反向过程,也是扩散模型生成图像的方式。
由 Fu Jiayi 和 Wang Yuxia 撰写的这篇论文,本质上是一份用微分方程(描述事物随时间变化的数学)语言编写的“用户手册”。它将科学家们研究这些模型的多种不同思路,统一成了一个连贯宏大的故事。
以下是他们故事的拆解,使用了简单的类比:
1. 描述旅程的两种方式(ODE 与 SDE)
论文开篇指出,将清晰图像转化为噪声(以及反之)的过程,可以用两种不同的数学语言来描述:
- 随机路径(SDE): 想象一位徒步者穿过迷雾森林。他有一张地图(指示他应该去的方向),但风(随机噪声)不断将他吹得稍微偏离轨道。每一步都是计划方向与随机阵风的混合。这就是随机微分方程(SDE)。
- 确定性路径(ODE): 现在,想象同一位徒步者,但这次风是完全可预测的,或者他正走在一条巨大的、平滑的传送带上,将他精确地运送到目的地,没有任何随机性。这就是常微分方程(ODE)。
核心洞见: 论文证明,尽管这两条路径看起来不同(一条颠簸,一条平滑),但它们都从同一个起点(清晰图像)出发,并到达同一个终点(纯噪声)。更重要的是,在任何给定时刻,它们都遵循完全相同的“密度图”。你可以在颠簸路径和平滑路径之间切换,而不会改变最终结果。
2. “分数”(侦探的直觉)
侦探如何知道该往哪个方向走?他们使用一种称为**分数(Score)**的东西。
在数学中,“分数”只是概率的梯度。用通俗的话说,可以把它想象成坡度。
- 如果你站在山上,坡度会告诉你哪边是“上”(数据所在的方向),哪边是“下”(噪声所在的方向)。
- 模型的任务就是学习这个坡度。它学会观察一张噪点图像,并指出:“‘上坡’方向(朝向真实图像)是这个方向。”
论文表明,我们训练这些模型的标准方法(要求它们猜测被添加的噪声),在数学上等同于要求它们学习这个“坡度”或分数。这就像教学生解数学题时,不是直接教公式,而是让他们去寻找答案。论文证明,这两种教学方法实际上是同一回事。
3. 训练:学习去噪
论文解释说,我们不需要直接教模型复杂的“坡度”数学。相反,我们只需给它一张噪点图片,然后问:“我们添加的噪声是什么?”
- 如果模型能完美预测出噪声,它也就自动学会了坡度。
- 一旦它知道了坡度,就可以逆转这个过程:从纯噪声开始,沿着“上坡”行走,创造出新的、逼真的图像。
4. 不同的“行走者”(DDPM、DDIM、DPM-Solver)
论文统一了人们用于生成图像的几种著名算法。它解释说,它们都只是沿着那个“坡度”采取步骤的不同方式:
- DDPM(谨慎的徒步者): 这种方法采取小心的小步。它在每一步都添加一点点随机性(就像 SDE 那样)。它很准确,但很慢。
- DDIM(平滑的滑行者): 这种方法忽略随机的风,只沿着平滑的传送带(即 ODE)行进。因为它不浪费时间去应对随机阵风,所以速度快得多,但这需要一张非常精准的地图(一个训练良好的模型)。
- DPM-Solver(特快电梯): 这是一种新颖的方法,利用数学技巧在山坡上迈出巨大而高效的步伐,而不是小步。它能以创纪录的速度到达山顶(最终图像)。
论文表明,DDPM 本质上是颠簸路径(SDE)的离散版本,而 DDIM 是平滑路径(ODE)的离散版本。它们是同一枚硬币的两面。
5. 引导过程(分类器引导)
有时你不仅仅想要一只猫,你想要一只黑猫。如何引导这位侦探?
- 分类器引导(Classifier Guidance): 你请来第二位专家(一个分类器),他大喊:“更黑一点!少白一点!”侦探同时听取图像坡度和专家的喊声,调整路径以生成一只黑猫。
- 无分类器引导(Classifier-Free Guidance): 与其聘请第二位专家,不如训练这位主要侦探能够说出“我不知道你想要什么”(无条件)和“我知道你想要一只黑猫”(有条件)。在生成过程中,你混合这两个答案来引导结果。论文解释了这种“混合”为何如此有效的数学原理。
6. 大统一:流匹配(Flow Matching)
最后,论文将扩散模型与一个较新的领域**流匹配(Flow Matching)**联系起来。
- 流匹配就像从噪声云到数据云画一条直线。
- 扩散则像一条蜿蜒的河流路径。
论文证明,尽管它们看起来不同,但如果以相同的方式训练它们(预测噪声/分数),它们最终描述的是完全相同的旅程。“噪声预测”损失函数实际上是伪装成“流匹配”损失函数。这就像意识到,无论你开车还是骑自行车,只要遵循相同的 GPS 坐标,你最终都会到达同一个目的地。
总结
这篇论文是一座桥梁。它将不同扩散算法(DDPM、DDIM、流匹配)那混乱复杂的领域联系起来,表明它们都只是求解同一个微分方程的不同方式。
- 前向: 将数据转化为噪声(容易)。
- 反向: 将噪声转化为数据(困难)。
- 秘密: 通过猜测噪声来学习“坡度”(分数)。
- 结果: 无论你是拄着拐杖颠簸行走(SDE),还是在平滑轨道上滑行(ODE),只要遵循坡度,你就能生成美丽的图像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。