← 最新论文
🤖 machine learning

Why DDIM Hallucinates More than DDPM: A Theoretical Analysis of Reverse Dynamics

本文从理论上证明,DDIM 的确定性本质使其在混合高斯目标中陷入模式之间并产生幻觉,而 DDPM 的随机性则使其能够逃离这些区域,这一发现表明引入随机步骤可以提升 DDIM 的采样质量。

原作者: Muhammad H. Ashiq, Samanyu Arora, Abhinav N. Harish, Ishaan Kharbanda, Hung Yun Tseng, Grigorios G. Chrysos

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad H. Ashiq, Samanyu Arora, Abhinav N. Harish, Ishaan Kharbanda, Hung Yun Tseng, Grigorios G. Chrysos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《为何 DDIM 比 DDPM 产生更多幻觉:逆向动力学的理论分析》的解读,将其拆解为简单概念与类比。

全景:两种“去模糊”照片的方法

想象你有一张非常模糊且充满噪点的猫和狗的合照。你的目标是“逆转”这种模糊,得到一张清晰的猫或狗的照片。

在 AI 图像生成领域,有两种流行的方法(采样器)来实现这一目标:

  1. DDPM:一种在去模糊过程的每一步都添加微量“随机性”(噪声)的方法。这就像走一步,然后轻微晃动双手以调整平衡。
  2. DDIM:一种严格确定性的方法。它遵循一条完美、笔直的数学路径,没有任何晃动。这就像闭着眼睛走钢丝,完美地沿着预先计算好的线条前行。

问题所在:该论文发现,这种严格、完美的路径(DDIM)往往会导致“幻觉”。AI 生成的不是清晰的猫或清晰的狗,而是一个奇怪的、模糊的混合生物,一半是猫,一半是狗。这是因为 AI 陷入了两个选项之间的“中间地带”。

核心发现:“中间地带”陷阱

研究人员研究了当 AI 试图在两个截然不同的选项(例如数据分布中的两个不同模式)之间做出决定时会发生什么。他们使用高斯混合模型对此进行了建模,这仅仅是一种 fancy 的说法,意指“拥有两个 distinct 山峰(模式)以及它们之间一个山谷的地形”。

以下是这两种方法在接近过程末端时的表现:

1. DDIM 陷阱(走钢丝者)

想象 AI 正走在一座连接“猫山”和“狗山”的漫长狭窄桥梁上。

  • 旅程:当 AI 从嘈杂的起点向清晰的终点移动时,它很快找到了这座桥并沿着它行走。
  • 卡住点:当 AI 到达桥梁的正中间时,它卡住了。因为 DDIM 是确定性的(没有随机性),如果它正好落在中间,数学上表明它没有理由向左或向右移动。它就坐在那里不动。
  • 结果:最终生成的图像是“模式插值”——一个既不是猫也不是狗的幻觉生物,而是两者的奇怪混合。论文证明,一旦 DDIM 进入这个“中间邻域”,它往往缺乏能量逃离并回到真正的山峰。

2. DDPM 逃脱(醉汉行者)

现在,想象 DDPM 行者在同一座桥上。

  • 旅程:它同样找到了桥并沿着它行走。
  • 逃脱:当它到达中间时,它不会只是坐在那里。因为 DDPM 在每一步都添加微量的随机噪声,它会受到一点“踢”或“冲击”。
  • 结果:这种随机的冲击足以将行者从正中心点推离。一旦它被稍微向左或向右推了一下,“猫山”或“狗山”的自然引力就会接管,让它一路滚向清晰、正确的图像。这种随机性实际上帮助它避免了幻觉。

关键发现

该论文在剥离了复杂的数学后,提出了三个主要观点:

  1. 这与速度或错误无关:人们过去认为 DDIM 产生更多幻觉是因为它为了加快速度而跳过步骤(这会导致数值误差)。作者证明这是错误的。即使你让 DDIM 完美地执行每一步,它仍然比 DDPM 更频繁地卡在中间。问题在于缺乏噪声,而不是速度。
  2. “鞍点”:从数学上讲,桥梁的中间是一个“鞍点”。它是一个不稳定的平衡点。对于确定性系统(DDIM)来说,这是一个陷阱;而对于随机系统(DDPM)来说,噪声就像一张安全网,将你从陷阱中推离并导向真实的解决方案。
  3. 一个简单的修复方案:作者测试了一种混合方法。他们让 DDIM 在旅程的大部分时间里进行快速、干净的工作,但在即将结束(当 AI 接近中间)时,切换到 DDPM 进行几步操作,以添加关键的“随机踢”。这个简单的技巧显著减少了幻觉的数量。

结论

将图像生成想象成在一个有两个出口(猫和狗)的迷宫中导航。

  • DDIM 就像一个完美遵循地图的机器人。如果地图引导它走到迷宫中间的死胡同,它就会停在那里并制造一个虚假的出口(幻觉)。
  • DDPM 就像一个在迷宫中探索的人类。即使他们误入中间,他们也可能绊倒或迈出随机的一步,偶然地让他们走出死胡同并到达真正的出口。

该论文得出结论:需要一点混乱(噪声)来防止 AI 陷入“虚假”的中间地带解决方案。通过理解这一点,我们可以设计出更好的 AI 采样器,既保持 DDIM 的速度,又在最后阶段添加足够的随机性,以确保结果是真实的而非幻觉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →