← 最新论文
🤖 machine learning

Catastrophic Compositional Generation: Why Vanilla Diffusion Models Fail to Extrapolate

本文认为,在针对分布外分布进行目标设定时,原生条件扩散模型在组合生成方面存在根本性的失败,因为分数估计误差比推理时的近似误差更为致命,使得标准的修正技术难以奏效。

原作者: Duncan Soiffer, Chandler Squires, Yuan Guan, Jason Hartford, Pradeep Ravikumar

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Duncan Soiffer, Chandler Squires, Yuan Guan, Jason Hartford, Pradeep Ravikumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位大师级厨师,他精通制作三种特定的菜肴:清汤、仅含胡萝卜的汤,以及仅含芹菜的汤。你请这位厨师创造一种全新的菜肴:一种同时含有胡萝卜和芹菜、且不含其他食材的汤。

你可能会想:“这很简单!厨师了解胡萝卜,厨师了解芹菜,他也了解汤。他只需要把“胡萝卜知识”和“芹菜知识”混合在一起,就能做出这道新菜。”

这篇论文讨论的是一种特定类型的 AI(称为扩散模型),它就像这位厨师一样。研究人员发现,当你试图强迫这些 AI 去组合它们从未见过在一起的概念时,结果往往会变成一场灾难性的混乱。

以下是使用简单类比对他们发现的详细解读:

1. 目标:“组合式生成” (Compositional Generation)

目标是组合式生成。这是指 AI 将它分别学到的事物(比如“沙发”和“画作”)组合成某种新事物(比如“带有画作的房间里的沙发”)的能力,即使它在训练期间从未见过这种确切的组合。

把它想象成一套乐高积木。AI 已经分别造出了城堡和宇宙飞船。现在你想要它造一个“宇宙飞船城堡”。

2. “天真”的方法:混合指令

标准的 AI 模型尝试通过简单地将它们的内部“指令”(称为得分/scores)相加来解决这个问题。

  • 类比: 想象 AI 有一个 GPS。一个 GPS 说“左转去沙发”;另一个 GPS 说“右转去画作”。天真的方法就是直接把这两个 GPS 信号相加:“左转 + 右转”。
  • 问题: 在现实世界中,如果你试图通过平均两个冲突的方向来驾驶,你并不会到达一个新的目的地,而是会原地打转或发生车祸。论文表明,对于这些 AI 模型,仅仅相加指令是行不通的,因为当你尝试组合它们时,数学计算会变得非常混乱。

3. 让情况变得更糟的“修复方案”:费曼-卡茨修正器 (Feynman-Kac Corrector, FKC)

研究人员最近发明了一个高级工具,叫做费曼-卡茨修正器 (FKC)

  • 类比: 这就像雇佣了一位超级聪明的导航员,实时观察 GPS 信号并纠正驾驶员。导航员会说:“等等,GPS 在误导你,因为你现在处于一个奇怪的地段。让我来调整方向盘。”
  • 论文的发现: 作者发现,虽然这个导航员可以修复“天真”方法的数学错误,但它有一个致命缺陷。这个导航员只在“正常”的地段(即 AI 见过的数据)经过训练。当 AI 试图驶向一个“新”的地方(即沙发 + 画作的组合)时,导航员会感到困惑,因为它从未去过那里。
  • 结果: 这个导航员不仅没有修复汽车,反而根据错误的记忆开始对着驾驶员大喊大叫。你越是尝试使用这个“修复方案”(通过增加更多的“粒子”或导航员),车开得就越糟糕。它会彻底失控。

4. 两种类型的错误

论文识别出了 AI 失败的两个主要原因,它们的表现形式不同:

  • 错误 A:数学故障(推理时近似误差 / Inference-time Approximation Error)
    • 本质: AI 正在尝试进行一种它并未被教过的数学技巧。
    • 修复: 如果 AI 已经掌握了基础知识,那么“导航员”(FKC)其实非常擅长修复这种错误。
  • 错误 B:糟糕的记忆(得分估计误差 / Score Estimation Error)
    • 本质: AI 仅仅是因为不知道这种新组合看起来是什么样子的,因为它从未见过它。它在胡乱猜测。
    • 问题: 这是“灾难性”的部分。当 AI 处于“低密度”区域(一个它从未见过的领域)时,它的猜测是非常糟糕的。由于“导航员”(FKC)试图纠正数学问题,它最终反而放大了这些糟糕的猜测。这就像一个 GPS 试图纠正一个已经在森林里迷路的驾驶员;GPS 只会将他们引向更深的树丛。

5. “房间”实验

为了证明这一点,研究人员用房间的图像进行了一项测试。

  • 场景 1(简单): 他们要求 AI 组合一个沙发和一个画作。由于沙发在地上,而画作在墙上,它们几乎没有重叠。AI 可以做得还可以。
  • 场景 2(困难): 他们要求 AI 组合一个沙发和一个咖啡桌。两者都位于地面上。它们在争夺同一个空间。
  • 结果: 当 AI 尝试组合沙发和桌子(这是一个“困难”的组合)时,“导航员”(FKC)让图像变成了熔化、扭曲的噩梦。你越是试图“纠正”图像,图像就变得越扭曲。

核心结论

论文得出结论:标准的 AI 模型(原生扩散模型)无法仅仅通过“打补丁”来组合新概念。

如果你想让 AI 可靠地组合它从未见过的概念(比如“一个带有白色沙发和黑色椅子的客厅”),你不能仅仅在推理阶段微调数学。你必须从 AI 构建或训练的最开始阶段就改变它。目前的这些“修复方案”实际上会让问题变得更糟,当 AI 被要求想象一些真正新颖的东西时。

简而言之: 你不能仅仅通过给一只狗一对更好的翅膀来教它飞行;你必须改变这只狗的生物构造。同样,你不能仅仅通过添加一个纠正步骤,就让这些 AI 模型擅长组合新事物;这些模型本身需要一个不同的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →