When Are Two Scores Better Than One? Investigating Ensembles of Diffusion Models
本文研究了无条件分数扩散模型的集成,并发现虽然聚合分数可以提高似然值和分数匹配损失,但无法一致地提升 FID 等感知图像质量指标,作者通过各种聚合策略、表格数据对比以及对模型组合的理论见解,对这一差异进行了探讨。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:委员会真的比天才更出色吗?
想象一下,你正试图创作一幅杰作。你拥有一位才华横溢的艺术家(单个 AI 模型),他已经通过多年的学习掌握了绘画技巧。现在,假设你召集了一个由五位同样优秀的艺术家组成的委员会。在许多科学领域,有一个旧规则是:“委员会总是比个人更出色。”如果一位艺术家犯了错,其他人可以进行纠正。如果你取他们的平均意见,你应该能得到一个完美的结果。
这篇论文探讨的是:这个规则对 AI 图像生成器(扩散模型)也适用吗?
简短的回答是:出人意料地,并不适用。 事实上,有时候委员会做出的画作甚至比那位最优秀的艺术家还要糟糕。
这些 AI 画家是如何工作的(“去噪”游戏)
要理解为什么委员会失败了,你需要了解这些 AI 画家是如何工作的。它们并不是从零开始绘画,而是从一张布满静态噪声(就像电视雪花一样)的画布开始,然后慢慢“清理”它,从而显现出一幅图像。
- 分数(Score): 在清理过程中的每一个微小步骤,AI 都必须猜测:“为了让这个像素看起来更像一张真实的脸,我应该向哪个方向移动这个像素?”这个猜测被称为分数。
- 过程: AI 会进行成千上万次这样的微小猜测,通过一步步移动像素,将图像从噪声转化为清晰的图像。
实验: “委员会”方法
研究人员尝试构建一个“集成”(Ensemble,即委员会)。他们分别训练了五位不同的 AI 画家。然后,在清理过程的每一个步骤中,他们都会询问这五位画家关于像素移动方向的建议。
他们尝试了不同的结合建议的方式:
- 算术平均值(The Arithmetic Mean): 他们取五个人猜测的平均值。(就像询问五个人方向,然后走平均距离)。
- 主导特征(The Dominant Feature): 他们只听从那个叫得最响亮的画家(即对于每个特定像素,其猜测幅度最大的画家)的意见。
- 专家混合(A Mixture of Experts): 他们随机选择一位画家,并让这位画家完成整个创作过程。
结果:当两个(或五个)不如一个时
以下是研究结果,按发生的情况分类如下:
1. “数学”变好了,但“艺术”变差了
当研究人员观察数学指标(训练损失)时,委员会的表现非常出色。五位画家的平均猜测在数学上比任何单个画家的猜测都更接近“完美”答案。
- 类比: 想象五个人在猜一个南瓜的重量。如果你取他们猜测的平均值,你可能会得到精确的重量。
- 问题所在: 在 AI 图像生成中,数学上的“正确”并不总是意味着图像看起来好看。委员会的平均猜测在数学上很精确,但生成的图像却变得模糊、浑浊或看起来很奇怪。相比之下,那位最优秀的艺术家生成的照片反而更清晰、更写实。
2. “模糊委员会”效应
当你平均五个不同的意见时,你往往会得到一个“安全”的中庸之道。
- 类比: 想象五位厨师在做汤。厨师 A 想让汤很咸,厨师 B 想让汤很辣,厨师 C 想让汤很甜。如果你把这五份汤混合在一起,你得到的不是一碗“完美的”汤,而是一碗平淡、混乱且味道模糊的废料。
- 论文的发现: 通过对“分数”(即移动像素的方向)进行平均,委员会抹平了那些让图像看起来真实、锐利的创造性细节。结果往往比只使用其中一位最优秀的厨师还要差。
3. 唯一的例外:“随机挑选者”
有一种策略的效果稍好一些:专家混合(Mixture of Experts)。
研究人员并没有采取平均意见的做法,而是从开始时随机挑选一位画家,并让其完成整个工作。
- 为什么有效: 这并没有创造传统意义上的“委员会”。它只是意味着在处理许多不同的图像时,你可以看到不同画家的独特风格。它没有将图像模糊化,只是增加了多样性。
4. 表格数据的惊喜(“森林”类比)
研究人员还在表格数据(非图像的数字表格)上使用 随机森林(一种由决策树组成的 AI 类型)进行了测试。
- 发现: 在这里,“主导特征”策略(听从那个叫得最响亮的树)效果非常好。
- 原因: 在表格数据的世界里,“平均”猜测往往会低估噪声(显得太安静了)。而“最响亮”的猜测反而更准确。这与图像生成中的情况正好相反——在图像中,那些“最响亮”或“平均化”的猜测破坏了画面。
理性的“顿悟时刻”
论文通过一个被称为**非交换性(Non-Commutativity)**的巧妙数学概念解释了为什么会发生这种情况。
- 概念: 在数学中,运算的顺序有时是至关重要的(例如,“先穿袜子,再穿鞋”与“先穿鞋,再穿袜子”是完全不同的)。
- 论文的洞察: 研究人员证明了添加噪声和**结合意见(平均化)**这两者之间无法很好地协同工作。
- 如果你取五张完美的图片,给它们加上噪声,然后再进行平均,你会得到一团模糊的混沌。
- 如果你在添加噪声的过程中对“规则”(分数)进行平均,你并不是在创造一个“超级模型”,你只是在创建一个遵循另一套略显破碎的规则的模型。
- 类比: 想象五个人试图牵着一只狗走。如果他们每个人都向稍微不同的方向拉绳子,狗并不会朝着一个“完美的平均方向”行走,而是会感到困惑并在原地转圈。
结论:我们该怎么做?
该论文得出结论,对于图像生成而言:
- 不要只是简单地平均模型: 仅仅训练五个模型并平均它们的猜测是在浪费计算资源。这通常不会让图像变得更好,反而往往会让图像变差。
- 专注于单个最好的模型: 将额外的计算能力用于训练一个真正优秀的模型,比训练五个平庸的模型并取其平均值要明智得多。
- “分数”并不等于“图像”: 仅仅因为一个 AI 在数学问题(预测分数)上表现得更好,并不意味着它在艺术问题(制作精美的图像)上也会做得更好。
简而言之: 在 AI 图像生成的领域,一个由五位艺术家组成的委员会往往会产生一团模糊的混沌,而一位天才艺术家则能创造出一件杰作。有时候,一个确实比多个更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。