← 最新论文
💻 computer science

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

本文揭示了 Fréchet Inception Distance (FID) 表现出主要由训练种子而非采样变异驱动的显著潜在随机性,从而建议在报告 FID 时应附带误差棒,并将较小的性能差距视为在统计上不具结论性的。

原作者: Nicolas Dufour, Alexei A. Efros, Patrick Pérez

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicolas Dufour, Alexei A. Efros, Patrick Pérez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位烹饪比赛的评委。每一位厨师(生成式人工智能模型)都会呈现一道菜肴,你会根据这道菜看起来有多美味以及吃起来的味道来给他们评分。在 AI 图像生成的领域中,这个分数被称为 FID(Fréchet Inception Distance)。分数越低,代表菜肴越好。

多年来,业界一直将这个分数视为一个完美的、不可改变的事实。如果厨师 A 的得分是 34.0,而厨师 B 的得分是 33.5,大家就会理所当然地认为厨师 B 绝对更胜一筹。

这篇名为 《FID 抽奖》(The FID Lottery) 的论文指出,这是一种危险的错觉。作者声称,你看到的得分不仅仅是衡量厨师技艺的标准,它同时也是一种运气的体现。

以下是他们利用简单的类比得出的研究结果:

1. 两场抽奖

作者说,每次 AI 生成图像时,都在进行两场不同的“抽奖”:

  • 训练抽奖(大奖): 在厨师开始烹饪之前,他们就已经对三件事掷了骰子:

    1. 食材: 数据是如何被洗牌和排序的。
    2. 储藏室设置: AI 的大脑(权重)在开始时的初始化方式。
    3. 烹饪过程: 在训练的每一步中,都会加入一种特定类型的“噪声”(随机静态噪声)。
    • 结果: 即使两位厨师遵循完全相同的食谱,那个在训练期间获得“幸运”骰子点数的人,最终做出的菜肴也会略有不同(且通常更好)。
  • 生成抽奖(小奖): 菜肴烹饪完成后,厨师需要进行摆盘。他们必须为最后的装饰品选择一个随机的起点。

    • 结果: 如果你要求同一位厨师对同一道菜进行 10 次摆盘,得分会略有波动,但变化不大。

重大发现: 作者发现,重新训练模型(再次进行“训练抽奖”)对得分的影响,是仅仅重新摆盘(进行“生成抽奖”)的 3.2 倍

2. “隐藏”的噪声底限

这篇论文揭示了这些分数存在一个“噪声底限”。

  • 想象这个分数是一个温度计。作者发现,仅仅因为运气,温度也会自然波动约 1% 到 2%,即便厨师什么都没做。
  • 问题所在: 最近许多 AI 论文声称通过微小的改进提升了分数(例如从 34.0 降到 33.8)。作者认为,如果改进幅度小于这 1%–2% 的“运气差距”,那么这种改进可能根本不是真正的进步。它可能只是因为那次掷出的骰子刚好对他们有利。

3. 规模并不总是意味着更好(关于运气)

你可能会认为,如果你建造一个更大、更强大的 AI(一个更大的厨房),运气因素就会消失。

  • 研究结果: 不会。无论 AI 是小还是巨大,“运气差距”都保持在大致相同的百分比(1%–2%)。
  • 类比: 这就像掷骰子。无论你掷一个骰子还是掷一千个骰子,随机性依然存在。扩大模型的规模并不会让骰子变得不再随机。

4. “金券”(运气之选)

作者发现,有些训练过程简直是极其幸运的。

  • 研究结果: 一个“幸运”的训练种子(一个幸运的开始)可以达到与“不幸运”的种子同样高质量的得分,但它能快上两倍
  • 启示: 如果一位研究人员声称他的新方法让训练速度提升了 2 倍,他可能只是将自己“不幸运”的旧方法与一次“幸运”的新运行进行了对比。他可能并没有真正改进代码;他只是运气好,掷中了幸运的骰子。

5. 调节引导(“秘密酱料”)

论文还研究了一个被称为“无分类器指导”(Classifier-Free Guidance, CFG)的设置,这就像是一个旋钮,告诉 AI 要多严格地遵循提示词。

  • 研究结果: 如果你为每一次训练运行都完美地调节这个旋钮,你可以将噪声差距缩小一半。
  • 代价: 这样做会改变排名。之前排名第 1 的“幸运”种子,在调节旋钮后可能会掉到第 5 名。这就像如果你为每一块蛋糕都调整了烤箱温度;那么在 350°F 时最好的那块蛋糕,在 360°F 时可能就不再是最好的了。

游戏的新规则

基于这些发现,作者建议了一种新的报告结果的方法,以便我们不再被运气所蒙蔽:

  1. 不要相信单一数字: 不要只报告一个分数。要根据使用不同种子的多次训练运行,报告一个“误差范围”(error bar)。
  2. 忽略微小的胜利: 如果一种新方法仅将分数提高了不到 ~1.3%,请将其视为“结论不足”。这很可能只是噪声。
  3. 调节旋钮: 如果你使用了引导(guidance),请为每次运行进行专门的调节,但要记住,这会改变哪些运行被视为“最佳”。

总而言之: 这篇论文告诉我们,在 AI 图像生成的世界里,运气扮演了巨大的角色。我们一直把随机波动误认为是科学突破。要了解一种新方法是否真的更好,我们需要进行多次实验,看看这种改进是否能在“运气抽奖”的噪声面前站得住脚。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →