← 最新论文
🤖 machine learning

Diffusion Models Preferentially Memorize Prototypical Examples or: Why Does My Diffusion Model Love Slop?

本文表明,扩散模型更倾向于记忆并过度生成由常见子字符串组成的典型示例,而非稀有或非典型样本,这暗示了更高抽象层面的数据集多样性对于防止记忆以及由此产生的生成输出中的“slop”(即低质量内容)至关重要。

原作者: Marta Aparicio Rodriguez, Anastasia Borovykh, Grigorios A. Pavliotis, Daniel J. Korchinski

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Marta Aparicio Rodriguez, Anastasia Borovykh, Grigorios A. Pavliotis, Daniel J. Korchinski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人厨师做一道新菜。你给了它一本厚厚的食谱(训练数据),里面充满了独特的菜谱。你的目标是让机器人学习烹饪的“原理”,这样它就能发明属于自己的美味佳肴,而不仅仅是逐页照抄书本。

然而,这篇论文发现这个机器人有一个奇怪的习惯:它并不会先记住那些奇特、独一无二的菜谱。相反,它会先记住“标准”的食材和常见的步骤。

以下是研究人员发现的详细拆解,使用了简单的类比:

1. 一个巨大的误解:“奇特的东西会先被记住”

你可能会认为,如果一个机器人要背诵你的书,它会先卡在那些最不寻常、最罕见或最困难的菜谱上,因为它们非常显眼。

  • 现实情况: 机器人实际上会先记住那些常见的内容。
  • 类比: 想象一个正在参加考试的学生。你可能认为他们会先在最难、最罕见的题目上卡壳。但这项研究表明,学生实际上会先记住那些最常见、最标准的题目。如果机器人看到食谱里有“盐和胡椒”(常见的),它会很快学会这种模式。如果它看到“火龙果和松露油”(罕见的),它需要更长的时间才能记住这种特定的组合。

2. “烂泥”阶段(The "Slop" Phase):当机器人变得平庸乏味

这篇论文中最有趣的部分是一个被称为**“烂泥”阶段(Slop phase)**的特定学习阶段。

  • 发生了什么: 在机器人开始完美复制整个菜谱之前,它会进入一个中间阶段。在这个阶段,它停止尝试创造力,开始过度使用它早期学到的最常见的食材。
  • 类比: 想象一位正在学习演奏爵士乐的音乐家。起初,他们演奏原创且复杂的独奏。然后,他们进入了一个“烂泥”阶段,不再即兴创作,而是反复演奏那几个简单、流行的音符。这并不是在模仿某首特定的歌,但它显得枯燥且重复,因为它只是在机械地复述那些“常见”的部分。
  • 结果: 如果你在机器人处于这个“烂泥”阶段时停止训练,它产生的内容会显得安全、平庸且乏味——这正是人们在网上常说的“AI 烂泥”(AI slop)。

3. “乐高”教训:先记住积木,再记住城堡

研究人员使用了一种特殊的合成数据,其运作方式就像乐高积木

  • 运作方式: 一张“图片”是由大积木(如一只猫)组成的,大积木由小积木(如耳朵、眼睛)组成,小积木又由微小的积木(如颜色、形状)组成。
  • 发现: 机器人会在记住整幅图画之前,先记住那些微小的、常见的积木(比如“橙色”或“圆形”)。
  • 危险之处: 即便你从训练数据中删除了重复的图片(使得每一张图像都是唯一的),机器人仍然会先记住这些图像中的“共同部分”。这意味着仅仅删除重复项并不能阻止机器人通过记忆构建模块来进行“作弊”。

4. 为什么“肥尾”(Fat Tails)有帮助(稀有性的长尾效应)

论文研究了某些事物非常普遍而另一些事物非常罕见的数据集(即“肥尾”分布)。

  • 发现: 如果你的数据集拥有大量的多样化、罕见的事物(一个长尾),机器人需要更长的时间才能开始进行记忆。
  • 类比: 如果你给机器人一个图书馆,其中 99% 的书是关于“猫”的,1% 是关于“外星猫”的,它会瞬间记住关于“猫”的书。但如果你给它一个图书馆,里面每一本书都是关于不同外星人的独特、怪异的故事,那么它需要更长的时间才会开始抄袭,因为它找不到可以依附的“共同”模式。
  • 教训: 多样性是一种护盾。你的数据越多样、越“古怪”,模型就越难陷入记忆并产生枯燥“烂泥”的陷阱。

5. 给创作者的启示

论文总结道,如果你想避免 AI 产生枯燥、重复的内容(“烂泥”),你必须谨慎对待何时停止训练模型。

  • 如果你停止得太早,模型可能正处于“烂泥”阶段,过度使用常见特征。
  • 如果你让它训练得太久,它就会开始记忆整个数据集。
  • 黄金窗口: 存在一个狭窄的窗口期,此时模型理解规则,但尚未开始过度依赖最常见的模式。

总结: 扩散模型(许多图像生成器背后的 AI)倾向于先记忆“平均水平”和“常见”的事物。这导致它们在最终开始复制特定实例之前,会经历一个产生平庸、重复内容的阶段。为了避免这种情况,你需要多样化的数据,并仔细把握停止训练的时机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →