← 最新论文
🤖 machine learning

On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

本文揭示了虽然通过采样演示进行同策略自蒸馏可以实现很强的 pass@1 准确率,但它会通过复合反馈放大现有的模型偏差,从而在无意中降低了输出多样性并使 pass@k 性能趋于平缓,最终限制了模型为分布外任务生成多样化策略的能力。

原作者: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这里是对这篇论文的解释,使用了简单的语言和富有创意的类比。

核心理念:“回声壁”效应

想象你正在尝试学习如何破解迷宫。你的老师其实只是一个比你稍微年长一点的版本。

在标准的学习设置中(称为强化学习RL),如果你找到了迷宫中的任何一条正确路径,老师都会说:“做得好!”并给你奖励。至于你走的是漫长蜿蜒的风景路线,还是短捷直接的高速公路,并不重要。只要你到达了出口,你就能得到同样的击掌鼓励。这会鼓励你去尝试许多不同的路径。

而在本论文研究的方法中,称为带有采样演示的自我蒸馏(SDSD),老师的工作方式则不同。在你开始之前,老师会挑选出一条你(或其他人)之前发现的特定正确路径,然后说:“好了,我希望你尝试解决迷宫的方式,要完全模仿这条特定的路径。”

论文指出,虽然这种方法能让你非常频繁地得到正确答案(高准确率),但它在暗中让你变得懒惰且重复。你停止了探索新路径,因为老师只在你模仿他们手中举着的特定路径时才会给予赞赏。

核心问题:“强者愈强”

作者发现了这种方法的一个隐藏代价:多样性的丧 way(Loss of Diversity)

把它想象成电台里的一首流行歌曲。

  • 标准 RL: 如果一首新歌很好听,DJ 就会播放它。如果另一首新歌也很好听,他们也会播放那首。你会听到各种各样的热门歌曲。
  • 自我蒸馏 (SDSD): DJ 挑选出那首已经在播放次数最多的歌。他们告诉乐队:“就照着那首歌来演奏。”
    • 如果乐队演奏的歌曲听起来哪怕只有一点点像那首热门歌曲,老师就会非常喜欢并给予强化。
    • 如果乐队演奏了一首完全不同(但同样正确)的歌曲,老师会感到困惑或热情不高,因为这与他们手中举着的“采样演示”不匹配。

久而久之,乐队不再演奏任何新东西。他们只演奏那首热门歌曲的变体。他们对那首特定的歌变得极其精通,但如果广播站要求换一种流派,他们就会失败。

论文的研究发现(证据)

研究人员在两个主要方面测试了这一点:

1. “图论迷宫”游戏
他们创建了一个游戏,AI 必须在由不同概念(如鸟类、水果或形状)组成的图中寻找路径。

  • 陷阱: 有些路径短且容易;有些路径长且难。
  • 结果: SDSD 模型非常迅速地找到了简单的路径,并获得了高分。然而,它们完全忽略了那些长且难的路径。
  • 失败之处: 当研究人员改变规则(让所有路径都变长)时,SDSD 模型崩溃了。它们已经习惯了依赖“简单路线”的习惯,无法适应变化。而 RL 模型由于练习过许多不同的路线,能够轻松应对新规则。

2. 科学问题
他们在科学问题(生物、化学、物理)上测试了模型。

  • 指标: 他们观察了 pass@k。这个问题是:“如果我们让 AI 生成 16 个不同的答案,其中有多少个是正确的?”
  • 发现: SDSD 模型在获得第一个答案(pass@1)方面表现出色。但当被要求生成 16 个答案时,几乎这 16 个答案都是同一个答案,只是写法略有不同。
  • 对比: RL 模型生成了 16 个不同且正确的答案。如果第一个错了,第 16 个可能就对了。SDSD 模型则没有提供任何备选方案。

为什么会这样?(“倾斜”的天平)

论文使用了一些复杂的数学来解释为什么,但这里是简单版本:

想象一个平衡不同解决方案的天平。

  • 标准 RL 将所有正确的解决方案视为平等。如果方案 A 和方案 B 都是正确的,天平保持平衡。
  • 自我蒸馏 倾斜了天平。它观察“演示”(示例路径)并询问:“方案 A 在多大程度上看起来像这个示例?”如果方案 A 看起来有点像示例,天平就会大幅向其倾斜。如果方案 B 看起来不同,天平就会向其相反方向倾斜。

因为 AI 不断地将自己的“热门”答案作为示例,它会进一步将天平向这些热门答案倾斜。那些“不受欢迎”但正确的答案被压制了。这被称为模式崩塌(Mode Collapse)——AI 坍缩到了单一的思维方式中。

“熵”的陷阱

论文还指出了一个棘手的测量问题。通常,科学家通过计算 AI 使用了多少种不同的词汇(Token 熵)来衡量“多样性”。

  • 论文发现,SDSD 模型可以仍然使用广泛的词汇(高词汇多样性),但在思维方式上仍然是完全相同的(低语义多样性)。
  • 这就像两个人在写论文。一个人写关于“猫”的,另一个人写关于“狗”的。他们使用的词汇不同,但如果两人的论点和结构完全一致,他们的思维其实并不具备多样性。SDSD 模型就是如此:它们通过变换词汇来掩盖其僵化的策略。

总结

论文得出结论,带有采样演示的自我蒸馏是一把双刃剑。

  • 优点: 它使模型在处理以前见过的题目时,在第一次尝试时获得正确答案的准确率非常高。
  • 缺点: 它破坏了模型进行创造性思考或尝试不同策略的能力。如果问题发生微调,或者第一次尝试失败了,模型将没有任何备选方案。

作者建议,如果我们想要 AI 具有鲁棒性和适应性,我们不能仅仅观察它获得正确答案的频率。我们必须检查它是否真的在尝试不同的方法,还是仅仅在一次又一次地重复同一个套路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →