← 最新论文
🤖 machine learning

Understanding Diversity Collapse in RLVR via the Lens of Overtraining

本文将带有可验证奖励的强化学习(RLVR)中的“多样性崩溃”识别为一种使模型推理边界变窄的过拟合现象,并提出了“贝叶斯边界门控”(Bayesian Boundary Gating)以将优化方向重新引导至未解决的问题上,从而提升了在多种推理基准测试中高 kk 值下的 Pass@kk 性能。

原作者: Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心观点:通过“过度训练”的视角理解 RLVR 中的多样性崩溃

大局观:“一招鲜”问题

想象你正在训练一名学生(AI)解决数学题。你给他们一份练习卷,他们可以尝试无数次直到得到正确答案。

  • 目标: 你希望学生能够更好地解决从未见过的问题,并且希望他们即使在需要多次尝试时也能找到答案。
  • 问题: 这篇论文发现,虽然学生在第一次尝试就能做对(Pass@1)方面变得非常出色,但如果允许他们尝试多次(Pass@k),他们寻找答案的能力反而变差了。

作者们称之为**“多样性崩溃”(Diversity Collapse)**。这就像是学生停止了创造性思考。他们不再尝试五种不同的方法来解决一个问题,而是只是重复那一种已知有效的办法,一遍又一遍地重复。如果那一种办法失败了,他们就会放弃,尽管如果他们尝试其他路径,可能在第二次或第三次尝试时就能找到答案。

原因:“在错误的东西上过度训练”

为什么会发生这种情况?作者认为这是**过度训练(Overtraining)**的一个案例。

把它想象成一位教练,只有当球员进球时才会给予表扬。

  1. 设定: 教练(AI 训练系统)给球员出一个题目。球员尝试了 8 次(这被称为“rollouts”)。
  2. 陷阱: 如果球员在 8 次尝试中哪怕只有一次做对了,教练就会认为:“太棒了!这个问题已经解决了!”
  3. 错误: 教练不断告诉球员要专注于这个“已解决”的问题,强化这种特定的解题方式。球员不再尝试新的角度,而只是精进那一个特定的招式。

论文表明,在标准的 AI 训练中,AI 大部分用于训练的时间都浪费在了那些它至少已经成功解决过一次的问题上。 因为 AI 不断练习这些“容易”的胜利,它便忘记了如何探索新的路径。它成为了一个特定技巧的大师,却失去了保持灵活性的能力。

“推理边界”类比

作者引入了一个概念叫做**“推理边界”(Reasoning Boundary)**。想象一堵墙,代表了 AI 能够解决的所有范围。

  • Pass@1 就像是在问:“AI 能在第一次尝试时就解决这个问题吗?”
  • Pass@k (High-k) 就像是在问:“如果我们让 AI 尝试 256 次,它能找到解法吗?”

论文声称,标准训练会将这堵墙向内推。AI 在处理它已经掌握的具体问题时变得更强,但它停止了扩展这堵墙以包含它之前无法解决的问题。这就像一个园丁,不断给其中几朵花浇水,直到它们长得巨大无比,而花园的其他部分(那些未解决的新问题)却因为没有得到水分而枯萎了。

证据:并不是 AI 学不会

有一种普遍的看法是,性能下降意味着 AI 仅仅是无法学习新的推理技能。作者通过两个实验证明了这是错误的:

  1. 观察: 他们观察了 AI 在训练期间的表现。他们看到 AI 确实 学会了解一些在开始时无法解决的问题。然而,与此同时,它开始在以前能轻松解决的问题上失败。这种“收益”被“损失”掩盖了。
  2. 干预: 他们尝试了一个简单的修复方法:停止在 AI 已经解决的问题上进行训练。 他们告诉 AI:“如果你曾经做对过一次,就停止练习那个题。只练习那些你做错的题。”
    • 结果: 当他们这样做时,AI 解决难题的能力(Pass@256)实际上升到了初始水平之上。这证明了 AI 能够 学习新事物,但标准的训练方法通过让它过度练习简单的东西,无意中阻碍了它。

解决方案:“贝叶斯边界门控”(BBG)

为了解决这个问题,作者提出了一种新方法,称为贝叶斯边界门控(Bayesian Boundary Gating, BBG)

把 BBG 想象成一个聪明的过滤器,为教练提供指导。在教练决定练习哪些问题之前,BBG 会询问:

  • “这个问题已经解决了吗?如果是,跳过它。”
  • “这个问题完全没解决吗?如果是,重点关注它!”
  • “这个问题处于中间状态吗?也许给它一点关注。”

通过数学化地估算哪些问题仍有“增长空间”,BBG 将 AI 的精力从过度训练容易的胜利转向那些真正需要帮助的问题。

结果

当他们在几个困难的数学基准测试中测试这种新方法时:

  • 标准 AI: 在第一次尝试做对方面变得更好,但在允许多次尝试时,解决问题的能力却变差了。
  • BBG AI: 在第一次尝试做对方面变得更好,并且 维持(或提高)了在允许多次尝试时的解题能力。

总结

论文认为,AI 模型之所以变得“固步自封”,是因为它们被迫练习那些已经掌握的问题。这使得它们变得僵化且缺乏创造力。通过停止让 AI 练习它已经知道的东西,并只专注于它目前还不知道的东西,我们可以帮助它成为一个更全面、更有能力的解题者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →