← 最新论文
🤖 machine learning

Leveraging Error Diversity in Group Rollouts for Reinforcement Learning

本文介绍了误差多样性优势塑造(EDAS),这是一种轻量级的后处理技术,通过基于组内误差多样性调节优势信号来增强可验证奖励强化学习(RLVR),在惩罚重复失败的同时鼓励探索性推理,从而在多个基准测试中带来一致的性能提升。

原作者: Wenpu Liu, Yuqi Xu, Weichu Xie, Yongfu Zhu, Shuai Dong, Ziyue Wang, Wenqi Shao, Xiaoying Zhang, Tong Yang, Nan Duan, Jiaqi Wang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenpu Liu, Yuqi Xu, Weichu Xie, Yongfu Zhu, Shuai Dong, Ziyue Wang, Wenqi Shao, Xiaoying Zhang, Tong Yang, Nan Duan, Jiaqi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生解决一道非常困难的数学题。你要求他们连续尝试解题 10 次。

在旧有的做法(标准强化学习)中,如果学生答错了,你只会说:“错了,再试一次。”无论他们是如何错的,你对每一个错误都一视同仁。

但本文的作者发现了一个有趣的现象:并非所有错误都是等同的。

重大发现:“错误派对”与“坏唱片”

研究人员观察了针对同一问题的 10 次尝试组,发现了两种截然不同的情景:

  1. 坏唱片(同质化错误): 学生尝试了 10 次,每一次都犯了完全相同的错误。也许他们每次都忘记进位,或者都以同样的方式误读了题目。
    • 结果: 学生陷入了僵局。他们不断撞在同一堵墙上,因为并没有探索新的失败方式,所以学不到多少东西。
  2. 错误派对(多样化错误): 学生尝试了 10 次,却以 10 种不同的方式失败了。有一次他们漏掉了一个步骤,另一次他们用了错误的公式,还有一次他们犯了计算错误。
    • 结果: 这是学习的金矿!因为学生尝试了如此多不同的路径,即使是错误的路径,教师(AI 训练系统)也能确切地看到逻辑在哪里崩溃,从而更好地指导学生。

本文的主要观点: 如果一组尝试包含多种不同的错误答案,AI 的学习速度会快得多。如果每个人都犯同样的错误,学习就会停滞。

解决方案:EDAS(“智能教练”)

为了解决这个问题,作者创造了一种名为**错误多样性优势塑造(Error Diversity Advantage Shaping, EDAS)*的新技术。你可以把 EDAS 想象成一位超级聪明的教练,他观察学生的 10 次尝试,并根据错误的多样性*来调整反馈。

以下是 EDAS 的工作原理,使用一个简单的类比:

  • “坏唱片”惩罚: 如果学生连续 10 次犯相同的错误(就像一张坏唱片),EDAS 会说:“好吧,你陷入了循环。我们需要对此进行严厉惩罚,以迫使你跳出这个循环。”它会对那个特定的重复错误给予巨大的“负分”,从而将学生推离该错误。
  • “错误派对”奖励: 如果学生犯了 10 种不同类型的错误,EDAS 会说:“太棒了!你正在探索。虽然你答错了,但你尝试了新事物。”它会减轻对这些罕见、独特错误的惩罚。它告诉学生:“不要过于担心这个特定的罕见错误;继续尝试新事物。”

为什么这很重要

该论文在两项非常困难的任务上测试了这种方法:数学竞赛(如 AIME 和 AMC)和编程(编写计算机程序)。

他们使用了一个流行的 AI 模型(Qwen3),并将旧的训练方法与新的 EDAS 方法进行了比较。

  • 在数学方面: EDAS 方法帮助 AI 解决了更多高难度的问题。平均而言,它在 100 分的量表上将 AI 的分数提高了约6 分,这在数学领域是一个巨大的飞跃。
  • 在编程方面: 它也有助于 AI 编写更好的代码,特别是在那些 AI 通常陷入相同错误循环的棘手问题上。

“秘密武器”

这篇论文最酷的部分在于,EDAS 不需要从根本上改变 AI 的思考或学习方式。它就像一种赛后调整

想象一支运动队正在比赛。教练并没有改变球员的肌肉或比赛规则。相反,在比赛结束后,教练查看统计数据并说:“嘿,你们一直在犯同样的防守错误,所以我们要特别重点攻克这一点。但你们尝试了一些新的进攻战术虽然失败了,但我们要为你们的勇敢给予一点肯定。”

这种简单的调整使 AI 能够停止陷入重复相同错误的“愚蠢循环”,转而鼓励它尝试不同的路径,直到找到正确答案。

总结

  • 问题: AI 经常陷入不断重复完全相同错误的困境。
  • 洞察: 包含不同类型错误的一组尝试,比所有人都犯相同错误的一组尝试更有助于学习。
  • 对策: EDAS 是一种工具,它严厉惩罚重复的错误,但奖励(或至少不那么严厉地惩罚)独特、罕见的错误。
  • 结果: 通过在成功之前探索更多样化的失败方式,AI 学习得更快,能解决更难的数学问题,并编写出更好的代码。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →