← 最新论文
🤖 machine learning

GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number: The Group-Standard-Deviation Identity

本文揭示了 GRPO、Dr. GRPO 和 DAPO 并非三种不同的方法,而是同一个底层机制的三种特定配置:即二元奖励(binary rewards)的组标准差,它决定了训练更新的幅度,并决定了哪些问题能有效地对学习做出贡献。

原作者: Yong Yi Bay, Kathleen A. Yearick

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yong Yi Bay, Kathleen A. Yearick

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一名学生解决一道难题。你不是只问他一次,而是让他连续尝试八次

  • 如果他八次全错,你无法有效地教他,因为你还不清楚对他而言“正确”的答案是什么样子的。
  • 如果他八次全对,你也无法教他太多,因为他已经掌握了;这里没有通过挣扎而产生的学习空间。
  • 但如果他四对四错,那就是最完美的切入点。你可以指着对的部分说:“这样做,”指着错的部分说:“别那样做。”这种尝试之间的**分歧(disagreement)**正是创造学习信号的关键。

这篇论文题为《GRPO、Dr. GRPO 与 DAPO 是同一个数字的三种运算》,它论证了三种流行的 AI 训练方法实际上都是在处理这种特定的“分歧时刻”。

以下是使用简单类比进行的拆解:

“神奇数字”:标准差

论文关注的是从那八次尝试中计算出的一个特定数值:标准差

  • 你可以把这个数字看作是一个**“困惑度计(Confusion Meter)”**。
  • 如果学生 8/8 全对或 0/8 全错,计数值为。此时没有困惑,因此也就没有学习信号。
  • 如果学生 4/8 对,计数值达到最大值。学生感到困惑,而这种困惑正是学习发生的地方。

论文证明,对于二元奖励(对/错)而言,这个“困惑度计”不仅仅是一个辅助工具;它本身就是课程的大小。

三种方法:调节旋钮的三种方式

论文表明,三种著名的 AI 训练方法只是同一个旋钮上的三种不同设置:

  1. GRPO(放大器):

    • 它在做什么: 它将课程内容除以“困惑度计”。
    • 类比: 想象一位老师说:“如果你很困惑(计数值高),我会大声地传达教导,确保你能听到。如果你不困惑(计数值低),我会轻声细语。”
    • 结果: 这种方法极度偏向于最难和最容易的问题(即计数值高的题目),而忽略了那些“恰到好处”的问题。它创造了一种“难度偏差”,迫使 AI 密集地关注极端情况。
  2. Dr. GRPO(平滑器):

    • 它在做什么:取消了除法操作。它完全忽略了“困惑度计”。
    • 类比: 这位老师说:“无论你有多困惑,我都会以完全相同的音量传达教导。”
    • 结果: AI 根据纯粹的成功率进行学习。它对待一个 50/50 的猜测和一个 90% 成功率的情况时,每单位进步所赋予的权重是相等的。它消除了第一种方法的“难度偏差”。
  3. DAPO(过滤器):

    • 它在做什么: 它观察“困惑度计”。如果计数值为(所有人全对或所有人全错),它会丢弃该组数据并要求学生重新尝试。
    • 类比: 这位老师说:“如果你所有的答案都对或者都错,我不会在这上面浪费时间评分。我会让你尝试一组新的问题,直到你表现出一些困惑为止。”
    • 结果: 它通过忽略那些无法提供教学信息的“沉默”组别,从而节省了计算资源。

重大发现:一个旋钮,三种设置

论文的核心观点是,这些并不是三种不同的发明。它们只是对同一个数字(即该组答案的标准差)进行的三种不同运算:

  • GRPO 对其进行除法。
  • Dr. GRPO 忽略它。
  • DAPO 过滤掉零值。

为什么这很重要(“组大小”法则)

论文还给出了一个关于你应该让学生尝试多少次(即“组大小/Group Size”)的实用规则。

  • 规则: 题目越难,你就需要让学生尝试的次数越多。
  • 类比: 如果一个问题是“抛硬币”(50% 的成功率),问 8 次通常就足够获得一次好的教导。但如果一个问题非常难(只有 5% 的成功率),问 8 次可能会导致 8 次全错,从而产生一个“沉默组”。你可能需要问 70 次,才能仅仅为了得到一个能让学生既有对也有错的组别,从而让你能够进行教学。

总结

这篇论文通过以下方式揭示了复杂的 AI 训练:

  1. 学习是通过分歧实现的。 如果一个 AI 组的所有成员达成了一致(全对或全错),他们就学不到任何东西。
  2. “困惑度计”就是课程本身。 分歧的程度决定了学习信号的强度。
  3. 这三种方法只是使用该计数的不同方式。 一种进行放大,一种忽略它,另一种则跳过计数值失效的组别。

作者在海量数学题数据集和受控计算机模拟中测试了这些结论,证明了这些公式能够完美预测 AI 的学习程度以及取得成功所需的尝试次数。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →