← 最新论文
🤖 machine learning

Rollout-Level Advantage-Prioritized Experience Replay for GRPO

本文提出了一种名为 Rollout-Level Advantage-Prioritized Experience Replay 的方法,该方法通过根据优势幅度存储并优先处理单个 rollout,同时通过年龄驱逐和新鲜锚定组合来限制陈旧性,从而缓解了 GRPO 的样本效率低下问题,并在各种模型规模的数学基准测试中实现了显著的性能和效率提升。

原作者: Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名非常聪明的学生(一个人工智能)如何解决困难的数学问题。你给学生出一个题目,然后让他们尝试解答。有时他们答对了,有时又答错了。

在本文描述的标准方法(称为 GRPO)中,老师会观察学生做的 8 次尝试。如果学生答错了 7 次,只答对了 1 次,老师会说:“好,那一个正确的答案太棒了!让我们从中学习。”然后,老师会丢弃所有 8 次尝试,并要求学生立即尝试 8 个题目。旧的尝试再也不会被提及。

本文的作者认为这是一种浪费。在众多“错误”答案中的那一个“正确”答案其实是金矿,但它在仅仅看一眼之后就被丢弃了。

问题:“陈旧食物”问题

作者尝试了一个简单的想法:经验回放(Experience Replay)。这就像是在冰箱里存满过去的尝试,以便稍后让学生再次学习。

但这里有一个陷阱:学生学习的速度非常快。当你从冰箱(缓冲区)中取出一个旧的尝试让学生重新学习时,学生已经发生了巨大的变化,以至于那个旧的尝试已经不再适用了。这就像试图用一本为幼儿编写的教科书来教青少年;学生已经“漂移”离开了那个旧课时的语境。如果你强迫他们学习它,会让他们感到困惑并干扰他们的学习。

解决方案:一个聪明、新鲜优先的厨房

作者提出了一个包含三个主要规则的新系统来解决这个问题:

1. “新鲜锚点”(不要忘记当下)
与其将旧的尝试和新的尝试随机混合在一个大堆里,不如将最新的尝试单独保存,并始终将它们作为主要的教学内容。想象一位厨师总是用新鲜食材开始烹饪。然后,他们会在其中加入一些“加热过”的剩菜(旧的尝试)来增加额外的风味,但新鲜食材才是基础。这确保了学生始终在学习他们刚刚所做的事情,同时还能从过去获得额外收益。

2. “过期日期”(年龄驱逐)
为了阻止“陈旧食物”问题,他们为每一个尝试都设定了严格的过期日期。如果一个尝试比设定的步数(例如 10 天)还要旧,它会被立即丢弃。这保证了无论你的冰箱有多大,学生都不会去学习那些与现状无关的陈旧内容。

3. “明星学生”优先级(优势优先化)
并非所有的旧尝试都同样有用。作者意识到,最有价值的教训来自于那些“稀有”的尝试。

  • 类比: 想象一群 8 名学生在参加考试。7 人得了 D,1 人得了 A。那个“A”就是明星。
  • 旧方法: 有些系统将整个 8 次尝试视为一个整体。如果这一组尝试是混合在一起的,系统可能就不会再次选取它。
  • 新方法: 这个系统观察的是单个尝试。它看到了那一组“D”中的那个唯一的“A”,并说道:“这个特定的尝试是一个金矿!”它优先保存并重新学习那个特定的“A”,因为它教导的东西最多。它忽略了那些大家已经知道如何处理的无聊的“D”。

结果:大模型学得更好

团队在三种不同规模的 AI 模型(小、中、大)上使用数学谜题进行了测试。

  • 小模型: 看到了一点点进步。
  • 中型模型: 看到了一定的进步。
  • 大型模型: 看到了一次巨大的进步。

最大的模型在解决数学问题方面变得显著更好(平均准确率提高了约 4.35%),并且效率更高。它学会了在不浪费时间或生成不必要文本的情况下提高准确性。

为什么这很重要

本文表明,通过更聪明地决定保留哪些旧教训、保留多久,以及如何将它们与新教训混合,你可以让 AI 的推理能力变得更强。这不仅仅是关于更努力地工作,更是关于更聪明地工作——通过回收过去最精彩的时刻,而不让它们干扰现在。

简而言之: 他们为 AI 训练构建了一个聪明的“时间胶囊”,保留了最好的、最近的以及最独特的教训,确保 AI 能从其高光时刻中学习,而不会被旧的错误所困扰。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →