← 最新论文
🤖 machine learning

XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation

XRPO 是一个统一框架,通过引入用于定向探索的自适应 rollout 分配器和用于提升利用效果的 novelty 感知优势锐化机制,增强了基于 GRPO 的大语言模型强化学习,从而在数学和编程基准测试中实现了更优越的性能和更快的收敛速度。

原作者: Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一位非常聪明但固执的学生(人工智能)如何解决高难度的数学问题或编写复杂的代码。传统的教导方式就像给这位学生做一份选择题试卷,要求他们对每一道题都尝试猜测 16 次。如果猜对了,就得到一颗金星;如果猜错了,就一无所获。

问题在于,这种方法效率低下。学生在他们已经掌握的题目上反复以同样的方式猜测,浪费了时间。与此同时,对于那些让他们屡屡得不到金星、极其困难的问题,他们干脆放弃,不再尝试学习,因为他们从未获得任何反馈。

XRPO 是一种全新的教学框架,旨在解决这一问题。它就像一位超级聪明的导师,会根据学生在当下那一刻的具体需求来调整策略。其运作方式可拆解为三个简单的技巧:

1. “智能下注”策略(针对性探索)

在旧方法中,无论题目是简单还是困难,学生都被迫对每一道题尝试猜测 16 次。

  • XRPO 的改进:导师审视题目并问道:“学生在哪里最困惑?”
    • 如果一道题很棘手,且学生的答案五花八门(不确定性高),导师会说:“好吧,让我们对这一道题尝试 20 次猜测!”因为学习就发生在这里。
    • 如果学生已经擅长某道题,导师会说:“很好,只需猜测一次就足够了。”
    • 类比:这就像一位赌徒,停止在他知道是公平的硬币投掷上下注,而是将所有赌注押在最有可能改变局势的骰子投掷上。这节省了时间,并将精力集中在最重要的地方。

2. “带提示的作弊”技巧(上下文学习种子)

有时,学生遇到一道极其困难的问题,导致他们每次都得不到金星。在旧系统中,学生只会盯着空白页面发呆,感到沮丧,而老师也束手无策,因为学生从未产生过可供学习的“正确”答案。

  • XRPO 的改进:导师悄悄在学生手中塞入一张“作弊条”。这并非当前问题的答案,而是学生过去曾正确解决过的一个相似问题。
    • 类比:想象你被一道谜题难住了。与其盯着它发呆,不如有人递给你一张你昨天解开的类似谜题的图片。突然间,你恍然大悟:“哦!我用了同样的技巧!”这能将学生从“卡住”的状态中唤醒,帮助他们突破之前无法逾越的障碍。

3. “奖励创造力”奖金(新颖性强化)

在旧系统中,如果学生答对了,就能得到一颗金星。无论他们是用枯燥、标准的方式解决,还是用巧妙、独特的方式解决,结果都一样。这导致所有学生的答案看起来千篇一律,他们不再尝试发挥创造力。

  • XRPO 的改进:导师审视正确答案并说:“你答对了,但你用了一种非常不寻常的方式!这令人印象深刻。”
    • 类比:想象一场烹饪比赛。如果每个人都做出了完美的汉堡,他们都会得到相同的分数。但 XRPO 会给那个用一种自己发明的、秘密且稀有的香料做出完美汉堡的人额外加分。这鼓励学生去探索新的、富有创造力的路径,而不仅仅是复制最常见的解决方案。

成果

当研究人员将这位新“导师”(XRPO)与旧方法进行测试对比时:

  • 学习更快:学生达到同等技能水平所需的时间不到原来的一半(速度快了 2.7 倍)。
  • 变得更聪明:学生正确解决的问题更多,尤其是那些曾经让他们束手无策的难题。
  • 效率更高:学生不再浪费时间撰写冗长、啰嗦的答案;他们学会了简洁明了。

简而言之,XRPO 阻止了人工智能盲目猜测,开始将其视为人类学习者:专注于困难部分,在卡壳时给予提示,并奖励巧妙的思维。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →