← 最新论文
🤖 machine learning

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

本文介绍了 Off-Context GRPO (OC-GRPO),这是一种强化学习算法,它通过在训练期间利用特权引导来克服困难推理问题中的学习悬崖,同时使用重要性校正以确保模型针对原始未引导目标进行优化,从而在数学基准测试中取得了显著的性能提升。

原作者: Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正在接受训练,学习解决棘手的数学谜题,旁边有一位老师可以瞬间检查它给出的任何答案是正确还是错误。这种设置——一个学习者加上一个给出是非判定的自动裁判——就是 AI 研究人员所说的“Reinforcement Learning with Verifiable Rewards”。机器人尝试解决谜题,答对了获得一个“大拇指”,答错了则得到“大拇指朝下”,通过多次尝试,它学会了如何收集更多的“大拇指”。

问题在于,有些谜题对于机器人来说实在太难了,以至于每一次尝试都以失败告终。当每一次尝试都失败时,所有的判定结果都是完全一样的,没有任何可供比较的对象,老师也就失去了可以依据的信号。这就像是在学习骑自行车时,只要踏板一转就会摔倒:由于从未体会过什么是平衡,也就没有任何进步的基础。这被称为“学习悬崖(learning cliff)”。

显而易见的解决方法是提供一份“作弊纸”——即提示或解题过程的前几步,这样机器人至少能偶尔成功一次。这虽然可行,但提出了一个尴尬的问题:对于一个被“喂到嘴边”的胜利,机器人究竟应该获得多少功劳?

这篇论文对这个问题给出了妥当的回答。这种方法被称为 Off-Context GRPO (OC-GRPO),它应用了一种修正机制,通过询问:在没有作弊纸的情况下,机器人有多大的概率能达到那个精确的解。功劳永远不会被全额给予,因为其中一部分总是属于提示。最终能保留多少功劳,取决于机器人本身已经具备了多少能力。一个接近独立解决问题的机器人会保留大部分功劳,因为作弊纸只是激发了它已有的能力;而一个几乎毫无胜算的机器人则几乎得不到任何功劳,因为作弊纸是用提示替代了技能,而非揭示了技能。作弊纸无法凭空创造出原本并不存在的技能。错误的处理逻辑则相反:如果答案已经给出了一半,机器人却依然做错了,那么它受到的惩罚会比普通的失败更重,因为在有帮助的情况下失败,比在没有帮助的情况下失败是更严重的证据。在那些在没有辅助下成功率几乎为零的最难谜题中,大部分真正的学习来自于这种放大的惩罚,而非通过辅助性的成功。机器人被推离它目前明显还无法做到的领域,而不是因为学会了“阅读”而受到表扬。

结果是,尽管机器人在练习时得到了帮助,但它的评分始终是基于真实的谜题,而非带有提示的谜题。

在标准的数学基准测试中,OC-GRPO 将平均准确率从 27.8% 提升到了 31.7%,相比于标准训练方法实现了 13.8% 的相对增益,且几乎没有增加额外成本。这种修正对于较小的模型尤为重要:在这些模型中,旧有的基于提示的方法表现甚至不如纯粹的训练,因为较弱的学习者无法吸收提示谜题与无提示谜题之间的差异,而 OC-GRPO 在所有测试的模型规模上都保持了其增益。更广泛的启示是,特权提示(privileged hints)是引导探索的一种极好的方式,只是必须诚实地分配功劳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →