ReCo: Reweighting GRPO Against Distributional Concentration
该论文介绍了 ReCo,这是一种通过归一化响应贡献并以基于方差的缩放取代重要性比例,来缓解 GRPO 倾向于集中在高概率响应和标记上的重加权方法,从而在不牺牲小 k 准确性的情况下,提高了数学推理基准测试中的 Pass@k 性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机不再仅仅是聊天,而是能够通过复杂的谜题(如数学问题或编程挑战)进行真正的“思考”。这是人工智能的前沿领域,特别是一个被称为“强化学习”的领域。把它想象成训练一只狗:你不仅仅是告诉狗该做什么;你让它去尝试,如果它坐下了,你就给它一个奖励。如果它跳上了沙发,你就不给。随着时间的推移,狗学会了坐下,因为它想要那个奖励。在人工智能的世界里,当计算机正确解决问题时,我们会给予它一个“奖励”。
训练这些 AI“小狗”的一种流行方法叫做“群体相对策略优化”(Group Relative Policy Optimization,简称 GRPO)。想象一下,你要求 AI 解决十次同一个数学问题。它会生成十个不同的答案。GRPO 会观察这十个答案,看看哪些得到了“奖励”(即正确的),并引导 AI 向那些成功的答案靠拢。这是一个聪明的技巧,它让 AI 在解决问题方面变得更加出色。但问题在于:有时,由于过于渴望得到奖励,AI 会变得过于自信,从而停止尝试新事物。它开始反复重复那几种固定的套路,忽略了其他同样有效且更巧妙的解题方法。
这正是首尔大学的一个研究小组决定解决的难题。他们注意到,虽然 GRPO 能让 AI 更快地解决问题,但它实际上会让 AI 变得缺乏创造力,并且在给予多次尝试机会时,找到正确答案的可能性反而降低了。他们将这个问题称为“分布集中化”(distributional concentration)——这是一个高级术语,意思就是 AI 陷入了思维定式,只敢探索那些它已知安全的路径。
为了解决这个问题,该团队发明了一种名为 ReCo(针对分布集中化的重加权 GRPO)的新方法。以下是它的工作原理,使用一个简单的类比:
想象你是一位正在给班级学生评分的老师,这些学生都在尝试解决同一个棘手的数学问题。
- 旧方法 (GRPO): 你让全班同学写下他们的答案。如果五个学生都写出了完全相同的解法(因为这是最流行的解法),你就给予这个解法极大的关注。你告诉全班说:“看!有五个人都这么做了!大家都应该这样做!”与此同时,那个尝试了某种奇特、有创意的方法但也做对了的学生却被忽视了,因为他是唯一的。全班不再尝试新事物,只是盲目模仿那个流行的答案。
- 新方法 (ReCo): 老师(ReCo)注意到了这种偏差。首先,老师意识到,如果五个学生写了相同的答案,那很可能是因为这个答案容易被发现,而不一定是因为它是“唯一”的好答案。所以,他们会降低那个流行答案的重要性。他们会说:“好吧,你们中有五个人这样做了,但既然它如此普遍,它的权重就不如一个独特的解法那么高。”这阻止了全班盲目跟风。
- 第二个技巧: 老师还会观察学生的思考过程。如果一个学生对某个特定的步骤有 99% 的把握,老师会说:“很好,你很有信心,但别太自负!仍然有极小的可能性你会出错,所以让我们保持大脑开放,考虑其他可能性。”但如果一个学生在面对分叉路口感到犹豫不决时,老师会给予巨大的鼓励来探索这种不确定性。这能防止学生过早地陷入单一、僵化的思维模式。
通过使用这两个技巧,ReCo 改变了 AI 的学习方式。它阻止了 AI 仅仅死记硬背那些“安全”的答案,并迫使它不断探索不同的路径。
研究人员在一些非常困难的数学竞赛上测试了这种新方法,例如 AIME(美国邀请数学邀请赛)和奥林匹克竞赛题目。他们使用了不同的 AI 模型,包括基于 Qwen 和 Llama 的模型。结果令人振奋。当要求 AI 只尝试几次时,ReCo 的表现与旧方法一样出色。但当给予 AI 许多尝试机会(比如生成 64 个不同答案并从中挑选最好的一个)时,ReCo 脱颖而出。它找到了旧方法完全错过的正确答案。
事实上,在一些最难的测试中,当给予多次尝试时,旧方法(GRPO)的表现甚至比最初未经训练的 AI 还要差,因为它变得如此狭隘。而 ReCo 则保持了 AI 的“头脑”开放。它保留了寻找多样化解决方案的能力,确保即使前几次尝试失败,AI 也有整套不同的策略库可以作为后盾。
团队还研究了为什么会发生这种情况。他们观察到,在旧方法下,AI 的“思维过程”变得非常重复,就像一张坏掉的唱片在循环播放同一首歌。而在 ReCo 下,即使是在解决同一个问题时,AI 也能持续生成独特、多样的处理方式。这就像是在观察一个学生,他不仅是照本宣科,还开始画图表、使用不同的公式,甚至通过建立物理模型来理解概念。
简而言之,ReCo 表明,要让 AI 真正变得聪明,我们不能仅仅奖励它快速得到正确答案。我们还需要奖励它“不陷入思维定式”。通过微妙地引导 AI 去重视多样性和不确定性,研究人员发现了一种方法,可以让这些数字大脑保持好奇心、创造力,并能够以我们始料未及的方式解决问题。这提醒我们,有时候,最好的学习方式就是保持开放的选择。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。