N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization
该论文引入了 N-GRPO,这是一种针对组相对策略优化(Group Relative Policy Optimization)的新型探索策略,它通过将锚点标记(anchor token)嵌入与其最近的语义邻居进行动态混合,以在注入多样性的同时保持语义一致性,从而增强了数学推理能力,并在分布内和分布外任务上均超越了现有基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一名非常聪明的学生(一个大语言模型)如何解决困难的数学问题。为了变得真正优秀,这个学生需要通过尝试多种不同的方法来解决同一个问题来进行练习。这个练习阶段被称为“采样”(rollout)。
这里介绍了一种帮助该学生练习的新方法,叫做 N-GRPO。以下是它的工作原理,通过简单的概念进行拆解:
问题所在:两种糟糕的练习方式
目前,当 AI 模型进行练习时,它们通常通过两种方式之一来尝试实现多样性,但两者都有缺陷:
“鹦鹉学舌”法(Token 级采样):
想象你要求学生重写一个句子。他们可能会说:“猫坐在垫子上”或者“垫子下面坐着猫”。- 问题在于: 这些只是换种说法。底层的逻辑完全相同。学生并没有学习新的解决数学问题的方法;他们只是在用不同的词表达同样的意思。这就像是在练习钢琴曲,但只是改变了音量,而不是改变音符。
“静态噪声”法(随机嵌入噪声):
想象给学生一个随机的电击,来搅动他们的思维。- 问题在于: 这太混乱了。这就像是在齿轮里扔进了一个扳手。学生可能会突然开始谈论“香蕉”,而他们本该谈论“代数”。随机噪声破坏了意义,导致学生偏离轨道并失败。
解决方案:N-GRPO(“聪明邻居”法)
作者提出了一个折中方案,称为 语义邻居混合(Semantic Neighbor Mixing)。你可以把它看作是一场“引导式小组头脑风暴”。
模型不是随机挑选一个词,也不是仅仅进行改写,而是观察它最可能想说的那个词(即“锚点”)。然后,它会在其内部词典中找到距离该词最近的 3 个“邻居”。
- 类比: 想象学生正准备说出“正方形(Square)”这个词。
- “鹦鹉学舌”法可能会说“四边形(Quadrilateral)”(仅仅是一个同义词)。
- “静态噪声”法可能会说“香蕉(Banana)”(随机且错误)。
- N-GRPO 会观察“正方形”,并找到它的邻居:“长方形(Rectangle)”、“菱形(Diamond)”和“立方体(Cube)”。然后,它会创建一个融合后的思想,这是所有四个概念的混合体。
这种混合是一种“连续的”思想。它还不是一个具体的词;它是一个处于这些相关想法中间的模糊概念。
为什么这有效
- 留在路径上: 因为邻居是根据与原词的相似度来选择的,所以这个新的“混合”思想在数学和逻辑上仍然是相关的。它不会漂移到毫无意义的状态(比如“香蕉”的例子)。
- 寻找新路径: 因为它是混合而成的,它允许模型探索比单一词汇稍微不同的解题角度。这就像是在森林中寻找隐藏捷径时,采取一条略微不同的路线,而不是仅仅更快或更慢地走原路。
如何使用
论文将此集成到一个名为 GRPO 的训练框架中。
- 在训练期间: 模型进行练习。有时(大约 10% 的时间),它会使用这种“聪明邻居”混合法来生成解决方案。如果该解决方案导向了正确答案,模型就会获得奖励,并学习到这条“混合”路径是有效的。
- 在测试期间(推理): 有趣的是,论文发现虽然这种混合有助于学习,但在模型独立回答问题时,它实际上会损害性能。因此,在进行最终测试时,他们会关闭这种混合,坚持使用标准的、清晰的答案。
结果
研究人员在数学问题(如 AIME 和 MATH 基准测试)上测试了不同规模的 AI 模型。
- 结果: 使用 N-GRPO 的模型比使用旧方法模型解决了更多的正确问题。
- 核心结论: 通过将相似词汇的“思想”混合在一起,AI 可以探索更具创造性的解决方案,而不会感到困惑或迷失方向。
局限性
论文指出有两个主要缺点:
- 速度: 寻找这些“邻居”并进行混合需要额外的计算能力,这使得训练过程变得稍慢。
- 范围: 他们仅在数学和科学领域进行了测试。他们还没有尝试将其用于编程,因为编程的规则非常严格(你不能在不破坏语法的情况下真的去“混合”代码语法)。
简而言之,N-GRPO 教会 AI 通过融合相似的想法来进行思考,从而在不失去理智的前提下探索新的解决方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。