Constrained Group Relative Policy Optimization
本文介绍了约束性 GRPO(Constrained GRPO),这是一种基于拉格朗日方法的组相对策略优化(Group Relative Policy Optimization)扩展,它通过对标准化优势而非原始奖励进行标量化处理,消除了由组内归一化引起的有害耦合效应,从而提高了约束执行能力和训练稳定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,研究人员正在教导大型计算机模型去解决复杂的问题,从驾驶自动驾驶汽车到解决困难的数学谜题。这些模型通过试错法进行学习,这一过程被称为强化学习。想象一个正在尝试走出迷宫的学生;当他们到达出口时会获得奖励,而撞到墙壁时则会受到惩罚。随着时间的推移,学生学会了如何最大化奖励并避免惩罚。然而,当我们希望模型遵循严格规则时(例如“绝不撞到行人”或“始终使用正确的语法”),同时又要保持其有用性,就会出现一个重大挑战。如果规则过于僵化,模型可能会变得毫无用处;如果规则过于宽松,它可能会违反规则。为了解决这个问题,科学家们使用了一种数学框架,在追求成功与遵守约束之间寻找平衡,并在模型学习过程中不断调整每条规则的重要性。
一种被称为“群体相对策略优化”(Group Relative Policy Optimization)的流行教学方法已成为热门选择,因为它效率极高,且不需要一个单独的“裁判”模型来评估每一步。相反,它通过比较针对同一个问题生成的若干组答案,来决定哪些答案更好。虽然这种方法在处理通用任务时表现良好,但研究人员发现,将其应用于严格的安全规则时却非常棘手。在一项新的研究中,来自 Mila – 魁北克人工智能研究所和蒙特利尔理工学院的研究团队发现,将不同目标组合成单一评分的标准方式实际上破坏了系统遵循规则的能力。他们引入了一种新的方法——“约束型群体相对策略优化”(Constrained Group Relative Policy Optimization),它修复了这一缺陷,并允许模型在严格遵守安全限制的同时学习复杂的行为。
研究人员确定的核心问题在于计算机如何同时处理多个目标。在标准方法中,模型会获取所有的奖励和惩罚,将它们混合成一个单一的数值,然后对该数值进行归一化处理,以便于学习。研究人员表明,这种混合过程产生了一种隐性的干扰。当计算机调整一条规则的权重时,它会无意中改变所有其他规则的相对重要性。这就像试图通过转动一个同时也会改变整个乐队平衡的旋钮,来调节管弦乐队中某一种乐器的音量;你可能想让小提琴声变大,但在这样做时,你却不小心让鼓声变小了,同时让长笛声变大了。这使得模型很难准确判断应该遵循哪条规则,经常导致它忽略安全约束或在训练期间变得不稳定。
为了解决这个问题,研究人员改变了操作顺序。他们不再先混合奖励和惩罚,而是让模型分别计算每条规则的价值,并对它们分别进行归一化处理。只有在每条规则都得到了独立公平的处理之后,才使用学习到的权重将它们合并。这个简单的转变消除了隐性干扰。通过在最后阶段之前保持信号的独立性,模型可以清晰地看到自己在每一项特定规则上的进步。结果是,学习过程变得更加稳定且可预测。研究人员在三个截然不同的环境中测试了这种新方法:一个智能体必须避开岩浆并管理电池的简单网格游戏;一个包含数千个复杂交通场景的真实自动驾驶模拟;以及一个涉及小学应用题的数学推理任务。
在网格游戏中,新方法让智能体的学习过程变得更加平滑。标准方法会导致智能体变得过度谨慎,由于过于激进地避开岩浆,导致它几乎无法移动;而新方法则允许智能体有效地利用其可用的“风险预算”,在保持安全的同时到达目标。在自动驾驶模拟中,新方法产生的驾驶员不仅更安全,而且在完成路线方面也更有效。使用新方法训练的模型在安全合规性和路线进度方面都取得了比以往先混合信号的方法更高的分数。它们成功避免了碰撞并遵守了交通规则,同时没有牺牲前进的驾驶能力,而其他方法在维持这种平衡方面表现挣扎。
最后的测试是教导一个语言模型在确保答案简短、格式正确且包含有效数字的同时,去解决数学问题。在这里,新方法再次证明了其优越性。使用标准混合方法训练的模型往往为了缩短答案或符合特定格式而牺牲了正确性。相比之下,新方法确保了模型在保持高标准格式和长度的同时,优先保证数学计算的正确性。在不同规模的计算机模型中(从拥有 15 亿参数的小型模型到拥有 70 亿参数的大型模型),新方法始终能产生更准确的结果,且不需要昂贵的额外训练组件。
研究结果表明,我们组合不同学习信号的方式与信号本身同样重要。通过仅仅改变计算机处理奖励和规则的顺序,研究人员能够创造出一个能更可靠地遵守约束的系统。这项工作不仅仅是一个微小的改进,它为训练能够在现实世界中安全运行的人工智能提供了一条更清晰的路径,因为在现实世界中,遵循规则往往与实现目标同样重要。这项研究证实,当我们希望人工智能既有能力又安全时,我们必须谨慎,以免衡量成功的方式让模型对它实际应该做什么产生困惑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。