← 最新论文
💬 NLP

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

本文介绍了 MDP-GRPO,这是一种通过采用多温度采样、双锚点优势函数、前景理论塑造以及非对称 KL 正则化来克服离散、低分散奖励设置下不稳定性的组相对策略优化(Group Relative Policy Optimization)的稳定变体,从而显著提升了多约束指令遵循性能。

原作者: Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti

发布于 2026-06-05
📖 2 分钟阅读☕ 轻松阅读

原作者: Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位非常有天赋但有点随性的厨师(即 AI)如何遵循一个非常具体的食谱。这个食谱不仅仅是“做一个蛋糕”那么简单,它是一系列严格的规则:“必须恰好使用 3 个鸡蛋”、“不能使用巧克力”、“指令必须全部大写”以及“以‘Bon Appétit’结尾”。

在 AI 世界中,这被称为多约束指令遵循(Multi-Constraint Instruction Following)。问题在于,标准的 AI 训练方法在面对如此严格的规则和二元反馈(要么遵守规则,要么没遵守)时,往往会感到困惑。

这里有一个关于该论文解决方案——MDP-GRPO 的简单拆解,使用了日常类比。

问题所在:“小组评分”陷阱

论文首先解释了目前的 AI 训练(称为 GRPO)是如何运作的。想象一下,老师一次性给一组 8 名学生(即 AI 的尝试)进行测验。老师并不是根据一个完美的标准来给每个学生评分,而是让他们相互之间进行比较

  • 如果 7 名学生得了“C”,而 1 名学生得了“B”,那么这名“B”的学生会获得巨大的奖励,而“C”的学生则会受到巨大的惩罚。
  • 故障点: 在严格的规则遵循中,很常见的情况是组内的所有人都会得到完全相同的分数(例如,大家都违反了“全大写”规则)。
    • 零方差崩溃(Zero-Variance Collapse): 如果所有人都得了“0分”,老师就无法判断谁做得更好。这个“成绩”对所有人来说都是零,导致 AI 无法学习任何东西。
    • 均值中心化盲区(Mean-Centering Blindness): 如果一组学生表现都很差,而另一组学生也表现得很差,老师会对他们进行同样的处理,因为相对于各自的小组,他们都“同样糟糕”。AI 并不知道自己具体违反了哪条规则。
    • 低方差放大(Low-Variance Amplification): 如果分数分别是 99、100、100、100,那么 99 和 100 之间微小的差异会被放大成巨大的惩罚,导致 AI 过度反应并变得不稳定。

解决方案:MDP-GRPO

作者提出了一个新的训练方法,包含四个用于修复这些故障的“工具”。你可以将其理解为升级了老师的评分系统。

1. “风味混合器”(多温度采样 / Multi-Temperature Sampling)

  • 问题: 如果你要求 AI 写 8 个不同版本的的故事,它可能会写出 8 个几乎一模一样的故事。如果它们完全相同,它们就会得到相同的分数,从而导致训练停滞。
  • 修复方法: 作者让 AI 使用不同的“创意水平”来写这 8 个故事。有些写得非常严谨(低温度),有些写得非常狂野且富有创意(高温度)。
  • 结果: 这确保了即使规则很难,这 8 次尝试也会足够不同,从而产生不同的分数。这防止了“所有人得分都为零”的问题。

2. “双锚点”系统(双锚点优势 / Dual-Anchor Advantages)

  • 问题: 当小组表现很糟时(每个人都失败了),“相对评分”系统就会失效。
  • 修复方法: 与其仅仅让学生互相比较,老师还会将他们与一个**固定的、虚构的“中立学生”**进行比较。
    • 想象一个“中立学生”,他纯粹靠运气就能完成 50% 的规则。
    • 如果 AI 的小组表现比这个“中立学生”还要差,AI 就会得到一个明确的信号:“你做得比平均水平还要差,再努力一点!”
    • 即使整个小组都在失败,这也能给 AI 提供学习信号,防止出现“对绝对表现的盲目性”。

3. “人类对损失的恐惧”(前景理论塑造 / Prospect-Theoretic Shaping)

  • 问题: 标准训练将微小的胜利和小小的损失视为相等但相反的概念。但在现实生活中,人类对失去的痛苦感远大于获得的快乐感。
  • 修复方法: 作者借鉴了经济学中的一个概念,称为前景理论(Prospect Theory)。他们通过编程让 AI 感觉到违反规则带来的“痛苦”要比遵循规则带来的“喜悦”强烈得多。
    • 如果 AI 违反了一条规则,惩罚是巨大且尖锐的。
    • 如果 AI 遵循了一条规则,奖励则是封顶且温和的。
    • 这阻止了 AI 变得过于鲁莽,并迫使它在面对严格约束时变得非常谨慎。

4. “不对称安全带”(不对称 KL 正则化 / Asymmetric KL Regularization)

  • 问题: 有时,在试图遵循规则的过程中,AI 可能会忘记如何正常说话,或者变得过于僵化。
  • 修复方法: 他们给 AI 的变化套上了一个“安全带”。
    • 如果 AI 正在进步(更好地遵循规则),安全带会变松,允许进行大幅度的改变。
    • 如果 AI 正在退步(违反规则),安全带会立即收紧,防止其做出破坏性的剧烈错误。

实验结果

作者在 Llama-3.2Gemma-2 等模型上测试了这种新方法。

  • 更擅长规则: AI 在遵循严格的多部分指令方面变得显著更好(严格成功率提升高达 5%)。
  • 学习稳定: 当 AI 遇到失败瓶颈时,训练并没有崩溃或陷入混乱。
  • 依然聪明: 至关重要的是,AI 在学习这些严格规则的同时,并没有丢失其通用知识(如回答常识问题或解决逻辑谜题的能力)。

总结

论文指出,教 AI 遵循严格的多重规则,就像教一位厨师遵循一个带有 10 个微小且具体约束条件的食谱。标准方法之所以失败,是因为当班级里的所有人都失败时,它们会感到困惑。MDP-GRPO 通过以下方式解决了这个问题:

  1. 让练习尝试更加多样化。
  2. 提供一个固定的参考点,以便即使在失败时,AI 也知道自己的处境。
  3. 让 AI 比“热爱成功”更“恐惧错误”。
  4. 防止 AI 在出错时发生过于剧烈的改变。

其结果是,AI 在遵循复杂、严格的指令方面变得更加可靠,同时不会丧失其通用的智慧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →