When Are Two RLHF Objectives the Same?
本文介绍了 Opal,一种用于确定 RLHF 偏好目标代数等价性的规范化算法,该算法揭示了许多广泛使用的方法实际上是同一底层目标的重参数化,同时识别出了产生真正不同目标的特定结构机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图完善新菜谱的厨师。在过去的几年里,数百名其他厨师都发表了他们自己“改进版”的食谱。有人说他们改变了香料,有人说他们微调了烹饪温度,还有人声称他们发明了一种全新的混合食材的方法。
核心问题在于:这些真的是不同的食谱,还是仅仅换了名字的同一道菜?
这篇论文介绍了一个名为 Opal 的工具(可以把它想象成一个“食谱翻译机”或“风味指纹扫描仪)来回答那个确切的问题,针对的是被称为 RLHF(基于人类反馈的强化学习)的 AI 训练方法。
以下是该论文发现的拆解,使用了简单的类比:
1. 问题所在:名字众多,味道相同
在 AI 世界中,研究人员提出了数十种不同的方法来教 AI 模型遵循人类偏好。他们给这些方法起了各种华丽的名字,比如 DPO、SPPO、SimPO 和 GRPO。每篇论文都声称其方法是一个“突破”或“截然不同且更好”。
作者们想知道:这些真的是不同的数学目标,还是仅仅用不同的语言书写的同一个目标?
2. 解决方案:Opal(翻译机)
作者构建了一个名为 Opal 的算法。你可以把 Opal 想象成一台机器,它获取两个不同的食谱(数学公式),并尝试将它们翻译成一种单一的标准“规范化”语言。
- 如果食谱能翻译成完全相同的标准语言: Opal 会说:“它们是相同的。”它会给出相同的“指纹”(哈希码)。
- 如果它们无法被翻译成相同的语言: Opal 会产生一个“见证”(witness)。这就像是一个具体的例子,展示了它们为何不同。例如:“在食谱 A 中,如果你加盐,它尝起来是咸的。在食谱 B 中,取决于锅里还有什么,加盐可能会让它尝起来变甜。”
3. 重大发现:许多“新”方法只是旧方法的伪装
当作者对 33 种不同方法 运行 Opal 时,他们发现了令人惊讶的事实:
“DPO”家族: 十种不同的方法(包括 SPPO 和 Nash-MD)被证明在代数上是完全等同于著名的 D besides DPO 方法的。
- 类比: 这就像有人声称他发明了一种烧开水的新方法,但管它叫“热相变”。这其实还是在烧开水,只是换了个高级的名字。
- 结果: 从 DPO 切换到 SPPO 并不会改变 AI 试图实现的实际目标;它只是改变了数学公式的写法。
“真正的”创新: 只有极少数方法是真正不同的。
- GRPO(批次效应): 这种方法被用于著名的 DeepSeek-R1 模型。Opal 证明它与 DPO 有着本质的区别。
- 类比: 想象你在给学生评分。在标准方法(DPO)中,你根据学生 A 自己的考试成绩来给 A 打分。而在 GRPO 中,你根据学生 A 与当天教室内其他学生的表现对比来进行评分。如果你把一个天才放进教室,学生 A 看起来就显得较差;如果你把一个成绩落后的学生放进去,学生 A 看起来就显得较好。这个“批次”改变了成绩。Opal 证明了这种“批次依赖性”使 GRPO 成为了一个完全不同的物种。
- KTO 及其他方法: 这些方法对“赢”和“输”的处理方式不同(就像一个比起赢带来的快乐,更恐惧损失的赌徒)。这种不对称性使得它们在结构上是独特的。
- GRPO(批次效应): 这种方法被用于著名的 DeepSeek-R1 模型。Opal 证明它与 DPO 有着本质的区别。
4. 实现真正差异的四个“秘密配料”
论文指出,要成为一种真正的新方法(而不仅仅是重述),它必须打破其中一条规则。如果它没有打破规则,那么它很可能只是对旧方法的重新包装。
- 组归一化 (Group Normalization): 根据组内其他成员的情况来改变分数(如 GRPO)。
- 对依赖权重 (Pair-Dependent Weighting): 根据特定答案的独特特征,对特定的配对进行差异化处理(如 KTO)。
- Token 级结构 (Token-Level Structure): 逐个单词地观察 AI 的回答,而不是看整个句子。
- 轨迹级 (Trajectory-Level): 观察 AI 做出的决策的整个路径,而不只是最终答案。
5. 这对从业者意味着什么
如果你是一名试图选择一种方法的工程师:
- 不要被名字迷惑。 如果你看到一种看起来像 DPO 但有着华丽推导过程的新方法,它可能只是穿着燕尾服的 DPO。
- 检查“批次”。 如果一种方法会根据训练批次中包含的其他示例而改变其行为,那么它正在做一些独特的事情(如 GRPO)。
- 目标是一致的。 即使数学形式看起来不同,如果 Opal 说它们是等效的,那么它们旨在实现相同的“完美”AI 行为。然而,它们到达目标的速度或稳定性可能会有所不同。
总结
这篇论文是 AI 领域的一次“现实检查”。它使用数学工具(Opal)剥离掉华丽的术语,揭示了大多数近期出现的“新”方法实际上只是用不同方式书写的旧目标。 真正的创新只发生在当你从根本上改变 AI 比较答案的方式时(例如观察整个群体或整个路径),而不仅仅是当你重新排列代数公式时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。