← 最新论文
💬 NLP

Adaptive Margin RLHF via Preference over Preferences

本文提出了一种名为自适应边际强化学习人类反馈(Adaptive Margin RLHF)的新型框架,该框架利用“偏好之偏好”(preference-over-preference)标注来推断用于奖励建模与对齐的动态且数据特定的边际,并引入了 DPO-PoP 算法,在增强判别性能与生成性能的同时,通过专门的采样策略解决两者之间的权衡问题。

原作者: Yaswanth Chittepu, Prasann Singhal, Greg Durrett, Scott Niekum

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaswanth Chittepu, Prasann Singhal, Greg Durrett, Scott Niekum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何写出人类真正喜欢的的故事。为了做到这一点,你向机器人展示成对的故事:一个“好”故事和一个“坏”故事,并问它:“哪一个更好?”这是训练 AI 的标准方法,被称为 RLHF(基于人类反馈的强化学习)。

通常,机器人只是学习在“好”与“坏”之间做出选择。但新论文 《通过“偏好之上的偏好”实现自适应边际 RLHF》(Adaptive Margin RLHF via Preference over Preferences)指出,并非所有的“好 vs 坏”比较都是等同的。

以下是该想法的简单拆解,使用了日常类比。

1. 问题所在:并非所有的“更好”选择都是一样的

想象你是一位正在给学生评分的老师。

  • 场景 A: 你在比较一位写出了杰作的学生和一位写出了胡言乱语的学生。这种差异是巨大的。这是一个容易的决策。
  • 场景 B: 你在比较两个都写了不错文章的学生,但其中一个的语法稍微好一点。这种差异是微小的。这是一个困难的决策。

在传统的 AI 训练中,计算机对这两种情况的处理方式完全相同。它只是学习“A 比 B 好”。

作者认为这是一个错误。计算机应该学习到,场景 A(巨大的差距)是一个“强”偏好,应该被赋予更多的信心;而 场景 B(微小的差距)是一个“弱”偏好,应该被更谨慎地对待。

2. 旧方法:索要分数(“评分量表”问题)

为了弄清楚差距有多大,之前的方法尝试询问人类:“如果以 1 到 10 分为标准,好故事比坏故事好多少?”

论文指出这种方法并不可靠。人类很难给出一致的数字。一个人可能会给巨大的差距打“9”分,而另一个人可能打“7”分。这就像是在没有温度计的情况下让人们猜测确切的温度;每个人的猜测都会有些偏差。

3. 新方案:“偏好之上的偏好”(PoP)

与其询问一个数字,作者提出了一个更聪明的提问方式。他们要求人类观察两个不同的比较,并决定哪一个差异更“显著”。

  • 比较 1: 杰作 vs. 胡言乱语。
  • 比较 2: 一篇优秀的文章 vs. 一篇稍好一点的文章。

问题是: “这两个情况中,哪一个展现出的差异更大?”

大多数人可以轻松地说出:“第一个情况(杰作 vs. 胡言乱语)的差异要明显得多。”

这就是 “偏好之上的偏好”(Preference over Preferences, PoP) 的核心思想。这就像是在问一位裁判:“金牌和垫底名次之间的差距,是否比银牌和铜牌之间的差距更大?”这个答案是显而易见的,也比让他们为一个差距分配一个具体的得分要可靠得多。

4. AI 如何利用这一点(“自适应边际”)

在数学术语中,好答案与坏答案之间的“差距”被称为边际(margin)。

  • 旧 AI: 使用固定的差距。 “只要好答案哪怕只是一点点更好,我就从中学习。”
  • 新 AI (DPO-PoP): 使用自适应边际
    • 如果人类说:“这是一个巨大的差异”,AI 会说:“好吧,我需要在我的内部数学模型中,确保好答案比坏答案好得多。”
    • 如果人类说:“这是一个微小的差异”,AI 会说:“好吧,我会对这个处理得更温和一些。”

论文引入了一种特定的方法,称为 DPO-PoP(带有“偏好之上的偏好”的直接偏好优化),它利用这些“强 vs 弱”的标签来自动调整数学计算。

5. 权衡:两种采样方式

研究人员发现,你如何提问会改变结果。他们测试了两种策略:

  1. “迭代式”策略(完美主义者): 你强迫 AI 去观察每一个“弱”比较(那些微小的差距),并确保它能把这些都做对。

    • 结果: AI 在识别哪个答案更好方面变得非常出色(它是一个优秀的评分员)。
    • 缺点: 因为它过于专注于这些微小、棘手的差异,它在实际写作时有时会感到困惑。它变得过于谨慎了。
  2. “随机式”策略(大局观): 你随机抽取比较,这自然意味着你会看到更多的“大差距”(明显的胜出)而非微小的差距。

    • 结果: AI 变成了一个更好的作家。它能创作出更具创意和帮助性的故事,因为它专注于人类喜欢的那些清晰、强烈的例子。
    • 缺点: 它在识别最细微、最微妙的差异时,可能不如前者那么完美。

核心结论

论文声称,通过仅仅让人们比较两个差异而不是评价一个差异,我们可以让 AI 更好地理解人类偏好的强度

  • 如果你想要一个完美的评判者,请使用“迭代式”方法。
  • 如果你想要一个优秀的创意作家,请使用“随机式”方法。

两种方法都优于传统的 AI 训练方式,证明了询问“哪个差异更大?”比询问“这个差异有多大?”是一个更聪明的提问方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →