← 最新论文
📊 statistics

Beyond RLHF: A Unified Theoretical Framework of Alignment

本文通过将大语言模型对齐重构为成对偏好下的分布学习,提出了一个统一的理论框架,推导出三个具有强非渐近收敛保证的原则性目标,为基于人类反馈的强化学习提供了严谨的理论依据,并解释了策略内方法在经验上优于基于似然方法的原因。

原作者: Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢但略显混乱的学生(即大型语言模型,或 LLM)。这位学生掌握大量事实,却并不总是懂得如何提供有益、礼貌或安全的回答。你希望教导他成为一名“好”学生。

在一段时间内,实现这一目标的标准方法是RLHF(基于人类反馈的强化学习)。这就像雇佣一位严格的老师,为学生的每一个回答打分(即“奖励”)。随后,学生尝试推测老师的期望,并调整其回答以获得最高分。

问题所在:
本文作者指出,尽管这种“基于分数”的方法行之有效,但从数学角度来看,人们并不真正清楚为何它有效。这就像遵循一份食谱,上面写着“加盐直到味道好”,却不懂盐为何能提升食物风味的化学原理。此外,如果对食谱调整过度,学生要么变得过于僵化(乏味),要么崩溃成胡言乱语。

新构想:
作者提出了一种看待该问题的新方式。与其思考“分数”或“奖励”,他们建议我们应着眼于学习偏好分布

想象你有一位“完美学生”(目标模型),他确切知道如何完美作答。你无法直接看到这位完美学生,但你可以观察到他在比较两个回答时的选择。

  • 场景: 你向完美学生展示两个回答 A 和 B。
  • 观察: 完美学生选择了 A。
  • 本文洞见: 作者假设,完美学生选择 A 仅仅是因为他们更有可能生成 A 而非 B。他们无需“分数”来做决定;只需遵循其内部概率即可。

基于这一简单假设,他们推导出了三种训练学生的新方法,分别称为PMLE偏好蒸馏反向 KL

三种新方法(“食谱”)

  1. PMLE(“投票”法):

    • 类比: 想象你试图通过观察成千上万张选票来推测完美学生的想法。如果完美学生在 90% 的情况下投票选择"A"胜过"B",那么你的学生应学会在 90% 的情况下回答"A"。
    • 工作原理: 它直接尝试匹配完美学生选择的概率,无需中间人“分数”。这就像通过聆听母语者说话来学习语言,而非阅读由机器人编写的语法书。
  2. 偏好蒸馏(“翻译”法):

    • 类比: 有时直接从完美学生学习很困难。因此,你雇佣一位“翻译”(一个更小、更简单的模型)来解读完美学生的想法,并写下其偏好的摘要。随后,你的学生从翻译的摘要中学习。
    • 工作原理: 首先,训练一个小模型来预测偏好;然后,教导你的主学生模仿这些偏好。这比直接从原始投票中学习更快,且通常更稳定。
  3. 反向 KL(“修正”法):

    • 类比: 这是本文的重大“顿悟”时刻。作者意识到,旧的“基于分数”的方法(RLHF)实际上是这种新方法的某种有缺陷的版本。
    • 修正: 旧方法存在一个缺陷:如果你试图从数据中学习过多,学生会忘记如何自然表达,变得像机器人。新方法添加了一个“安全网”(熵项),迫使学生在保持学习偏好的同时,保持创造力和自然性。这就像告诉学生:“做完美学生做的事,但不要失去你自己的个性。”

为何重要(结果)

作者不仅撰写了方程,还从数学上证明了这些新方法随着数据量的增加,性能必然提升

  • “收敛”承诺: 他们证明,随着向学生展示更多示例,学生的回答将在数学上收敛至完美学生的回答。旧方法缺乏这种保证;它们仅仅是“充满希望”。
  • 解决两难困境: 旧方法(RLHF)存在一个死循环:若试图大量学习,学生会退化(变得 nonsensical);若试图保持安全,学生则学不到足够内容。新的“反向 KL"方法解决了这一问题,使学生能够深入学习的同时不失其本性。
  • 现实世界测试: 当他们在文本摘要和聊天对话中测试这些方法时,新方法的表现与旧“金标准”方法相当,甚至更优。

核心结论

这篇论文就像一位机械师意识到某款名车(RLHF)的引擎确实能运转,但他们并不了解其背后的物理原理。他们逆向工程该引擎,找到了缺失的螺栓(概率假设),并构建了三种更可靠的新引擎。

他们发现,旧的“分数”系统实际上只是笨拙地尝试实现这些新方法自然完成的事情:学习人类偏好的分布。通过修正数学原理,他们使训练过程更加稳定、理论更严谨,且在实践中同样有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →