← 最新论文
💬 NLP

Offline Preference Optimization via Maximum Marginal Likelihood Estimation

本文介绍了 MMPO,一种稳定且简化的离线偏好优化方法,它通过最大化边际对数似然使大语言模型与人类偏好保持一致,从而消除了对显式奖励模型的依赖,并在对齐质量和通用能力保持方面优于基准方法。

原作者: Saeed Najafi, Alona Fyshe

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Saeed Najafi, Alona Fyshe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教机器人变得“有礼貌”

想象你有一个非常聪明的机器人(大语言模型),它几乎读过了互联网上的所有内容。它能写故事、解数学题,还能回答问题。然而,它有点像一个聪明但有些混乱的青少年:它知道如何说话,但并不总是知道人类究竟想听什么。有时它很没礼貌,有时它让人困惑,有时它还会胡编乱造。

为了解决这个问题,我们需要让机器人与人类的偏好“对齐”(align)。目前实现这一目标的标准方法叫做 RLHF(基于人类反馈 Reinforcement Learning from Human Feedback)。你可以把它想象成雇佣了一位严厉的教练,观察机器人的表现,给好的回答加分,给坏的回答扣分。但这个过程很麻烦,成本很高,而且机器人经常会被教练不一致的规则搞糊涂。

最近,一种更简单的方法 DPO 被发明了。它就像跳过教练,直接给机器人看两个答案(一个好的,一个坏的),然后说:“选那个好的。”这效果更好,但仍然存在一些怪癖,如果调整参数过度,可能会变得不稳定。

这篇论文介绍了一种名为 MMPO 的新方法。 作者说:“让我们尝试一个完全不同的角度。”他们不再试图教机器人去挑选赢家,而是将这个问题视为一个边际似然(marginal likelihood)估计问题。

核心思想:“最佳猜测”游戏

要理解 MMPO,想象你正在试图猜出一个悬疑故事的结局。你知道开头(提示词),并且有两个可能的结局:

  1. 好的结局: 人类更喜欢的那个。
  2. 坏的结局: 人类不喜欢的那个。

旧的方法 (DPO/RLHF):
旧的方法就像是在玩“热与冷”的游戏。它们计算“好结局”的分数和“坏结局”的分数,然后试图推高好结局的分数并压低坏结局的分数。这有点像在玩跷跷板;如果你在一边用力过猛,整个平衡就会被打破(不稳定)。

新方法 (MMPO):
作者提出了一种基于最大边际似然 (MML) 的不同方法。

想象你是一名侦探,试图弄清楚在只有少量线索(你看到的这两个结局)的情况下,某个特定的“好结局”成为故事真实结局的可能性有多大。

MMPO 不再是直接对比这两个结局,而是问道:“如果我们观察这个故事所有可能的结尾,‘好结局’实际上发生的可能性有多大?”

为了做到这一点,数学过程将“好结局”和“坏结局”都视为“样本”(线索),用以估计这种可能性。

  • 它不需要一个单独的“教练”(奖励模型)来告诉它什么是好的。
  • 它不需要为了追求多样性而强行要求机器人保持“创造力”(熵最大化)。

魔法技巧:如何在没有教练的情况下运作

论文声称,通过使用这种“最佳猜测”的数学方法,机器人会隐式地学习偏好好的答案,而无需被明确告知。

这里有一个类比:
想象你在教一只狗“坐下”。

  • RLHF: 你有一个带着响片和零食的训练员。当狗坐下时,你按响片;当它没坐下时,你不按。
  • DPO: 你给狗看一张它坐着的照片和一张它站着的照片,然后说:“我更喜欢这张坐着的照片。”
  • MMPO: 你只是看着那张“坐下”的照片,并根据你掌握的证据,计算出这是正确行为的可能性。

论文从数学上证明了,当你进行这种计算时,数学逻辑会自然地推动机器人更多地选择“好结局”。这就像数学本身充当了奖励系统。机器人学会了提升好答案的概率,并稍微降低坏答案的概率,这一切都在一个平滑的过程中完成。

为什么这种方法更好?(结果)

作者在不同规模的机器人(从小型“玩具”机器人到大型“大脑型”机器人)上测试了这种方法。以下是他们的发现:

  1. 它更稳定:
    想象你在调收音机。使用旧方法(DPO)时,如果你把旋钮(一个称为 β\beta 的设置)转动得哪怕只有一点点,音乐可能会变成杂音或直接中断。而使用 MMPO,无论你怎么转动旋钮,收音机都能保持清晰。这种训练很难被“搞砸”。

  2. 它保持了机器人的聪明才智:
    有时候,当你教机器人变得有礼貌时,它会忘记如何做数学或讲笑话。它会变成一个虽然安全但很无趣的“唯唯诺诺者”。
    论文显示,MMPO 能够更好地保留机器人原有的聪明才智。它在学习变得有礼貌的同时,不会忘记如何作为一个通用的助手。

  3. 它胜出的次数更多:
    当他们让这种新方法在比赛中(AlpacaEval)与旧方法对决时,MMPO 始终能获得第一名或并列第一,尤其是在那些更小、更高效的模型上。

“秘制配方”的成分

论文还进行了实验,以查看哪些部分的配方是必不可少的。他们发现有两个关键成分让魔法得以奏效:

  • 批次内归一化 (In-Batch Normalization): 这就像确保班级里的每个人都按照同样的标准评分。如果一个学生得了 A+ 而另一个得了 F,老师会调整分数使比较公平。这防止了某个奇怪的例子破坏整个教学过程。
  • 无需“额外”熵: 他们发现,试图强迫机器人保持“多样性”(熵最大化)实际上会让效果变差。他们让数学自然地完成这项工作。

总结

简而言之,这篇论文说:“不要试图建立一个复杂的奖励系统来教机器人人类喜欢什么。相反,使用一个简单的统计技巧,将人类的偏好视为线索。这个技巧能自然地教会机器人变得乐于助人,保持稳定性,并确保它不会忘记如何保持聪明。”

他们将这种新方法称为 MMPO(最大边际似然偏好优化),并认为这是将 AI 与人类价值观对齐的一种更简单、更可靠的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →