MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge
原作者: Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton
原作者: Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:MaPPO(最大后验偏好优化)
问题陈述
本文针对当前用于使大语言模型(LLMs)与人类偏好对齐的偏好优化(PO)方法(特别是直接偏好优化 DPO 及其变体)存在的根本性局限进行了探讨。尽管 DPO 成功地将偏好学习重构为最大似然估计(MLE)问题,从而消除了对复杂强化学习滚动的需要,但它引入了一个关键缺陷:挤压效应。
由于基于 MLE 的目标仅专注于最大化优选响应(yw)与被拒响应(yl)之间的相对似然差距,它们往往忽略了奖励的绝对幅度。实证证据表明,随着训练的进行,模型倾向于同时降低两个响应的概率以扩大差距,而不是提高高质量响应的概率。这导致了:
- 置信度退化:高质量输出的绝对似然降低。
- 不稳定性:特别是在“近乎平局”的情况下(即两个响应均为高质量但风格不同),MLE 目标强制进行人为分离,从而从输出空间的高质量区域中抽离概率质量。
- 缺乏全局校准:训练信号局限于成对比较,缺乏对外部先验知识或绝对奖励幅度的锚定。
方法论:MaPPO
作者提出了最大后验偏好优化(MaPPO),这是 DPO 的一个原则性扩展,它将数据驱动的先前奖励知识整合到优化目标中。
核心公式
MaPPO 将范式从最大似然估计(MLE)转变为最大后验(MaP)估计。
- 先验知识整合:该方法假设可以获取所选响应和被拒响应的先验奖励估计(rw和rl),这些通常源自预训练的奖励模型或神谕(oracle)。
- MaP 损失函数:标准 DPO 损失函数增加了基于奖励差距 Δr=rw−rl 的校准项。推导出的损失函数为:
LMaP(θ)=E(yw,yl,x)∼D[−logσ(βlogπref(yw∣x)πθ(yw∣x)−Δr⋅βlogπref(yl∣x)πθ(yl∣x))]
其中,Δr∈[0,1] 作为被拒响应项的缩放因子。 - 机制:
- 当奖励差距较大(偏好明确)时,Δr 接近 1,MaPPO 的行为与标准 DPO 类似。
- 当奖励差距较小(近乎平局或两个响应均为高质量)时,Δr 较小。这降低了对被拒响应(yl)的惩罚,防止模型激进地抑制其概率。这缓解了挤压效应,并保留了高质量输出的绝对置信度。
关键特性
- 无新超参数:MaPPO 除了 DPO 中已有的超参数外,不引入任何额外的超参数。奖励差距 Δr 直接源自用于构建偏好对的奖励模型分数。
- 兼容性:它被设计为“即插即用”插件。它可以无缝替换现有 DPO 变体(如 SimPO、IPO、CPO)中的 MLE 组件,并支持离线(静态数据集)和在线/迭代(从当前策略生成响应)设置。
- 理论稳定性:作者提供了理论分析,表明与 DPO 相比,MaPPO 的梯度算子具有更低的 Lipschitz 常数,这意味着更新更稳定,且在驻点处 yw 和 yl 之间的对数概率比是有界的。
主要贡献
- 原则性泛化:MaPPO 通过将先验奖励估计整合到最大后验目标中,泛化了 DPO,超越了 MLE 过度简化的二元分类。
- 缓解挤压效应:通过根据奖励差距对被拒响应进行加权,MaPPO 抑制了对近乎平局对的过度惩罚,从而产生校准更好的策略。
- 多功能性:该方法支持离线和在线偏好优化,并且与广泛的 DPO 变体(SimPO、IPO、CPO、Iterative-DPO)兼容,无需架构更改或额外调整。
- 实证验证:在多个模型系列(Llama-3、Qwen2.5、Mistral)和规模(1.5B 到 32B)上进行的广泛实验证明了其一致的提升。
实验结果
作者在三个标准基准测试上评估了 MaPPO:MT-Bench、AlpacaEval 2.0 和 Arena-Hard。
- 性能提升:
- 在 AlpacaEval 2.0 上,MaPPO 将 Mistral-7B-Instruct 模型的胜率从 18.24%(DPO)提升至 30.56%(+12.32 分)。
- 在 Arena-Hard 上,同一模型从 14.2% 提升至 18.4%(+4.2 分)。
- 对于 Qwen2.5-7B-Instruct 模型,MaPPO 在 AlpacaEval 2.0 上使 DPO 提升了 +6.23,在 Arena-Hard 上提升了 +13.7。
- 泛化能力:改进在不同模型规模和系列中保持一致。值得注意的是,MaPPO 使得较小的模型在对齐任务中能够超越较大的基础模型。
- 兼容性:当应用于 SimPO、IPO 和 CPO 等变体时,MaPPO consistently 带来了收益(例如,SimPO 在 AlpacaEval 上提升了 +7.60),且无需额外的计算成本或超参数调整。
- 鲁棒性:使用不同奖励模型(包括低质量模型)进行的消融研究表明,MaPPO consistently 优于基线,表明其对先验信号的变化具有鲁棒性。
- 学术基准:该方法在学术基准(IFEval、GPQA、MMLU、GSM8K)上保持或提升了性能,表明它不会在通用能力上产生显著的“对齐税”。
意义与主张
本文声称,MaPPO 为基于 MLE 的偏好优化中固有的置信度退化问题提供了一个简单且原则性的解决方案。通过显式整合先验奖励知识,MaPPO 提供了更校准的训练信号,该信号尊重响应的绝对质量,而不仅仅是它们的相对排序。
作者强调,MaPPO 在不牺牲计算效率的情况下实现了这些改进。它保留了 DPO 的闭式、单步优化结构,在对齐阶段不需要额外的滚动、价值函数或奖励模型训练。这项工作将 MaPPO 定位为 RLHF 流程的替代品,而是一种稳健的通用增强策略,可集成到现有的偏好训练流程中,以生成更可靠、更稳定的对齐模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 NLP 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。