← 最新论文
💬 NLP

Distributionally Robust Reinforcement Learning with Human Feedback

本文介绍了用于微调大语言模型的基于奖励的 RLHF 和无奖励 DPO 的分布鲁棒变体,提出了具有收敛保证的小批量梯度下降算法,与标准方法相比,这些算法显著提高了在分布外任务上的性能。

原作者: Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明的机器人助手如何写电子邮件、解决数学问题或与人聊天。你通过向它展示成千上万个“好”答案与“坏”答案的对比示例来进行教学。这个过程被称为基于人类反馈的强化学习 (Reinforcement Learning from Human Feedback, RLHF)

然而,这里有一个问题。如果你只通过编写“友好”邮件的示例来训练机器人,然后突然要求它编写一份“法律”合同或“科学”报告,它可能会感到困惑并表现不佳。它对训练数据进行了“过度专业化”,导致无法处理新的、不同的情况。这就像一个学生仅仅背诵了特定练习题的答案,却在正式考试中失败了,因为问题的表述方式发生了变化。

这篇论文提出了一种新的训练方法,旨在让这些机器人具有鲁棒性 (Robustness)——这意味着即使问题发生变化,或者环境与它们在训练期间看到的略有不同,它们依然能保持聪明且乐于助人。

以下是他们是如何实现的,使用了几个简单的类比:

1. 问题所在:“回声室”效应

目前的训练方法就像把一个学生关在一个回声室里。他们只能听到一种声音(训练数据)。如果现实世界有不同的口音或语调,学生就会迷失方向。作者将这种现象称为缺乏分布外 (Out-of-Distribution, OOD) 鲁棒性

2. 解决方案:“最坏情况”教练

作者引入了一个概念,叫做分布鲁棒优化 (Distributionally Robust Optimization, DRO)

想象你正在训练一名马拉松选手。

  • 标准训练: 你只在平坦、阳光明媚的跑道上跑步。
  • 鲁棒训练: 你告诉选手,“我希望你能应对任何与这条跑道略有不同的情况。也许会有微风,也许地面有点泥泞,也许温度稍微高了一些。”

机器人不仅仅学习如何在“完美”的数据上表现出色,相反,它学习即使在数据向“最坏情况”发生轻微偏移时也能表现良好。它在为不可预见的状况做准备。

3. 他们是如何做的(两步走的过程)

该论文侧重于教导机器人的两个主要阶段:

步骤 A:学习“裁判”(奖励估计)
首先,机器人需要一个“裁判”(奖励模型)来告诉它一个答案是好是坏。

  • 诀窍: 作者并没有仅仅对训练数据中的得分取平均值,而是教导“裁判”要保持怀疑精神。他们问道:“如果我们观察的数据略有偏差或发生了偏移,会发生什么?如果我们面对的是一个略微不同的版本的数据,我们可能得到的最低分是多少?”
  • 结果: “裁判”变得更加严格且可靠。它不会被训练数据中的奇特之处所迷惑。论文表明,这使得“裁判”在处理新的数据时,在推理任务(如数学或逻辑)方面表现得更好。

步骤 B:学习“演员”(策略优化)
一旦“裁判”准备就绪,机器人(“演员”)就会尝试通过编写答案来取悦“裁判”。

  • 诀窍: 作者更新了两种流行的用于此目的的方法:
    1. PPO (Proximal Policy Optimization,近端策略优化): 一种方法,机器人试图在保持其原始个性的同时,最大化“裁判”的评分。
    2. DPO (Direct Preference Optimization,直接偏好优化): 一种快捷方法,它跳过了“裁判”这一步,直接从“好 vs 坏”的示例中学习。
  • 创新点: 他们将同样的“最坏情况”思维应用到了这些步骤中。机器人学习即使在提示词(它收到的问题)分布发生轻微偏移时,也能表现出色。

4. 结果:“超强推理”

团队使用两个不同的模型(一个 20 亿参数的小型模型和一个 70 亿 参数的较大模型)将他们的新型“鲁棒”机器人与标准机器人进行了对比测试。

  • 测试: 他们使用了一个名为“Unified-Feedback”的大规模数据集来训练机器人,但随后在完全不同的数据集(如“HHH-Alignment”或“MT-Bench”)上对其进行测试,而这些数据集是机器人从未见过的。
  • 结果:
    • 鲁棒型机器人在这些全新的任务上的表现优于标准机器人。
    • 最显著的提升在于推理能力。就像一个学习了数学原理而非仅仅背诵答案的学生一样,鲁棒型机器人在问题发生变化时,在逻辑和推理任务上的表现显著提升。
    • 他们发现了一个使用“最坏情况”思考程度的“甜点区”(一个被称为 ρ\rho 的参数)。如果让他们过度担心最坏情况,机器人会变得困惑;但如果把握得当,它就会成为处理新情况的冠军。

总结

简而言之,这篇论文教导 AI 模型不要仅仅死记硬背训练数据,而是要理解底层的规则。通过训练它们去预期并处理数据的轻微变化(使用“最坏情况”策略),这些模型在遇到与训练内容不同的现实世界任务时,会变得更加可靠和聪明。

核心要点: 你不仅想要一个知道练习题答案的机器人;你还想要一个即使题目风格改变,也能通过真实考试的机器人。这篇论文展示了如何构建这样一种机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →