← 最新论文
🤖 AI

Distributionally Robust Listwise Preference Optimization

本文提出了一种基于 Plackett-Luce 目标的易处理、分布鲁棒的列表式偏好优化框架,该框架通过将最坏情况修正降低至 O(KlogK)O(K\log K) 的复杂度,从而高效地处理排序标签不确定性,进而提升了在离线和在线语言模型对齐中的鲁棒性与性能。

原作者: Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人写故事、写诗或写代码。为了做好这件事,你需要向它展示人类喜欢的例子。通常,你会给机器人两个选项:“故事 A”和“故事 B”,然后由人类说:“我更喜欢 A。”这被称为**成对(pairwise)**学习。

但在现实世界中,人类经常需要从一整组选项(故事 A、B、C 和 D)中进行选择,并且可能会对它们进行排序。有时,这种排序是混乱的。也许是人类累了,也许是这些故事非常相似,或者使用的评判工具出了错。这就是带有**噪声标签(noisy labels)列表式(listwise)**学习。

这篇论文介绍了一种全新的教学方式,专门设计用于处理这种混乱情况而不至于产生困惑。以下是使用简单类比进行的拆解:

1. 问题所在:“困惑的裁判”

大多数现有方法都假设裁判(人类或奖励模型)是完美的。如果裁判说“A 比 B 好”,机器人就会 100% 地相信这一点。

但如果裁判表现得前后不一怎么办?

  • “难分伯仲”问题: 两个故事如此相似,以至于裁判只能靠抛硬币来决定谁更好。
  • “顶端错误”问题: 裁判不小心把一个糟糕的故事放在了列表的最顶端。
  • “噪声”问题: 用于测量质量的工具产生了随机误差。

如果机器人盲目地从这些带有噪声的列表中学习,它可能会学到错误的教训。

2. 解决方案:“安全网”方法

作者提出了一种名为**分布稳健列表式偏好优化(Distributionally Robust Listwise Preference Optimization)**的方法。让我们来拆解一下:

  • 列表式(Listwise): 机器人不再仅仅观察一对组合(A 对 B),而是同时观察整个列表(A、B、C、D)。
  • 稳健(Robust): 机器人假设裁判可能会犯错。它不仅仅是根据被告知的排序进行学习,它还会追问:“如果裁判犯了错呢?他们原本可能想表达的最坏情况下的排序是什么?”

类比:严厉的教练
想象一位体育教练正在训练一名选手。

  • 旧方法: 教练说:“你跑完这段赛程用了 10 秒。”选手据此进行训练,目标是精准达到 10 秒。如果秒表坏了,实际时间其实是 12 秒,那么选手现在就会感到困惑。
  • 本文的方法: 教练说:“你跑完了这段赛程。秒表显示是 10 秒,但它可能坏了。让我们假设最坏的情况:也许你实际跑了 12 秒。让我们训练你在 12 秒的情况下依然表现出色。”

通过针对“最坏情况”(即最令人困惑或最有噪声的排序)进行训练,机器人变得更加稳定。如果裁判实际上是对的,机器人依然表现出色;如果裁判错了,机器人不会崩溃,它只是表现得没那么完美,但依然保持可靠。

3. 魔法技巧:排序,而非猜测

你可能会想:“如果有 4 个故事,就有 24 种不同的排序方式(4x3x2x1)。检查所有可能性以找到‘最坏’的那一个会耗费太长时间。”

该论文最大的突破在于一个数学捷径
他们发现,要找到“最坏情况”下的排序(即对机器人伤害最大的那个),你不需要检查所有 24 种可能性。你只需要将机器人的当前得分进行逆序排列

  • 类比: 想象你有一副扑克牌。你想知道你能抽到的最差的一手牌是什么。与其把这副牌洗练上百万次来寻找最差的手牌,不如直接看你手里的牌,按从小到大的顺序排列,然后意识到:“哦,最差的手牌就是那些最小的牌被先选中的情况。”
  • 结果: 这将一个极其耗时的任务(检查数百万种组合)变成了一个只需瞬间即可完成的任务(仅仅是对列表进行排序)。这使得该方法足以在真实计算机上快速运行。

4. 结果:更强壮,更聪明

作者通过两种方式测试了他们的方法:

  • 离线测试(图书馆测试): 他们使用了一个排序数据集,并故意搞乱了其中的数据(例如将顶部的故事与一个烂故事互换,或者互换两个相似的故事)。
    • 结果: 当标签是干净时,他们的方法表现得和旧方法一样好。当标签带有噪声时,他们的方法在忽略噪声并学习正确内容方面表现得出色得多。
  • 在线测试(实战练习): 他们让机器人生成自己的故事,并让一个“奖励模型”(AI 裁判)对它们进行排序。
    • 结果: 当故事列表变大(可选选项增多)时,“奖励模型”裁判开始因为不堪重负而出现更多错误。旧方法会被这种现象搞糊涂,而新的“稳健”方法能更好地处理更大的列表,从而造就一个更聪明的机器人。

总结

这篇论文为 AI 提供了一个安全网。与其盲目信任一个选项的排序,AI 会假设这个排序可能略有偏差。它利用一个简单的排序技巧计算出该排序的“最坏情况”版本,并针对这种最坏情况进行训练,以确保即使在那种情况下也能表现良好。这使得 AI 在面对混乱数据时更加可靠,且不会降低运行速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →