← 最新论文
🤖 machine learning

Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning

本文介绍了PROSPER\texttt{PROSPER},这是一种基于博弈论中最大熵布莱克韦尔胜者概念的可证明高效算法,旨在无需标量化即可解决多目标偏好微调中的非传递偏好问题,并在利用多目标评判反馈的大语言模型上展现出卓越性能。

原作者: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何写一个完美的故事。你有一个“裁判”(另一个 AI),它会阅读机器人的故事并提供反馈。通常,我们会要求裁判给出一个单一分数,比如“10 分中的 8 分”。但这里有个问题:裁判经常感到困惑。它可能会说故事 A 比故事 B 好,故事 B 比故事 C 好,但随后又奇怪地说故事 C 比故事 A 好。

这被称为非传递性(或循环)。这就像“石头剪刀布”游戏:石头赢剪刀,剪刀赢布,但布赢石头。不存在单一的“最佳”出招。当这种情况发生时,机器人会感到困惑,因为它不知道应该朝哪个方向学习。

本文介绍了一种新方法,即使裁判不一致且规则复杂,也能教会机器人。

问题:困惑的裁判与“标量”陷阱

通常,当裁判需要检查故事的多个方面(例如:它有趣吗?它安全吗?它符合事实吗?)时,它会试图将所有这些分数合并为一个单一数字。作者称此为标量化

  • 类比:想象你在给一名学生打分。你需要在数学、艺术和跑步方面给他们打分。如果你只是将它们全部加总为一个“总分”,你可能会忽略该学生在数学上是天才但在艺术上很糟糕的事实。如果裁判试图将这些合并为一个数字,它经常会产生那些令人困惑的循环(A > B > C > A),因为它试图强行将方钉敲进圆孔。

解决方案:“最大熵布莱克韦尔赢家”

作者提出了一种寻找最佳机器人策略的新方法,他们称之为最大熵布莱克韦尔赢家(让我们称之为“超级适应型机器人”)。

他们不再问“哪篇故事是绝对最好的?”(这可能根本不存在),而是问:“无论裁判今天决定关注哪条具体规则,哪种机器人策略最难被击败?

  • 类比:想象一位棋手,他不试图在某一种特定的开局招数上做到最好。相反,他的下法确保无论对手是从左侧、右侧还是中心进攻,他都不会惨败。他对对手可能利用的任何特定弱点都具有鲁棒性。这个“超级适应型机器人”就是在最坏情况下获胜次数最多的那个。

算法:PROSPER

为了真正教会机器人成为这种“超级适应型”,作者创建了一个名为PROSPER的算法。

  • 旧方法:通常,要教会机器人应对多个裁判,你必须模拟一个巨大的、混乱的游戏,让机器人与一个试图欺骗它的“反派”对战。这既缓慢又计算成本高昂。
  • PROSPER 方法:作者发现了一个数学技巧。他们意识到,与其与反派进行复杂的博弈,不如直接使用简单的回归(一种数学拟合方法)来训练机器人。
  • 类比:可以这样想:与其雇佣陪练伙伴朝你脸上挥拳来教你如何躲避(这既困难又危险),你只需观看挥拳的视频,并从数学上学习其中的模式。PROSPER 让机器人直接从裁判的反馈中学习,而无需模拟复杂的战斗。它将多人游戏变成了单人作业。

他们做了什么以及发现了什么

该团队在大型语言模型(LLMs)上测试了这种方法,使用的数据集让裁判根据特定的检查清单(评分标准)评估回复。

  1. 现实检验:他们确认,当你要求 AI 裁判分别查看多个不同标准(如安全性、风格和事实)时,它仍然会感到困惑并产生循环。拆分标准有所帮助,但并未完全解决问题。
  2. 结果:当他们使用 PROSPER 训练机器人时,机器人比使用旧方法训练的机器人在遵循指令和自然聊天方面表现得更好。
  3. 证明:他们发布了训练好的机器人(参数量分别为 30 亿和 70 亿),并表明它们在遵循指令和一般对话的标准测试中击败了所有其他方法。

总结

简而言之,当 AI 裁判不一致且对什么是“好”答案感到困惑时,标准的训练方法就会失效。本文指出:“不要试图寻找单一的完美答案。相反,要找到一种策略,它足够稳健,能够应对裁判任何令人困惑的偏好。”他们构建了一个名为PROSPER的工具,可以高效地完成这一任务,将复杂的博弈论问题转化为简单的数学问题,从而产生更智能、更可靠的 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →