Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
本文介绍了 GraphDPO,这是一种直接偏好优化的原则性推广,它利用由多次轨迹生成的完整偏好图来强制传递性并聚合监督信号,从而克服成对方法的局限性,并在推理与程序合成任务中实现更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一位机器人厨师如何烹制完美的菜肴。
旧方法:“双味”测试
传统上,为了训练机器人,你会给它两道菜:一道是它做的(我们称之为“味道 A"),另一道是你做的(或更好的版本,“味道 B")。你会说:“味道 B 比味道 A 好。”机器人从这单次比较中学习。这就像当前的标准方法,称为DPO(直接偏好优化)。
问题在于?在现实世界中,你得到的不仅仅是两道菜。你可能会让机器人烹饪同一道菜五次,得到五个不同的版本:
- 烤焦的吐司。
- 略微未熟。
- 完美金黄。
- 完美金黄(但形状略有不同)。
- 一道完全不同的、奇怪的菜肴。
如果你使用旧的“双味”方法,你必须将这五道菜拆分成对(1 对 2、1 对 3、2 对 3 等)。这会造成混乱。你失去了全局视角。你可能会告诉机器人“完美金黄”比“未熟”好,“未熟”比“烤焦”好,但机器人可能会感到困惑,因为你没有在单一清晰的链条中明确告诉它“完美金黄”比“烤焦”好。这就像试图只通过观察成对的表亲来理解家谱,而忽略了父母和祖父母。
新方法:味道的“家谱”(GraphDPO)
这篇论文的作者提出了一种名为GraphDPO的新方法。他们不再只看成对的菜肴,而是审视机器人所有尝试的整个“家谱”。
图谱(树):他们将所有五道菜排列成一个层级结构。
- “烤焦”和“奇怪”的菜肴位于底部。
- “未熟”的菜肴位于中间。
- 两道“完美金黄”的菜肴位于顶部。
- 关键在于,他们意识到这两道“完美金黄”的菜肴是并列的。它们属于同一个“俱乐部”。机器人不需要因为不知道这两道完美菜肴中哪一道“略微”更好而受到惩罚;它只需要知道这两者都比差的菜肴好。
规则(传递性):系统强制执行一条逻辑规则:如果 A 比 B 好,且 B 比 C 好,那么 A必须比 C 好。旧方法在将事物拆分成对时,往往忽略了这条规则。GraphDPO 将这条规则直接构建到学习过程中,确保机器人的理解从上到下保持一致。
“神谕”锚点:有时,你拥有实际的食谱(即真实情况)。GraphDPO 允许你将这道完美的食谱固定在树的顶端。在训练开始时,机器人被告知:“这是黄金标准,以此为目标!”随着机器人变得更聪明,系统会慢慢放松这种束缚,让机器人自行探索并找到通往顶端的路径,而无需被微观管理。
为什么这更好?
- 消除困惑:它防止机器人因那些实际上并列的事物被强行排序而产生的矛盾指令而感到困惑。
- 高效:尽管它审视整个树状结构,但其速度惊人。它不需要检查每一对菜肴相互之间的对比;它只需查看各个组别。
- 更好的结果:论文在数学问题和编程任务上测试了这种方法。在这些领域,往往存在“正确”和“错误”的答案(就像烤焦与完美的菜肴),GraphDPO 帮助机器人学得更快,并比旧的逐对方法获得更高的分数。
简而言之
这篇论文主张,与其一次向 AI 展示两个选项来教导它,不如向它展示一整批选项,将它们排序成清晰的层级(图谱),并让它一次性学习它们之间的所有关系。这为 AI 创造了一个更稳定、更合乎逻辑且更有效的教师,特别是在答案要么明显正确、要么明显错误的情况下。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。