A Regret Minimization Framework on Preference Learning in Large Language Models
本文介绍了一种名为基于遗憾的偏好优化(RePO)的新型框架,该框架通过遗憾最小化重新构建了来自人类反馈的强化学习,以更好地捕捉人类偏好的前瞻性和反事实特性,从而在推理和偏好基准测试中实现了持续的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人解决数学题或写一封得体的邮件。你希望机器人能从人类的反馈中学习,但人类通常不会说:“这句话值恰好 7.5 分。”相反,我们会说:“我更喜欢这个答案,而不是那个。”
长期以来,计算机科学家一直试图教机器人通过最大化分数来学习。他们把机器人的每一步行动都当作是在赚取即时积分,就像在电子游戏中收集金币一样。如果机器人的某一步做对了,它就得到一枚金币;如果做错了,它就会失去一枚金币。机器人的目标仅仅是尽可能多地抓取金币。
“集金币者”方法的缺陷
论文指出,这种“集金币者”的心态实际上是理解人类思维的一种错误方式。人类并不仅仅关注眼前的步骤;我们会向前瞻,也会向后看那些“本可以发生”的情况。
作者使用了一个极佳的比喻:“如果……会怎样”游戏(The "What If" Game)。
想象你正在观看一场国际象棋比赛中的一步棋。
- 旧方法(奖励最大化): 你只看那一步棋本身。它吃掉了对方的棋子吗?如果是,很好;如果不是,不好。你是在孤立地评价这一步。
- 新方法(遗憾最小化): 你看着这一步棋,并追问:“如果他们刚才在这里走了另一条路,局面会不会更好?”或者,“如果他们一直这样下下去,会在 10 步之后获胜吗?”
人类很难孤立地判断一个步骤。我们是基于前瞻性预期(我们认为接下来会发生什么)和反事实比较(他们原本还可以怎么做)来做出判断的。
论文的解决方案:“基于遗憾的偏好优化”(RePO)
作者引入了一种新方法,称为 RePO。RePO 不再试图最大化分数,而是教机器人最小化遗憾。
把“遗憾”(Regret)想象成当你感叹“我早知道该走另一条路,那样就能避开堵车了”时的那种感觉。
- 在旧方法中,机器人只关心它现在走的这条路是否顺畅。
- 在新方法(RePO)中,机器人会问:“与我本可以采取的最佳路径相比,我搞砸了多少?”
用通俗易懂的话解释其原理
- 向前看: 当人类看到一个部分答案(比如数学题解题过程的前半部分)时,他们会在脑海中完成整个题目。如果他们认为“噢,这条路径最终会导致错误答案”,那么即使前半部分看起来没问题,他们也会不喜欢这个过程。RePO 通过模拟未来来模拟这一点,观察当前的步骤是否会导致死胡同。
- 比较替代方案: 人类经常通过将一个行动与一个并未发生的“更好版本”进行比较来做出判断。RePO 计算了机器人所做的行为与“完美机器人”所做行为之间的“距离”。它的目标是缩小这个差距。
- “遗憾”得分: 不同于给出一个表示“好”的正分,RePO 计算的是一个“遗憾”得分。目标是让这个遗憾值尽可能接近于零。如果遗憾值很高,意味着机器人做出了一个导致结果比原本可选方案更差的选择。
为什么这很重要(根据论文所述)
研究人员在数学问题和通用对话任务上对该方法进行了测试。他们发现,使用 RePO 训练的机器人更擅长:
- 解决数学问题: 它们明白,只有当一个步骤能导向正确的最终答案时,这个步骤才是“好”的,而不仅仅是看这个步骤本身看起来是否合乎逻辑。
- 符合人类品味: 它们能更好地与人类偏好保持一致,因为它们不再试图通过追求即时积分来“钻空子”,而是开始思考整个旅程,就像人类思考那样。
“魔术技巧”(样本效率)
其中一个最酷的发现是 RePO 在学习方式上更加“聪明”。
- 旧方法 (DPO): 如果你向机器人展示一个被遮掩(掩码处理)的数学问题,机器人会感到困惑并表现不佳。它需要反复看到完整的正确答案才能学会模式。
- 新方法 (RePO): 由于 RePO 是建立在“遗憾”(思考“如果……会怎样”)的概念之上的,它天生就能理解隐藏的答案是可疑的。它不需要过多的额外训练来弄清楚不完整的路径是糟糕的。它“内化”了这样一个教训:“如果你看不见终点线,那你可能走错路了。”
总结
论文的核心观点是:不要再把机器人教成只关心下一步的贪婪集金币者了。相反,要教它们成为具有反思能力的旅行者,去询问:“我是否走了最好的路?与那条未选之路相比,我对自己的选择有多少遗憾?”通过这样做,机器人将具备更好的推理能力,并且能更好地与人类的思维方式保持一致。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。