Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
本文引入了马尔可夫决策竞赛(Markov decision contest)作为一种处理具有成对偏好强化学习的新型框架,证明了平稳马尔可夫策略是最优的,并展示了一种简单的迭代算法在长时程、高维问题上比以往的方法具有更高的学习效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人如何走路,或者如何玩电子游戏。在旧的方法中(称为强化学习),你就像一个拿着计分卡的严厉老师。你会告诉机器人:“如果你迈出这一步,你会得到 +10 分。如果你摔倒了,你会得到 -5 分。”机器人的唯一目标就是让这些分数最大化。
但有时,给机器人一个具体的评分是很困难的。更简单的方法是直接说:“我更喜欢这种走路方式,而不是那种。”也许你并不确切知道为什么一种方式更好,你只是知道你更喜欢它。这被称为成对偏好(pairwise preference)。
问题在于,使用这种“我喜欢这个胜过那个”的比较来教机器人学习的旧方法,只在短时间的游戏中效果良好。如果游戏持续很长时间(比如一个机器人学习走路数小时),旧方法会变得混乱、缓慢且效率低下。此外,它们也无法保证一个简单的、“即时”的决策规则能像一个记住过去发生了一切的复杂规则那样出色。
这篇论文介绍了一种解决此问题的新方法,称为马尔可夫决策竞赛(Markov Decision Contest)。它是如何运作的,我们可以用一些简单的类比来说明:
1. 新的游戏:一场“竞赛”,而非计分卡
与其给机器人一个计分卡,不如想象机器人正在与一个镜像版的自己进行一场比赛。
- 设置: 机器人进行一轮比赛。然后,机器人的一个“克隆体”使用不同的策略进行一轮比赛。
- 裁判: 裁判观察两轮比赛,并说:“我更喜欢第一种,”或者“我更喜欢第二种,”或者“两者相等。”
- 目标: 机器人想要找到一种策略,使得无论它的克隆体使用什么策略,裁判都不会一致地认为克隆体的策略优于机器人的策略。
这就是作者所说的马尔可夫决策竞赛。它将“从偏好中学习”的问题转化为了两个玩家之间的一场公平游戏。
2. 大惊喜:简单即胜利
在许多复杂的游戏中,你可能会认为你需要记住你做过的每一个动作(一种“依赖历史”的策略)才能获胜。但作者证明了令人惊讶的一点:你不需要记忆。
他们证明了“平稳(stationary)”策略——即一种只看当前情况并决定现在做什么,而不必担心过去的策略——实际上与任何记住整个历史的复杂策略一样好。
- 类比: 想象你在下国际象棋。你可能认为你需要记住最后 50 步棋才能做出最好的走法。作者证明了对于这种特定类型的游戏,你只需要观察当前的棋盘就能做出完美的走法。这使得问题变得更容易解决。
3. 高效解决谜题
作者展示了解决这个“竞赛”在数学上是可控的。
- 精确解: 如果问题不是太大,你可以使用标准的数学工具完美地解决它,而且不会耗费太长时间。它处于我们已知可以解决的标准数学问题的同一个“难度等级”。
- 近似解(HPI 算法): 对于巨大的、复杂的问题(如高维机器人控制),他们创建了一个简单的迭代算法,称为对冲策略迭代(Hedged Policy Iteration, HPI)。
- 运作方式: 机器人尝试一种策略,观察它与克隆体的对比,然后稍微调整其策略以在下次做得更好。它不断重复这个过程。
- 结果: 机器人变得越来越好,以可预测的速度收敛到最佳策略。
4. 是否奏效?(实验)
作者将他们的新方法与现有的最优秀的从偏好中学习的方法进行了对比测试。他们使用了一组困难的、长期的机器人控制任务(模拟机器人需要在数千步内完成行走、伸手或奔跑的任务的环境)。
- 结果: 他们的新方法(HPI)比旧方法学得更快、更高效。
- “非传递性”转折: 他们甚至测试了偏好很奇怪的情景。例如:“我喜欢 A 胜过 B,B 胜过 C,但 C 胜过 A”(类似于剪刀石头布)。旧方法在处理这类问题时会挣扎,但新的“竞赛”模型可以自然地处理它。
总结
这篇论文的核心观点是:“不要试图强迫机器人在你只有偏好时去最大化一个复杂的计分卡。相反,让他们进行一场针对自己的‘竞赛’。我们证明了简单的、“即时”的决策足以赢得这场竞赛,并且我们建立了一个快速、可靠的算法来教他们如何做到这一点,即使对于非常漫长且复杂的任务也是如此。”
这对于训练大语言模型(比如你正在与之交谈的这个模型)特别有用,因为在这种情况下,“游戏”(对话或任务)可以持续很长时间,而且通过说“我更喜欢这个答案”通常比分配一个具体的数值要容易得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。