← 最新论文
📊 statistics

Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning

本文介绍了相似性作为奖励对齐(Similarity as Reward Alignment, SARA),这是一种用于基于偏好的强化学习的鲁棒对比框架,该框架通过学习潜在表示来将奖励计算为相似性,并在连续控制基准测试中证明了其相比基线模型具有更优越的稳定性和噪声抗性。

原作者: Sara Rajaram, R. James Cotton, Fabian H. Sinz

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Sara Rajaram, R. James Cotton, Fabian H. Sinz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何走路、跳舞或烹饪美食。在人工智能的世界里,这被称为强化学习(Reinforcement Learning)。通常情况下,机器人通过尝试并获得来自人类程序员的得分或“奖励”来学习。如果机器人做得好,它会得到一分;如果它摔倒了,就会失去一分。但问题在于:编写一个完美的评分系统是非常困难的。这就像是试图编写一本关于“好厨艺”的规则手册,既要涵盖厨师可能犯下的每一种错误,又不能误导他们把房子烧掉。

为了解决这个问题,科学家们开发了一个聪明的捷径,叫做基于偏好的强化学习(Preference-based Reinforcement Learning, PbRL)。他们不再编写规则手册,而是让人们观察两个不同的机器人尝试,然后说:“我更喜欢这一个,而不是那一个。”机器人随后会努力弄清楚是什么让“好”的那一个更好的隐藏规则。比起写一份关于究竟有多少奶酪才算完美的说明书,说“我更喜欢这个披萨”要容易得多。然而,这里有一个大问题:人类并不完美。我们会疲劳,会困惑,有时也会犯错。如果机器人向一个经常出错的老师学习,它可能会学得笨拙或者危险。这篇论文探讨了在面对偶尔出错的人类教师时,教导机器人所面临的复杂现实。

这项研究背后的研究人员 Sara Rajaram、R. James Cotton 和 Fabian H. Sinz 注意到,目前大多数通过人类偏好教导机器人的方法都依赖于一种特定的数学技巧,叫做 Bradley-Terry 模型。你可以把这个模型想象成一个严格的裁判,他只关心一对一的比赛。如果你告诉裁判:“机器人 A 比机器人 B 好,”裁判就会假设这是绝对的事实,并据此调整机器人的大脑。但如果你只是在瞎猜呢?或者如果你累了,选错了呢?旧的模型将每一个错误都视为事实,这会让机器人感到困惑,并在人类教师失误时导致其表现极差。

为了解决这个问题,团队引入了一种新方法,称为 SARA(相似性作为奖励对齐)。SARA 不再像那个只看两两对比的严格裁判,它更像是一位睿智的艺术评论家,审视着一整座画廊。SARA 不仅仅一次比较两个机器人,它会观察人类喜欢的所有“好”示例,并寻找让它们变得特别的共同模式。它创造了一个关于完美表现的心理“指纹”。然后,当机器人尝试新动作时,SSA 会问:“这个看起来有多像我们的指纹?”如果它看起来很相似,机器人就会获得奖励;如果它看起来不同,就会得到较低的分数。

SARA 的精妙之处在于它忽略了噪声。如果一个人不小心说了一个糟糕的表现是“好”的,SARA 不会惊慌。因为它已经观察了许多其他的“好”示例,它会意识到这一个坏例子并不符合其余例子的模式。这就像一位音乐老师,听过成千上万首完美的钢琴曲;如果一个学生弹奏了一首带有错音的曲子,而老师却不小心鼓掌了,老师的大脑会知道:“等等,这听起来不像其他的优秀乐曲,”从而不会让学生认为自己表现得很好。

团队在各种机器人任务上测试了这个想法,比如让一个虚拟的跳跃器(hopper)跳跃或让一个步行器(walker)向前移动。他们故意搞乱了人类的反馈,将错误的反馈率设定在 0% 到 40% 之间。在这些测试中,旧的方法(那些严格的裁判)随着误差的增加而开始崩溃,在某些任务上的表现下降了多达 73%。然而,SARA 却保持了稳定。即使在人类反馈存在噪声的情况下,SARA 的机器人依然表现良好,展示出了相对于旧方法具有统计学意义的显著改进。

研究人员还检查了 SARA 对任务真实目标的理解程度,而不仅仅是人类所说的话。他们发现,SARA 计算出的奖励与环境的实际物理特性更加一致,而旧方法计算出的奖励则不然。这表明 SARA 更擅长过滤掉人类的困惑,并找到隐藏在底层的真正“好”的行为。

简而言之,这篇论文表明,在利用人类反馈教导机器人时,寻找许多示例中表现出的“氛围”(vibe),比纠结于每一次细微的比较更为有效。通过使用一种从一组“好”示例的集体智慧中学习,而非仅仅通过两两对抗的方法,SARA 让机器人对人类的错误更加具有鲁棒性。这并不意味着人类教师必须完美;它意味着机器人足够聪明,能够识别出老师什么时候状态不佳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →