← 最新论文
🤖 AI

Reward Learning through Ranking Mean Squared Error

本文介绍了用于强化学习的排序回报回归(Ranked Return Regression for RL, R4),这是一种利用排序均方误差损失从人类轨迹评分中推断回报函数的创新型回报学习方法,在提供最小性与完备性形式保证的同时,在机器人基准测试中表现出优于现有基于偏好方法的实证性能。

原作者: Chaitanya Kharyal, Calarina Muslimani, Matthew E. Taylor

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaitanya Kharyal, Calarina Muslimani, Matthew E. Taylor

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何走路、跑步或拿起一个杯子。在人工智能的世界里(特别是强化学习领域),机器人通过尝试并根据做得好坏获得积分(奖励)来学习。但问题在于:设计一个完美的积分系统是非常困难的。

如果你告诉机器人,“向前移动就获得积分”,它可能会发现一种通过在地面上扭动腿部来获取积分的方法,而无需真正行走。这被称为“奖励误设”(reward misspecification),就像给学生出一道考试题,他们可以通过背诵答案而不是学习知识来作弊。

旧方法:“更好还是更差?”

为了解决这个问题,研究人员开始寻求人类的帮助。人类不再编写代码,而是观察机器人的动作并说:“那次行走比这一次更好。”这被称为基于偏好的学习(Preference-Based Learning)

把它想象成一场盲测咖啡。你给评委两杯咖啡,并问:“哪一杯更好?”评委选出其中一杯。

  • 问题所在: 这只能给你一个极其微小的信息(一个“是”或“否”)。它并没有告诉你咖啡到底好多少。此外,如果两杯咖啡都很糟糕,评委只能说“它们一样差”,但无法表达出“两者都非常糟糕”。让人类不断进行比较是非常费力的,而且无法捕捉到全貌。

新方法:“给咖啡评分”

一种更新的想法是基于评分的学习(Rating-Based Learning)。与其比较两个事物,不如直接展示给人类看一个事物,并要求他们给出一个分数,比如 1 到 5 星。

  • 优势: 这对人类来说更容易(心理负担较小),且能提供更丰富的信息。1 星评价告诉你会咖啡很糟糕,而 5 星评价则说明咖啡很棒。它捕捉的是“绝对质量”,而不仅仅是“相对质量”。

R4 登场:一位“排名得分”教练

这篇论文介绍了一种名为 R4(用于强化学习的排序回报回归,Ranked Return Regression for RL) 的新方法。把 R4 想象成一位聪明的教练,他使用一种特殊的评分系统来从这些星级评分中学习。

R4 是如何工作的,我们用一个简单的类比来说明:

  1. 设定: 假设你有一堆机器人的行走记录。人类已经对它们进行了评分:“差”、“还可以”和“好”。
  2. 旧方法 (RbRL): 之前的方法试图强迫机器人的内部得分去匹配“好”这个桶里的“精确中间值”。这就像是在说:“如果你被评为‘好’,你的得分必须正好是 75。”这忽略了有些“好”的行走仅仅是勉强及格,而有些则是极其出色。它强迫所有的“好”看起来都一样。
  3. R4 方法: R4 使用了一个巧妙的技巧,叫做排序均方误差(Ranking Mean Squared Error, rMSE)
    • 它不强迫得分去撞某个特定的数字,而是询问:“如果我拿一个‘差’的行走、一个‘还可以’的行走和一个‘好’的行走,你能按顺序排列它们吗?”
    • 它使用了一个特殊的数学工具(一个“软排序器”),这个工具可以由计算机进行调整。它查看机器人对这三次行走的预测得分,并询问:“你是否把‘好’的那次排在了‘差’的那次前面?”
    • 如果机器人排错了顺序,系统会轻轻地推动机器人的“大脑”,使其修正排名。

为什么这更好?

  • 没有人为的界限: 你不需要决定“还可以”在哪里结束以及“好”在哪里开始。你只需要说:“这个比那个好。”
  • 保持多样性: 它允许一个“好”的行走得分为 90 或 95。它不会强迫它们全部变成 85。这保留了表现之间的自然差异。
  • 灵活性: 如果人类想要增加一个新的类别,比如“超级好”,系统也可以处理,而不会崩溃。

证明:理论与现实

作者不仅猜测这行得通,还进行了数学证明。

  • 保证: 他们证明了,如果人类的评分符合逻辑(即“好”的行走确实比“差”的行走要好),那么 R4 保证能找到最符合这些评分的最佳奖励系统。这是解决这个谜题的最有效方式,不会遗漏任何有效的解。

实验:机器人与人类

团队通过两种方式测试了 R4:

  1. 模拟人类: 他们使用计算机程序来模拟人类对机器人行走进行评分。R4 始终比旧方法能更好地教导机器人移动得更快、更好。
  2. 真实人类: 他们雇用了 8 名真实的人在屏幕上对机器人的行走进行评分。
    • 结果: 尽管人类之间存在很大差异(有些人打 4 星,有些人打 12 星;有些人很严格,有些人很宽松),R4 仍然比旧方法能更好地教导机器人运动。
    • 感受: 人类反馈说,对机器人进行评分非常容易,感觉并不费力(低认知负荷)。

总结

该论文认为,R4 是一种更聪明、更灵活且经过数学证明的、利用人类评分来教导机器人的方法。 我们不再强迫人类玩“这个比那个好”的游戏,而是让他们给出简单的评分,然后 R4 利用一种特殊的排序技巧将这些评分转化为机器人的完美老师。它表现得更好,能很好地处理人类的差异性,并且易于人类使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →