← 最新论文
🤖 machine learning

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

本文介绍了 Robometer,这是一种可扩展的奖励建模框架,它结合了帧级进度监督与轨迹比较偏好学习,并在大规模 RBM-1M 数据集上进行训练,以从多样化的专家轨迹和次优轨迹中有效学习可泛化的奖励函数。

原作者: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Ste
发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做晚饭。过去,要教这个机器人,你必须充当一位严厉的裁判,监视它每一个动作的每一秒,并为其切洋葱的表现赋予精确的分数(例如“10 分中的 7.5 分”)。如果机器人掉了刀,你就必须确切地判断分数是在何时下降的,以及下降了多少。这极其困难,尤其是在机器人失败时,这意味着你无法利用机器人在现实世界中成千上万次“失败”的尝试,因为它们太混乱而无法评分。

ROBOMETER 是一个新系统,它通过采用更智能、更像人类的评分方式,改变了我们教机器人的方法。

核心理念:比较而非评分

ROBOMETER 不再试图为每一个瞬间给出完美分数,而是通过比较同一任务的两次不同尝试来学习。

这就像选秀节目的评委。评委不再给参赛者打出 8.2 分(满分 10 分),而是直接观察两场表演,然后说:“表演 A 明显优于表演 B。”

  • 旧方法:你必须看着机器人把杯子放到桌子上的失败过程,并试图计算出这次失败究竟有多“糟糕”。
  • ROBOMETER 方法:你向机器人展示一段人类完美完成该动作的视频,以及一段机器人打翻杯子的视频。系统会学习:“人类视频更好。”它不需要知道为什么,也不需要给出具体数字;它只需学习“好”与“坏”的顺序。

“错误巨库”(RBM-1M)

为了训练这个系统,研究人员建立了一个名为RBM-1M的巨大图书馆。

  • 旧问题:大多数机器人训练库只包含“完美”的视频。如果机器人打翻了杯子,那段视频就会被扔进垃圾桶,因为它难以评分。
  • 新方案:这个图书馆包含来自 21 种不同类型机器人(从单臂到人形手)的100 万段视频。关键在于,它充满了错误、失败和笨拙的尝试。因为 ROBOMETER 是通过比较来学习的(例如“这次失败的尝试比那次成功的尝试更差”),它实际上可以这些被丢弃的失败视频堆中学习。它将失败视为关于该做什么的宝贵教训。

工作原理(两步舞)

ROBOMETER 同时使用两种特定技巧进行学习:

  1. “进度”检查:它观看单段视频,并尝试猜测:“这个任务进行到哪个阶段了?”(0% 到 100%)。这为机器人对时间和进度的理解提供了锚点。
  2. “偏好”检查:它并排观看两段视频,并决定:“哪一段更好地完成了任务?”这教会机器人理解动作的质量,即使该动作是完全失败的。

通过结合这两者,机器人学会了一种对成功的“感觉”,即使面对它从未见过的机器人,或在它从未进入过的房间,这种感觉依然有效。

实际成效(已验证的结果)

该论文表明,该系统在四个具体的现实场景中比之前的方法表现更好:

  1. 自动在线学习:当机器人在实时学习任务(如将碗放在桌子上)时,ROBOMETER 充当教练,立即告诉机器人“你做错了”,并引导其修正错误。在杂乱的厨房环境中,它帮助机器人将成功率从20% 提升至 85%,而旧方法则停滞在 55%。
  2. 从混乱数据中学习(离线强化学习):如果你拥有一组混合了完美视频和混乱失败视频的数据,ROBOMETER 可以从中筛选出内容来训练新机器人。与最佳先前的工具相比,它将成功率提高了2.4 倍
  3. 发现优质内容(数据过滤):想象你有一大堆视频片段,需要找出其中最好的 10 个来教机器人如何“搅拌锅”。与其他搜索工具相比,ROBOMETER 能更好地找到相关且成功的片段,并忽略失败片段。这使得机器人学习该任务的能力提高了4.5 倍
  4. 识别失败:如果机器人陷入停滞、振荡(来回晃动却未移动)或掉落物体,ROBOMETER 可以立即检测到这种失败,而无需被告知失败长什么样。它在**81%**的案例中正确识别了失败,优于其他系统。

总结

ROBOMETER 是一个“通用奖励模型”,它不再需要人类为机器人工作的每一秒进行评分。通过利用包含成功与失败的大规模图书馆来学习比较“更好”与“更差”,它帮助机器人学得更快、更好地处理错误,并能适应新任务和新机器人本体,而无需从头开始重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →