← 最新论文
💻 computer science

Position: Good Embodied Reward Models Need Bad Behavior Data

本立场论文认为,具身智能社区必须优先收集并利用“坏”机器人数据——例如失败的、次优的或危险的行为——来训练能够准确符合人类偏好、并避免过度奖励不安全或表面化任务完成情况的奖励模型。

原作者: Ran Tian, Yilin Wu, Andrea Bajcsy

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ran Tian, Yilin Wu, Andrea Bajcsy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人折衣服或倒水。为了教好它,你需要一位“老师”(奖励模型),这位老师在看到机器人的动作后,能说出:“做得好!”或者“不,这搞砸了。”

这篇论文指出,我们目前的机器人老师之所以表现不佳,是因为它们只见过完美的范例。它们从未见过灾难是什么样子的。

以下是使用简单类比对该论文论点的拆解:

1. 问题所在:“完美学生”偏差

目前,当我们训练这些机器人老师时,我们只向它们展示机器人完美完成任务的视频。这就像试图通过只看专业驾驶员在完美天气下的驾驶视频来教学生开车,却从未向他们展示过爆胎、侧滑或险些撞车的场景。

因为老师们从未见过“糟糕”的行为,所以它们过于乐观。

  • 结果: 如果机器人在尝试拿起杯子时撞翻了一个碗,老师可能仍会说:“做得好!你拿起了杯子!”因为它看到了杯子的移动。它忽略了机器人同时也弄坏了其他东西这一事实。
  • 现实情况: 论文测试了三种顶尖的机器人老师。它们都会给那些实际上正在失败、不安全或通过“作弊”来完成任务的机器人打高分。随着任务难度增加(例如使用工具),这些老师的表现变得越来越差,基本上是在随机猜测。

2. 解决方案:我们需要“坏”数据

作者认为,我们不应该丢弃那些“失败”。我们需要收集并分享机器人撞车、掉落物品或动作危险的视频。

可以把这想象成医学院。如果你只研究健康患者,你就无法诊断疾病。你也需要研究病患。

  • 论文的观点: 即便是少量的“坏”数据(机器人失败的视频)也能帮助老师学习哪些行为是不应该被奖励的。
  • 实验过程: 研究人员通过向老师展示一段机器人失败的视频(例如:洒出坚果)以及一段关于错误的文字描述来进行测试。
    • 仅有文字: 帮助不大。老师无法将文字与物理上的混乱联系起来。
    • 文字 + 视频: 在简单任务(如拿起物体)中略有帮助。
    • 文字 + 视频 + “记分卡”: 这种方式效果最好。他们给老师展示了一段失败的视频,加上一份详细的记分卡,展示了视频中机器人是在何时以及为何失败的。这使得老师能够学会即便任务的其余部分看起来还不错,也要在机器人出错的那一刻对其进行惩罚。

3. 为什么我们现在还没有这些数据

你可能会问:“为什么我们不直接记录所有的失败呢?”

  • 障碍: 在数字世界(如文本聊天机器人)中,生成“坏”数据既容易又便宜。你只需要输入乱码即可。
  • 机器人世界: 在现实世界中,机器人是物理实体。让它们失败往往意味着损坏物品、浪费时间或造成安全隐患。此外,大多数机器人实验室都过于专注于展示成功,因此在任何人看到这些“丑陋”的失败视频之前,就把它们删除了。

4. 行动呼吁

作者要求机器人界落实四项具体行动:

  1. 发布“坏”数据: 不要隐藏失败。实验室和公司应该像分享成功案例一样,分享机器人撞车、掉落物品或动作不安全的数据库。
  2. 伪造失败(合成数据): 由于真实的碰撞成本高昂,我们需要更好的计算机模拟技术,以生成更真实的“如果……会怎样”的失败场景(例如:“如果机器人在这里打滑会怎样?”)。
  3. 去中心化测试: 我们不应该只由一个实验室来测试机器人,我们需要许多不同的场所,在现实世界的条件下进行测试,以捕捉更多类型的失败。
  4. 更好的老师测试: 我们需要新的基准测试来测试“老师”本身,确保它们确实在从人类反馈中学习,而不仅仅是在瞎猜。

总结

论文认为,要构建可靠的机器人,我们必须停止将“失败”视为应被隐藏的错误。相反,我们必须将失败数据视为一种至关重要的资源。如果看不见“坏”行为,我们的机器人老师就会一直给危险或草率的机器人打高分,认为它们做得非常出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →