← 最新论文
💻 computer science

DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

该论文介绍了 DenseReward,这是一种在由多样化失败模式生成的合成数据集上训练的稠密机器人奖励模型,它通过视觉和语言输入预测细粒度的帧级奖励,以克服稀疏反馈的局限性并改进机器人操控策略。

原作者: Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人把球放入篮筐。在过去,你必须观看整个机器人尝试、失败、再尝试、再失败的完整视频,然后在最后才说:“做得好!”或“做得不好!”这就像是给学生考试,直到他们已经忘记了每一道题之后,才告诉他们最终成绩。机器人完全不知道自己为什么失败,或者在过程中表现如何。

DenseReward 应运而生,它是一个全新的系统,就像一位超级专注的教练,在机器人的每一个动作之后都会低声报出一个分数。它不再是简单的“通过/失败”,而是给出一个 0 到 1 之间的数字,准确地告诉机器人当前距离成功还有多远。

问题所在:“伪失败”陷阱

以这种方式教机器人面临的一个巨大障碍是,你需要一个海量的示例库,展示所有可能出错的情况。你需要看到机器人撞到桌子、掉落球、错过篮筐或卡住。

通常,研究人员试图通过截断成功的视频或假装失败来制造这些“失败”。但本文的作者认为,这就像是通过看一段车停在那里的视频来学习驾驶;它并不能教会你真实的碰撞感。这些“伪”失败无法捕捉到机器人实际掉落物体或撞击墙壁时那种混乱的物理现实。

解决方案:机器人“失败工厂”

为了解决这个问题,团队在计算机模拟中构建了一个自动化工厂。他们没有要求人类手动去破坏物体(这既慢又枯燥),而是编写程序让机器人经历五个特定阶段:接近(Reach)、抓取(Grasp)、抬起(Lift)、移动(Move)和放置(Place)。

随后,他们引入了“针对性扰动”——基本上就是故意给机器人一个轻微的推力,让它出错。

  • 他们让机器人的手瞄准偏移,导致错过(Miss)。
  • 他们让机器人忽略障碍物,导致碰撞(Collision)。
  • 他们在机器人拿着物体时摇晃它,导致掉落(Fall)。
  • 他们甚至让机器人发生碰撞,然后观察它如何重新回到正轨,创造了**恢复(Recover)**场景。

通过这种自动化方式,他们生成了一个包含 27,000 个回合(也就是 2.7 万次!)的数据集,涵盖了所有这些不同的失败方式,并为视频中的每一帧都提供了精确的分数。

核心主角:DenseReward

利用这个庞大的数据集,他们训练了一个名为 DenseReward 的模型。把这个模型想象成机器人的“第六感”,能感知进度。当你给它一个任务(比如“把球放入篮筐”)、一张当前场景的照片以及几张紧接之前的照片时,它能瞬间预测出一个分数。

  • 如果机器人平稳地向篮筐移动,分数就会上升。
  • 如果机器人撞到了桌子,分数就会下降。
  • 如果机器人掉了球但随后又捡了起来,分数会先下降然后再次爬升。

论文显示,该模型的预测能力优于其他智能 AI 模型(如通用视觉语言模型)或旧的奖励系统。在测试中,新模型的平均误差仅为 0.081,而其他模型的误差接近 0.30。这是一个巨大的精度差异。

它真的有效吗?

作者不仅止于做一个优秀的“预测者”,他们还测试了这个“教练”是否真的能帮助机器人更好地学习。

  1. 在模拟器中: 他们使用这些分数来指导模型预测控制(MPC)系统。机器人不再靠猜测下一步动作,而是观察 28 种可能的动作,询问 DenseReward 哪一个看起来最好,然后选择那一个。结果如何?与其它方法相比,机器人更接近目标物体(将平均距离缩减到了约 0.229)。
  2. 在现实世界中: 他们在真实的实验室中使用机械臂手臂,尝试教它叠杯子和把球放入篮筐。在没有密集反馈的情况下,机器人在叠杯子任务中的成功率仅为 40%。但当他们让 DenseReward 指导学习过程时,成功率跃升至 80%。对于把球放入篮筐的任务,成功率从 30% 提升到了 70%。

论文说了什么(以及没说什么)

作者谨慎地指出,虽然这些结果令人印象深刻,但它们是基于特定的模拟和有限的现实任务。他们并不声称这解决了所有机器人问题。他们明确反对“伪”失败(即仅仅剪辑成功的视频)足以应对的情况;他们坚持认为,具备物理真实感的失败数据是必要的。

他们还提出这是一种实用的前进路径,但也承认仍有工作要做。他们计划挑战更难的任务,例如使用工具或执行更长、更复杂的动作序列,并希望最终能引入人类反馈,使奖励更加完善。

简而言之,DenseReward 表明,如果你想让机器人学得更快,你需要一位不仅仅是在比赛结束时才给分的教练,而是一位能在每一步都精准掌握机器人状态的教练——而且这位教练必须见过大量的、真实的、混乱的失败,才能理解什么是真正的“表现出色”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →