← 最新论文
🤖 AI

Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation

本文介绍了 Robo-Dopamine 2.0,这是一种基于历史条件且具备分布外(OOD)感知能力的过程奖励模型,它利用成对预测、符号进度空间以及符号跳跃(Signed-Hop)课程学习,旨在克服稀疏奖励和静态视觉评估的局限性,从而显著提高视觉-语言-动作模型在机器人操控任务中的鲁棒性和成功率。

原作者: Yijie Xu, Haopeng Jin, Run Zhou, Shengbang Liu, Sixiang Chen, Hongyang Cheng, Sicheng Hu, Peterson Co, Jinwen Luo, Huajie Tan, Shanghang Zhang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijie Xu, Haopeng Jin, Run Zhou, Shengbang Liu, Sixiang Chen, Hongyang Cheng, Sicheng Hu, Peterson Co, Jinwen Luo, Huajie Tan, Shanghang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人模仿人类动作的能力已变得异常出色。通过观看数千小时的演示视频,现代人工智能系统可以学习如何抓取物体、倾倒液体或组装零件,并展现出令人惊讶的灵巧度。这些被称为“视觉-语言-动作模型”的系统,就像是一个完美背诵了教科书的学生。它们知道任务完成得正确时是什么样子的。然而,现实世界的工作很少是一条直线。机器人可能会打滑、抓错物体,或者遇到突然改变的光照或背景。当这种情况发生时,机器人往往会陷入停滞,无法判断自己仅仅是暂停了,还是犯了一个需要采取完全不同策略的错误。核心挑战不仅在于观察世界,更在于理解当下正在发生的故事。为了修复错误,机器人需要一种方法来了解自己已经完成了多少,在哪里出了错,以及如何在面对从未见过的场景时重回正轨。

多年来,研究人员一直试图通过给机器人一个简单的评分来解决这个问题:只有在任务完成后才给予奖励。这就像是告诉一个学生,只有在完成整场考试后才能得到一颗金星,而不会对每个具体问题提供反馈。这使得学习过程缓慢且低效。其他方法尝试提供持续的反馈,但这些方法通常很脆弱,一旦环境发生轻微变化就会失效。一项新研究引入了一种更聪明的引导方式,它更像是一位观察练习过程的资深教练。由北京大学及其他机构的研究团队领导的这项研究,开发了一个名为 Robo-Dopamine 2.0 的系统。该系统不再仅仅关注任务的起点和终点,而是观察整个事件序列,理解前因后果。它学会了区分一个尽管背景杂乱但仍在取得进展的机器人,与一个真正失败的机器人。

这个新系统的核心在于其理解时间和历史的能力。想象一个机器人试图堆叠积木。如果机器人撞倒了一个积木,简单的系统可能只会看到一堆积木,然后认为任务已完成或已失败。但新系统会观察运动的历史轨迹。它知道这堆积木是在特定的动作序列之后出现的,从而能够理解机器人正处于恢复状态,而非单纯的随机失败。研究人员使用大量的成功机器人运动库来训练这个系统,但他们也刻意创造了“假设如果”的情景。他们提取成功的视频,并微妙地改变它们,以展示机器人抓错物体、掉落零件或被障碍物阻挡的情况。通过将这些经过修改的版本与原始的成功版本并列展示,机器人学会了识别无害的变化(如不同的背景颜色)与关键错误(如抓取失败)之间的区别。

这种训练使系统能够构建一个包含成功与失败的进度心理地图。它学会了某些状态是积极的,意味着机器人正在向目标迈进;有些状态是消极的,意味着机器人犯了需要纠正的错误。至关重要的是,它还学会了识别那些看起来不同但实际上进度相同的状态,例如在一个杂乱的房间里工作与在一个整洁的房间里工作的区别。这种处理“分布外”情况(即机器人未被明确训练过的场景)的能力,正是让该系统具有鲁棒性的原因。研究人员通过让系统在模拟环境中引导机器人完成复杂任务,随后在真实的物理机器人上进行测试,验证了这一点。在模拟中,该系统帮助机器人学习新任务的速度显著快于以往的方法。当转移到涉及双臂机器人尝试将正方形木块插入一组插孔的真实实验中时,该系统证明了其价值。如果没有这种新的引导,机器人很难完成这四个连续插入动作的序列。有了这个新系统,机器人在 20 次尝试中成功完成了全套序列 15 次,相比基准方法有了显著提升。

这种方法的成功在于它如何构建学习过程。研究人员并没有将所有数据一次性全部丢给机器人。他们设计了一个课程,首先教机器人识别成功与失败之间巨大的、明显的差异。一旦机器人理解了大体轮廓,系统就会引入更精细的细节,帮助它区分进度中微妙的变化。这种循序渐进的学习,结合回顾近期动作历史的能力,使得机器人即使在情况出错时也能保持清晰的方向感。该系统并不依赖于魔法或复杂且无法解释的规则。它只是提供了一个持续的、细致入微的反馈流,告诉机器人它距离目标有多近,以及它是否正在朝着正确的方向移动。通过赋予机器人更好的自我进度感知能力,这项工作让我们离能够像人类员工一样应对复杂、不可预测的现实世界的机器更近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →