MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference
MemCorr-DP 是一种扩散策略,通过将 2D 特征匹配提升为与参考轨迹的显式 3D 关系,并利用反事实调节来使几何结构与当前场景对齐,从而增强了在复合空间和视角偏移下的视觉运动鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
通过观察人类执行任务来学习的机器人正变得越来越普遍,但它们面临着一个顽固的局限:一旦世界发生轻微变化,它们往往就会失败。如果一个机器人学会了在原地站立时开门,那么如果门移动了几英寸,或者观察场景的摄像机角度发生了偏移,它可能会变得困惑。这是因为许多机器人控制器依赖于记忆特定的视觉模式,例如图像特定角落里门把手的确切形状,而不是理解交互背后的底层几何结构。当场景发生变化时,熟悉的模式消失了,机器人的计划也就崩溃了。为了构建能够真正适应环境的机器,研究人员正在探索如何教机器人关注物体与其自身运动之间的空间关系,而不仅仅是屏幕上的像素。这种方法旨在创造一种“肌肉记忆”的形式,即无论物体位于何处或摄像机如何观察,都能理解机械臂抓取器相对于物体的运动方式。
在一项新的研究中,研究人员开发了一个名为 MemCorr-DP 的系统,该系统通过教机器人将其动作与记录的成功案例进行对齐来解决这个问题,即使场景看起来非常不同。其核心思想简单而强大:机器人不是试图记住成功尝试的外观,而是学习将其当前情况的物理几何结构与保存的成功轨迹的几何结构进行匹配。想象一下机器人尝试开门的场景。研究人员为它提供了一段成功的开门视频。当机器人在新位置以不同的摄像机角度尝试执行任务时,它使用视觉匹配系统来寻找实时视图与记录视频中门和机器人手部的对应点。随后,它将这些匹配点提升到一个共享的三维空间中,从而创建一个描述机器人手相对于门的位置、以及记录中手在同一时刻相对于门的位置的关系集合。这使得机器人能够看到,尽管门在不同的位置,但手与把手之间的物理关系是相同的,因此它可以继续执行正确的动作。
研究人员在模拟任务中测试了该系统,该任务要求机器人打开并关闭一扇门。他们刻意增加了任务难度:将门移动到超出机器人训练期间所见范围很远的位置,并将摄像机角度偏移了十五度。在这些具有挑战性的条件下,新系统的成功率达到了 96.67%。相比之下,依赖纯视觉图像(没有这种几何匹配)的标准机器人控制器成功率仅为 88%。这种差异看似微小,但在机器人领域,12% 的失败率与 3% 的失败率之间代表着巨大的可靠性差距。研究表明,该系统的成功高度依赖于使用点与点之间的完整三维关系。当研究人员剥离了详细的点对点匹配,转而使用更简单的信息(例如仅使用门的中心或运动的一般方向)时,成功率显著下降。这证明了机器人需要匹配系统提供的精确空间图谱才能应对剧烈的偏移。
为了确保机器人确实是在遵循参考视频的指令而非仅仅在猜测,研究人员引入了一种巧妙的训练方法。他们通过给机器人完全相同的起始位置和带有噪声、不确定性的输入,但要求它根据两个不同的参考视频预测两种不同结果的操作,从而教机器人区分开门和关门。如果当参考内容改变时,机器人无法区分开门和关门,说明它并没有学到正确的教训。这种“反事实”训练迫使系统必须密切关注参考轨迹的具体细节。结果显示,当机器人被给予错误的参考视频时,它会尝试错误的动作,这证明它确实是在响应参考资料提供的引导,而不是依赖于预先习得的习惯。
该研究还考察了系统处理视觉匹配过程中误差的能力。在现实世界中,在两个不同图像之间匹配点绝不会是完美的;总会存在一些微小的误差。研究人员发现,即使匹配并不完美,他们的系统依然保持稳健,即使计算出的位置偏差了几厘米,仍能保持较高的成功率。这种韧性表明,该系统不需要像素级的精准对齐即可运行;它只需要一个足够好的三维关系近似值来引导机器人的动作。研究人员指出,虽然该系统在模拟实验中表现良好,但尚未在实体机器人或不同类型的任务上进行测试。评估过程局限于单个门实例以及特定类型的运动和摄像机偏移。然而,结果提供了强有力的证据,证明显式地对机器人、物体与参考示例之间的三维关系进行建模,是创造能够将技能泛化到新且不可预测环境中的机器人的一个充满希望的方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。