← 最新论文
💻 computer science

FOCI Policy: Focus on Object-Centric Interactions for Relational Manipulation Policies

该论文提出了 FOCI 策略,这是一个以物体为中心的框架,通过将技能抽象为时间紧凑的交互片段以及任务相关物体之间空间不变的相对 SE(3)SE(3) 运动,从而提高了刚性关系操控中的泛化能力和数据效率。

原作者: Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直在努力解决将物体从一个地方移动到另一个地方这一简单行为。虽然它们可以被编程在工厂中执行重复性任务,但要教会它们通过一次注视或简短的演示来应对新情况,仍然是一个深刻的挑战。目前大多数方法试图通过展示如何精确移动自身的手臂和手指来教导机器人,这本质上是在进行一种形式的肌肉记忆训练。这种方法需要海量的数据,通常需要数百次演示,以涵盖物体可能处于的每一种位置或房间可能进行的每一种布置。如果机器人遇到轻微的变化,例如杯子向左移动了几英寸,那些僵化的指令往往就会失效。研究人员现在正在探索一条不同的路径:不再关注机器人的身体,而是教导机器去关注物体本身之间的关系。通过理解牙刷相对于杯子的运动方式,而不是机器人的抓取器如何在空间中移动,系统可能会以更少的精力学会泛化技能。

鲁汶大学(KU Leuven)的一个研究小组开发了一个名为 FOCI Policy 的新框架,将这一理念付诸实践。他们的研究表明,许多复杂的任务是由物体相互作用的短暂、关键时刻所支配的,而其余的动作仅仅是位移过程。想象一下学习如何往玻璃杯里倒水。拿起水壶并走向桌子的过程可以有无数种方式,但水从壶嘴流进杯子的那一刻是受到严格约束的,并且遵循特定的模式。研究人员观察到,如果机器人能够隔离这些短暂且高风险的交互阶段,并忽略掉那些多变且具有噪声的位移时间,它就能更高效地学习任务。他们构建了一个系统,可以自动扫描演示视频,识别出物体何时开始接触或相互影响,并提取出那个特定的片段。

一旦这个关键片段被隔离出来,系统就不会尝试记忆机器人的精确路径。相反,它学习的是两个参与物体之间的相对运动。如果人类演示将酒瓶放入架子中,机器人学习的是酒瓶相对于架子的运动,而不是机器人手臂的运动。这种方法使得技能独立于机器人的特定体型或房间的具体布局。系统随后可以将学到的这种关系应用到新场景中,即使物体的方位发生了变化,或者机器人变成了完全不同的型号。在测试中,研究人员针对每个任务仅用了一次演示来训练该系统。当面对新场景时,机器人成功完成了堆叠酒瓶、拧入钉子或倾倒液体等复杂动作,其表现往往优于那些经过大量数据训练的其他方法。

当视觉条件发生变化时,结果尤其令人瞩目。在一组实验中,研究人员引入了严重的视觉干扰,例如改变光照、添加干扰物体或改变物品的纹理。虽然其他经过百次演示训练的高级系统在这些条件下成功率大幅下降,但这种新方法尽管只使用了十分之一的数据,却保持了与那些经过重度训练的模型相当的性能水平。这表明,通过专注于物体间的几何关系,机器人变得不再那么容易被视觉噪声所迷惑。该系统证明了其稳健性,能够在物理机械臂上处理现实世界的任务,在仅看一次动作后,就能成功完成如清扫灰尘或打开抽屉等任务。

然而,研究人员也谨慎地指出,这种方法并非适用于所有类型的运动。该方法最适用于涉及具有清晰、明确交互阶段的刚性物体的任务,例如将插销插入孔中或将书放在书架上。对于涉及持续接触的任务(如将柔软物体推过桌面),或者对于物体过于微小或被遮挡导致机器人无法可靠判断其位置的情况,该方法的有效性较低。该系统依赖于清晰观察物体的能力;如果机器人无法估算物体的位置,它就无法计算出正确的相对运动。尽管存在这些局限性,这些发现仍为机器人的学习方式提供了一种引人注目的转变。通过剥离关于机器人如何移动的冗余细节,转而关注物体之间本质的“舞蹈”,研究人员展示了机器可以仅用极少量的以往认为必要的数据量来获取新技能。这种效率让我们离这样一个未来更近一步:即机器人可以在几分钟内而非几天内学会新任务,从而快速适应现实世界中不可预测的本质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →