← 最新论文
💻 computer science

AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation

AffordTrajDP 是一个通过将检索到的锚点示能(anchor affordance)传播至物体的 SE(3) 位姿,从而生成具有时间一致性且感知状态的引导轨迹,进而增强机器人操纵能力的动态框架,该框架克服了静态示能的局限性,并在精密关键任务中实现了更高的成功率。

原作者: Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在教一个机器人做家务。长期以来,科学家们一直试图通过向机器人展示人类做任务的视频来教导它们,希望机器人能够通过“观察并学习”来掌握技能。但当情况发生变化时,机器人的表现通常非常糟糕。如果你把杯子向左移动三英寸,或者光照发生了变化,一个基于旧设置进行训练的机器人可能会感到困惑,从而掉落杯子。这就像是试图按照一份为特定厨房编写的食谱来烹饪,但随后你却把炉灶移到了另一个房间;原本的指令就不再适用。

为了解决这个问题,研究人员开发了一个聪明的技巧,叫做“示能”(affordance)。把“示能”想象成物体上的一个“魔法高亮”,它能准确地告诉机器人应该在哪里抓取或触摸。机器人不再盯着整个杂乱的房间,而只是注视着那个被高亮显示的点。然而,这里有一个问题:大多数这些高亮显示都是静态的。它们就像贴在移动汽车上的贴纸。如果汽车向前行驶,贴纸会停留在原处的空中,而试图去触摸贴纸的机器人最终会完全错过汽车。这篇论文正是针对这一问题展开研究的:如何让这个“魔法高亮”随着物体一起移动,从而让机器人永远不会失去抓取?

开发 AffordTrajDP(名字很拗口,但可以将其理解为“示能轨迹动态策略”)的研究人员意识到,使用静态高亮是旧方法在处理像插入 USB 驱动器或堆叠积木等复杂任务时失败的主要原因。他们的解决方案是停止将高亮视为一个固定的贴纸,而是将其视为一个移动的目标。

以下是他们的新系统是如何工作的,我们用一个简单的类比来说明:想象你正在尝试接住朋友扔过来的飞盘。

  • 旧方法(静态示能): 你的朋友告诉你:“飞盘会在那棵大橡树那里。”于是你跑向那棵树并等待。但你的朋友把飞盘扔过了那棵树。你站在原地等待一个永远不会到达橡树的飞盘,而真正的飞盘却从你身边飞了过去。这就是机器人使用静态接触点时发生的情况;它根据物体“曾经”所在的位置来计算触摸位置,而不是根据物体“正在前往”的位置。
  • 新方法(AffordTrajDP): 你的朋友不再只给你一个点,而是给了你一条移动路径。“飞盘会在这里,然后到那里,再到那里。”你不仅仅是跑向一个点,而是沿着一条匹配飞盘飞行轨迹的路径奔跑。

在机器人的世界里,这条“路径”被称为动态示能轨迹。系统首先从记忆库中找到一个“源”示例——就像看着一张杯子的照片来寻找抓取手柄的最佳位置。然后,机器人不再仅仅是复制那个点,而是预测物体在接下来的几秒钟内会出现在哪里。它将那个完美的抓取点进行“传播”,使其随着物体的预测运动而向前拖动。这创造了一个每毫秒都会更新的移动指南,确保机器人的手始终与物体对齐,即使物体发生晃动或位移也是如此。

团队通过两种方式测试了这个想法:一种是在名为 ManiSkill3 的超精确计算机模拟中,另一种是在使用实际机器人手臂(Galaxea A1 和 UR7e)的真实世界中。

在模拟实验中,他们向机器人提出了六种不同的挑战,从拿起方块到插充电器。结果显而易见:旧方法(如 DP3 和 AffordDP)的成功率大约在 52.2% 到 57.8% 之间。但有了这个新的动态指南后,成功率跃升至 70.0%。这种提升在最困难的任务中最为显著,例如插入充电器,在这些任务中,旧方法一旦接触到插座,就很难保持插头的对齐。

他们并没有止步于模拟。他们将机器人带到真实的实验室,尝试诸如堆叠方块、拿起杯子以及极具挑战性的适配器插入(将特定的插头插入紧凑的插座)等任务。他们测试了机器人处理见过和未见过的物体(不同形状或颜色)的能力。

  • 在 Galaxela A1 机器人上,新方法在所有任务中的成功率达到了 66.1%,而之前最好的方法仅为 35.0%。
  • 在 UR7e 机器人上,新方法达到了 72.5% 的成功率,击败了之前最好的 55.8%。

研究人员还进行了一项“侦探”实验,以观察系统的哪个部分真正发挥了核心作用。他们尝试拆解这个谜题的各个部分:

  1. 只有路径,没有特定点: 如果他们告诉机器人遵循一条路径,但没有告诉它在物体上的起始位置,机器人就会感到困惑并失败(有时表现甚至比旧方法还差)。
  2. 只有点,没有路径: 如果他们给了机器人完美的抓取点,但没有随着物体的移动而更新它,机器人在接触后就会偏离航线,尤其是在棘手的任务中。
  3. 两者结合: 只有当他们将特定的“触摸位置”与“运动方式”结合在一起时,机器人才能稳定成功。

这表明,对于要在混乱、变化的世界中处理精密任务的机器人来说,它们需要的不仅仅是一个抓取瞬间的快照,更需要一个实时更新的移动路线图。作者指出,虽然他们的方法取得了显著进展,但在处理极高公差的任务(如 USB 插入任务,这是对所有人来说都最难的任务)时仍面临挑战。然而,通过证明动态、移动的指南比静态指南更有效,他们为让机器人不再因计划赶不上变化而“掉链子”开启了一扇新的大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →