← 最新论文
💻 computer science

GraphPoint: Semantic Entity Graphs and Point Trajectories for Compositional Robot Manipulation

本文介绍了 GraphPoint,这是一个通过预测夹爪轨迹将语义实体图与几何控制相联系的框架,旨在通过提升机器人操控中依赖指令的泛化能力,并通过旨在测试子任务间及子任务内组合重用的新基准测试 CoMani 进行了验证。

原作者: Kang Luo, Hesheng Wang

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Kang Luo, Hesheng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在研究实验室中,能够拿起杯子或将碗放在桌子上的机器人已变得屡见不鲜,然而当指令发生轻微变化时,这些机器往往会表现得力不从心。一个被训练成将碗放在盘子上的机器人,如果被要求将同一个碗放在盘子的右侧,或者被要求通过“扫过”而非“提起”的方式将其放过去,它可能会失败。发生这种情况是因为目前的许多系统倾向于学习将特定的场景图像与特定的动作进行匹配,而不是真正理解描述动作的文字。当视觉场景看起来很熟悉时,机器人就会依赖这种视觉捷径,从而忽略了新的指令。为了构建能够真正适应环境的机器人,研究人员需要教会它们将物体的含义与其位置分离开来,并理解动作可以如何以新的方式进行组合与匹配。

上海交通大学的一个研究团队开发了一种解决这一问题的新方法,引入了一个名为 GraphPoint 的系统。该系统不再将机器人的视野视为单一、无结构的图像或点云,而是将场景分解为一张由特定角色组成的地图。它将机器人的手、被移动的物体以及目标目的地识别为不同的实体。随后,该系统利用大型语言模型来阅读人类指令,并将其转化为一个结构化的计划,明确定义这些角色应当如何相互作用。例如,如果一个人说“把碗放在盘子上”,系统就会理解碗是被移动的物体,盘子是目标,而动作是放置。至关重要的是,它在内部逻辑中保持了这些角色的独立性,这使得它能够将同样的“放置”逻辑应用于不同的物体或不同的目标,而无需从头开始重新学习整个动作。

研究人员使用他们创建的一套名为 CoMani 的新挑战集对他们的想法进行了测试。这个测试场旨在隔离特定类型的学习。在一组测试中,机器人被要求执行相同的动作(如放下物体),但关于放置位置的指令不同,例如“在盘子上”与“在盘子的右侧”。在另一组测试中,机器人必须使用不同类型的动作,比如通过“扫过”物体而非“提起”物体。最后,他们测试了机器人是否能将几个简单的任务串联成一个从未见过的更长的序列,例如按照特定顺序移动瓶子、碗和奶酪。其目标是观察机器人能否依靠听到的词汇,而非仅仅依靠记忆房间内的视觉模式。

结果显示,GraphPoint 在这些测试中的表现显著优于其他领先的方法。当指令改变了物体间的关系时(例如要求机器人将物品放在右侧而非上方),GraphPoint 在几乎所有案例中都取得了成功,而其他系统往往因为受困于场景的视觉布局而失败。该系统还证明了其学习新动作类型的能力。当被要求旋转一个旋钮时——这是一个它从未展示过的任务——它成功地将“旋转”的概念应用到了一个新的物体上。最令人印象深刻的是,当面对一个从未整体练习过的三步序列时,该系统能够成功完成前两步,成功率超过 80%,并在大约一半的尝试中完成了全部三个步骤。这表明机器人可以将它单独学到的简单技能进行组合,从而遵循复杂的、多步骤的指令。

该系统的成功取决于它处理信息的方式。系统并非根据房间内的绝对位置进行工作,而是描述一切相对于机器人自身手的相对关系。这使得机器人能够理解,无论物体从哪里开始,移动物体“向右”的含义都是一样的。此外,该系统还使用了一种技术,在训练期间暂时隐藏物体的详细形状,从而迫使它关注语言指令和物体的角色,而不是仅仅记忆物体的外观。通过将机器人的动作锚定在角色与关系的语义地图中,研究人员创建了一个即使在视觉场景保持不变时也能对语言变化做出反应的策略。这项工作表明,对于机器人要在动态环境中变得真正有用,它们必须学会将指令作为行动的主要指南,而不是将视觉模式视为唯一的真相来源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →