在研究实验室中,能够拿起杯子或将碗放在桌子上的机器人已变得屡见不鲜,然而当指令发生轻微变化时,这些机器往往会表现得力不从心。一个被训练成将碗放在盘子上的机器人,如果被要求将同一个碗放在盘子的右侧,或者被要求通过“扫过”而非“提起”的方式将其放过去,它可能会失败。发生这种情况是因为目前的许多系统倾向于学习将特定的场景图像与特定的动作进行匹配,而不是真正理解描述动作的文字。当视觉场景看起来很熟悉时,机器人就会依赖这种视觉捷径,从而忽略了新的指令。为了构建能够真正适应环境的机器人,研究人员需要教会它们将物体的含义与其位置分离开来,并理解动作可以如何以新的方式进行组合与匹配。
上海交通大学的一个研究团队开发了一种解决这一问题的新方法,引入了一个名为 GraphPoint 的系统。该系统不再将机器人的视野视为单一、无结构的图像或点云,而是将场景分解为一张由特定角色组成的地图。它将机器人的手、被移动的物体以及目标目的地识别为不同的实体。随后,该系统利用大型语言模型来阅读人类指令,并将其转化为一个结构化的计划,明确定义这些角色应当如何相互作用。例如,如果一个人说“把碗放在盘子上”,系统就会理解碗是被移动的物体,盘子是目标,而动作是放置。至关重要的是,它在内部逻辑中保持了这些角色的独立性,这使得它能够将同样的“放置”逻辑应用于不同的物体或不同的目标,而无需从头开始重新学习整个动作。
研究人员使用他们创建的一套名为 CoMani 的新挑战集对他们的想法进行了测试。这个测试场旨在隔离特定类型的学习。在一组测试中,机器人被要求执行相同的动作(如放下物体),但关于放置位置的指令不同,例如“在盘子上”与“在盘子的右侧”。在另一组测试中,机器人必须使用不同类型的动作,比如通过“扫过”物体而非“提起”物体。最后,他们测试了机器人是否能将几个简单的任务串联成一个从未见过的更长的序列,例如按照特定顺序移动瓶子、碗和奶酪。其目标是观察机器人能否依靠听到的词汇,而非仅仅依靠记忆房间内的视觉模式。
结果显示,GraphPoint 在这些测试中的表现显著优于其他领先的方法。当指令改变了物体间的关系时(例如要求机器人将物品放在右侧而非上方),GraphPoint 在几乎所有案例中都取得了成功,而其他系统往往因为受困于场景的视觉布局而失败。该系统还证明了其学习新动作类型的能力。当被要求旋转一个旋钮时——这是一个它从未展示过的任务——它成功地将“旋转”的概念应用到了一个新的物体上。最令人印象深刻的是,当面对一个从未整体练习过的三步序列时,该系统能够成功完成前两步,成功率超过 80%,并在大约一半的尝试中完成了全部三个步骤。这表明机器人可以将它单独学到的简单技能进行组合,从而遵循复杂的、多步骤的指令。
该系统的成功取决于它处理信息的方式。系统并非根据房间内的绝对位置进行工作,而是描述一切相对于机器人自身手的相对关系。这使得机器人能够理解,无论物体从哪里开始,移动物体“向右”的含义都是一样的。此外,该系统还使用了一种技术,在训练期间暂时隐藏物体的详细形状,从而迫使它关注语言指令和物体的角色,而不是仅仅记忆物体的外观。通过将机器人的动作锚定在角色与关系的语义地图中,研究人员创建了一个即使在视觉场景保持不变时也能对语言变化做出反应的策略。这项工作表明,对于机器人要在动态环境中变得真正有用,它们必须学会将指令作为行动的主要指南,而不是将视觉模式视为唯一的真相来源。
技术摘要:GraphPoint
问题陈述
机器人操控策略往往难以泛化到其特定的训练演示之外,即使新的指令涉及熟悉的物体和行为。当语言与视觉场景在训练期间具有强相关性时,策略倾向于学习固定的视觉-动作映射(捷径),而非响应请求的行为。这种局限性体现在两种形式的组合泛化中:
- 子任务内泛化(Within-subtask generalization): 在单个原子交互中,以新方式重新组合熟悉的语义因子(实体、动作类型和修饰符)的能力。
- 跨子任务泛化(Across-subtask generalization): 在没有显式序列级演示的情况下,重用已学习的原子子任务来执行未见的长程指令的能力。
现有的方法(包括基于图像、场景点和实体点的策略)虽然提高了在已演示任务上的性能,但在熟悉的实体与新的动作修饰符或动作类型配对时,或者在必须动态管理子任务转换时,仍表现挣扎。
方法论:GraphPoint
作者提出了 GraphPoint,一个将语义实体图与几何控制相连接的框架。其核心思想是将当前的操控状态表示为语义实体图,使受指令驱动的关系变得显式,而不是依赖于隐式的视觉相关性。
- 任务到图的构建(Task-to-Graph Construction): 大语言模型(LLM)将自然语言指令解析为有序的子任务图。每个子任务定义了语义角色:执行者(Actor, A)、受体(Patient, P)和目标(Target, T)。这些角色由学习到的嵌入表示。动作类型和修饰符使用冻结的语言编码器(BGE)进行编码,并进行投影以调节策略。
- 具身点实体(Grounded Point Entities): 视觉定位(使用 VLM)和时间追踪(使用 SAM 2)识别任务相关的物体。它们被表示为相对于当前工具中心点(TCP)的稀疏 3D 点云(每个实体 32 个点)。执行者(夹爪)由六个几何关键点表示。
- 角色结构化实体图编码器(Role-Structured Entity Graph Encoder): 编码器处理实体点,使用共享的 MLP,并在局部编码(实体内部)与全局交互(实体之间)之间交替进行。
- 相对坐标: 所有点都相对于 TCP 表示,减少了对绝对场景位置的依赖。
{({ A \leftrightarrow P \leftrightarrow T$ }) 强制执行特定的“受体中介”交互链,屏蔽直接的执行者-目标注意力,以鼓励通过被操作的物体进行交互。
- 角色感知点塌陷(Role-Aware Point Collapse, RPC): 在训练期间,受体或目标的点集会被随机塌陷为其质心,以防止模型依赖基于形状的捷径,从而迫使其依赖语义条件。
- 点-轨迹流策略(Point-Trajectory Flow Policy): 策略通过条件流匹配预测未来的夹爪点轨迹(10 步)和夹爪命令。轨迹是在 TCP 相对坐标系下预测的。通过将预测的关键点与机器人的几何结构进行最小二乘刚性对齐,恢复可执行位姿。
- 长程组合(Long-Horizon Composition): 进度头根据受体与目标之间的关系估计子任务完成情况。这实现了“自我切换”(Self-Switching, SS),即系统根据预测的进度而非外部信号推进到下一个子任务,从而允许单个原子策略在整个序列中被重用。
基准测试:CoMani
为了严格评估这些能力,作者引入了 CoMani,一个具有受控拆分的基准测试:
- CoMani-Mod: 测试修饰符泛化(例如,“在……之上”与“在……右侧”),保持动作类型固定。它使用匹配的初始场景,以确保失败是由于关系理解问题而非视觉捷径。
- CoMani-Act: 测试动作类型泛化(例如,“放置”与“扫过”与“旋转”),保持修饰符固定。它评估动作一致成功率(ACSR),以确保机器人执行的是被指令的动作,而不仅仅是到达目标。
- CoMani-Seq: 通过将原子子任务链接为 3 步指令来测试序列组合,且无需序列级的训练数据。
关键结果
在 CoMani 上的实验表明,GraphPoint 优于多种基线方法(包括 ACT、Diffusion Policy、DP3、Point Policy 和 CbF):
- 修饰符泛化: GraphPoint 实现了 96.4% 的平均成功率(SR)(在分布外任务上为 80.0%),显著优于经常无法泛化到留出修饰符的基线模型。
- 动作泛化: GraphPoint 在留出的动作上获得了最高的动作一致成功率(ACSR),包括将“旋转”动作迁移到新的实体(奶油奶酪)上,而其他方法在此完全失败。
- 序列组合: GraphPoint 是唯一能够执行未见 3 步序列的方法。使用环境切换(ES)时,它在头两个子任务上实现了 82.5% 的 SR,对于完整序列实现了 50.8% 的 SR。使用自我切换(SS)时,它实现了 95.0% 的 SR2 和 67.5% 的 SR3。基线方法很少能完成前两步。
- 消融研究: 移除角色感知点塌陷(RPC)或使用绝对坐标会大幅降低 OOD 性能,证实了语义正则化和相对坐标系的必要性。移除语言调节会将 OOD 成功率从 80% 降至 8.3%。
意义与主张
论文声称 GraphPoint 成功解决了原子级和序列级的指令依赖型泛化问题。通过围绕语义角色构建策略,并将交互调节在语言衍生的修饰符和动作类型上,该框架避免了困扰标准模仿学习的视觉捷径。使用语义实体图使得机器人可以根据指令对同一个视觉场景进行不同的解释,而预测的进度机制使得将学习到的技能组合成复杂的、未见的任务成为可能。作者指出,目前的局限性在于前端感知(解析、定位、分割)以及严重的遮挡问题,后者可能会破坏被追踪的实体点。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。