← 最新论文
💻 computer science

SemAnCorr: Semantic Anchored Correspondence for Zero-Shot Manipulation Skill Transfer

SemAnCorr 是一个无需训练的框架,它通过联合位姿-对应关系优化与泛函映射传播,建立起稠密、语义一致且几何连贯的对应关系,从而实现了跨越几何多样性物体的鲁棒零样本操纵技能迁移。

原作者: Xiaoxiang Dong, William Baron, Hongyi Chen, Uksang Yoo, Jeffrey Ichnowski, Weiming Zhi

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoxiang Dong, William Baron, Hongyi Chen, Uksang Yoo, Jeffrey Ichnowski, Weiming Zhi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个已经学会如何打开特定水瓶的机器人。它确切地知道在哪里抓取瓶盖、需要旋转多少度以及何时停止。现在,想象把同一个机器人交给一个全新的、具有不同形状、不同瓶盖尺寸和不同纹理的水瓶。这个机器人能否在无需重新训练的情况下,利用它在第一个水瓶上学到的知识来打开第二个水瓶?这就是机器人领域“零样本”(zero-shot)学习的终极目标:将一项技能从一个外观不同但功能相同的物体上迁移过来的能力。

为了实现这一点,机器人需要一张被称为“对应”(correspondence)的心理地图。你可以把它想象成一个翻译官,它会说:“这个杯子的把手对应那个杯子的把手,”或者“这把剪刀的顶端对应那把老虎钳的顶端。”但棘手之处在于,机器人需要两样东西才能协同工作。首先,它需要知道“什么是哪个部分”(语义含义)。其次,它需要知道表面的曲线和弯曲程度,以便确定抓取的精确角度(几何连贯性)。如果机器人只知道“这是把手”,却不理解其形状,它可能会像对待平面把手一样去抓取一个弯曲的把手,从而导致机器人打滑或损坏物体。

这正是由一篇介绍 SemAnCorr(语义锚定对应)的新论文所解决的问题。研究人员发现,虽然以往的方法擅长寻找“是什么”(语义部件),但往往在“如何做”(平滑的几何形状)方面表现不佳,导致机器人的动作笨拙。他们的解决方案是一个巧妙的、无需训练的框架,其作用就像一位高级裁缝。SemAnCorr 不仅仅是随机匹配像素或点,它首先识别出关键的“锚点”区域——例如杯子的把手或剪刀的刀片——这些区域在语义上是重要的。然后,它在整个物体表面拉起一张平滑的、无形的网(一种被称为“泛函映射”的数学工具),确保两个物体之间的连接不仅在逻辑上是正确的,而且在物理上也是平滑且连续的。

论文表明,通过将这些语义锚点与这种平滑的几何拉伸相结合,机器人可以更可靠地迁移操作技能。在测试中,这种新方法实现了 90.8% 的语义准确率,击败了之前的先进技术。更重要的是,当研究人员在真实机器人执行剥香蕉、开笔盖或从水壶倒水等任务时,新方法成功的频率显著高于旧技术。例如,在扭转水瓶或用剪刀裁剪等复杂任务中,旧方法由于其“地图”是锯齿状且不连贯的而失败了,而 SemAnCorr 则为机器人提供了成功所需的平滑且可靠的引导。作者认为,这种方法可以帮助机器人从单次演示中学习,并将其应用于各种新物体,从而使其在我们的日常世界中更具适应性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →