← 最新论文
💻 computer science

Towards Fine-Grained Object Manipulation: SAM3-Guided Visuomotor Policy with Persistent Memory Learning and Focused Visual Conditioning

本文提出了一种由 SAM3 引导的视觉运动框架,该框架通过具有持久物体记忆功能的 FOM-SAM3 和实现聚焦视觉调节的 FSAE,使机器人能够在存在干扰物和视觉相似性的情况下,鲁棒地辨别并操作细粒度物体。

原作者: Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

发布于 2026-09-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是执行广泛、宏观任务的高手:拿起杯子、移动箱子或堆叠积木。对于这些工作,机器人的“眼睛”通常会扫描整个房间,寻找任何符合“杯子”或“箱子”等一般描述的物体。当目标仅仅是抓取“一个”杯子时,这种方法效果很好。但现实世界要具体得多。想象一下,如果要求人类从挤满了红色汽水罐、蓝色水罐和绿色茶罐的货架上,拿起一罐特定的红色草莓汁。人类能瞬间识别出品牌、口味以及标签上的细微差别。然而,标准的机器人通常只能看到“红罐”,要么抓错,要么被杂乱的环境搞糊涂。这种从通用物体识别到区分精细细节(如特定型号、颜色图案或品牌)的能力之间的差距,正是细粒度操控(fine-grained manipulation)的前沿领域。挑战不仅在于看到物体,还在于能在许多外观近乎相同的物体中看到“正确”的那一个,并以此进行精准的操作。

一组研究人员开发了一种新系统,教机器人进行这种区分,使其即使在有视觉相似的“双胞胎”在场时也能处理特定物品。他们的研究方法详述于最近的一项研究,该方法超越了每次遇到新物体都要从头开始教授机器人新技能的理念。相反,他们创建了一种让机器人为其学习识别的特定物品建立持久记忆的方法。该系统构建在强大的视觉基础模型 SAM3 之上,该模型擅长在图像中寻找并勾勒出物体。然而,标准版本的模型存在局限性:它可以被告知寻找“一个杯子”,但在旁边有一个几乎完全一样的蓝色杯子时,它很难找到“那个边缘有缺口的特定蓝色杯子”。研究人员通过创建一个“记忆库”解决了这个问题,机器人在其中存储用于识别每个特定目标所需的独特数字指纹。

为了构建这个记忆,研究人员并没有重新训练整个庞大的视觉系统,因为那既缓慢又耗费计算资源。相反,他们保持核心视觉引擎不变,并教会了它一个新技巧:如何将一组特定的内部“标记”(tokens)与特定物体联系起来。他们向机器人展示了几十张目标物品(例如一罐红色的 Wontae 草莓汁)在纯色背景下的照片。通过学习是什么让那个特定的罐子区别于其他红罐的过程,系统生成了一组紧凑的记忆标记。这些标记就像是该特定物体的持久身份卡。一旦存储,机器人可以在需要再次寻找该特定罐子时检索此身份卡,即使罐子在另一个房间、光照条件不同,或者被看起来很像的干扰物包围。这使得机器人可以通过简单地更换它正在寻找的记忆标记来切换任务,而不是重新学习整个任务。

第二个重大创新是机器人如何利用这些记忆来决定行动。在许多机器人系统中,视觉信息是整个场景的模糊混合体,这会分散机器人的决策注意力。研究人员引入了一种称为“聚焦空间-外观编码”(focused spatial-appearance encoding)的方法。这种技术迫使机器人忽略目标物体之外的一切。它提取由记忆标记确定的目标物体的精确形状和位置,并仅提取该形状内部的视觉细节。它将这些细节与物体所在的精确坐标相结合。通过仅向机器人的动作规划器提供这种聚焦且高质量的数据,该系统确保机器人是对被要求寻找的特定物品做出反应,而不是对背景杂物或外观相似的邻居做出反应。这种聚焦视图随后被传递给机器人的控制软件,由后者计算出抓取或推动物体所需的平滑运动。

研究人员在一个配备了两个摄像头的真实机械臂上测试了该系统,其中一个摄像头提供桌面的第三人称视角,另一个安装在机械臂上,提供第一人称视角。他们创建了一个包含三十种不同物理对象的数据库,涵盖了罐子、杯子、盖子和盒子,其中许多对象都有视觉相似的对应物。在一组测试中,机器人被要求拿起一个特定的罐子,而附近放置了其他同色但不同品牌的罐子。依赖通用场景描述的标准机器人策略在这些场景中经常失败,通常会抓错罐子或被干扰物搞混。然而,新系统在几乎所有的尝试中都成功识别并操作了正确的目标。当研究人员将目标更换为另一种类型但不同品牌的物体时,机器人只需检索新的记忆标记即可完成任务,无需任何新的训练或演示。

结果表明,该系统能够区分视觉上几乎完全相同的物体,而这一任务曾让其他方法束手无策。在机器人必须从一组相似物体中挑选特定物品的测试中,新方法保持了很高的成功率,而其他方法则表现出性能显著下降。该系统还证明了其鲁棒性,当机器人需要移动物体到新位置时,聚焦视觉编码有助于它追踪物品不断变化的位置和方向。研究人员指出,该系统并非完美无缺:如果物体的独特特征被遮挡(例如罐子的标签背对着摄像头),机器人就无法识别它。此外,由于过于严格地关注目标,机器人可能会忽略场景中的其他障碍物,这可能是其在复杂环境中导航时的局限性。尽管如此,这项工作展示了在赋予机器人处理现实世界任务中微妙且特定需求的能力方面迈出的重要一步,使其从通用的“抓取者”转变为能够区分熟悉与混乱的精准“操作者”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →