MessyMem: Learning-from-Doing Memory for Mobile Manipulation
MessyMem 是一个面向移动操作机器人的持久化记忆系统,它维护着一个由交互衍生知识增强的空间定位 3D 场景图,使机器人能够从经验中学习,并通过在长程任务中复用过去的发现,显著超越现有的基准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在我们的家庭和办公室中,移动的机器人正变得越来越普遍,但它们仍然在面临一项基本的人类技能:记住它们所学到的东西。如今的家用机器人通常将每一次新的请求都视为它们进入房间后的第一次。如果机器人打开一个橱柜发现它是空的,它可能会在第二天早上就忘记这个事实。如果它发现一个抽屉被锁上了,它在未来的任务中可能会一次又一次地尝试强行打开它。这种缺乏持久记忆的现象迫使机器人不断地从零开始,浪费了时间和精力。为了在真实的家庭中有效运作,机器不仅需要一张关于物体位置的地图,还需要一份通过触摸和行动所发现的记录,以及一种能够回想起数小时或数天前特定视觉细节的方法。
斯坦福大学的研究人员开发了一个名为 MessyMem 的系统来解决这个问题。该系统充当了移动机器人的长期记忆,使它们能够跨越不同的房间并在较长的时间内携带知识。MessyMem 并不是依赖于一个简单的物体列表或一个过于庞大且难以搜索的连续视频流,而是构建了一个随着每一次交互而变得更加智能的结构化世界地图。它结合了三种截然不同的信息类型:物体位置的空间地图、机器人通过物理接触或移动物体所学到的记录,以及在关键时刻拍摄的特定照片库。通过将这三个元素链接在一起,机器人可以回答复杂的疑问,例如“我在哪里见过剪刀?”或“哪个橱柜是锁着的?”,而无需重新探索整个房子。
该系统的核心是一个 3D 场景图(3D scene graph),它本质上是一个数字地图,列出了机器人所见到的每一个物体及其在世界中的位置。与仅记录几何形状的标准地图不同,该系统为每个项目附加了一个详细的档案。当机器人与物体进行交互时(例如尝试打开抽屉或拿起杯子),一个专门的软件组件会分析结果。它会判断抽屉是否被锁住了、杯子是否是空的,或者动作失败是否是因为机器人打滑了。这些信息会被直接写入该物体的数字档案中。因此,如果机器人尝试打开一个橱柜并发现它是锁着的,这个事实就会被保存下来。稍后,当被要求寻找某样东西时,机器人会检查其记忆,看到“已锁定”的注释,从而跳过那个橱柜,直接转向一个未锁定的橱柜。
然而,仅仅知道一个橱柜是锁着的并不总是足够的。有时机器人需要记住一些简单的文字注释无法捕捉的精细细节,比如杯子上特定的贴纸或罐子上的标签。为了处理这种情况,MessyMem 会保存选定的照片(称为关键帧),并将它们直接与地图中的物体链接起来。这些照片并非随机的视频流;它们是精心挑选的时刻,例如机器人在抓取物体之前的视角,或者是打开抽屉后的内部视角。当机器人面临新任务时,它会在记忆中搜索最相关的照片。它可能会寻找一张显示咖啡容器最后一次被看到的精确货架的照片,或者一张特定图案袜子的照片。这使得机器人能够根据过去收集到的视觉证据,来区分两个看起来一模一样的物品。
研究人员在计算机模拟和真实环境中的实体机器人移动测试中对该系统进行了测试。在涉及超过三小时、包含二十五个不同家庭任务的连续序列模拟中,使用 MessyMem 的机器人成功完成了百分之八十的任务。这比其他方法有了显著的改进。那些仅依赖空间地图而没有交互注释,或者拥有注释但没有照片的机器人,表现要差得多。例如,当被要求在一个杂乱的橱柜中寻找特定物品时,完整的系统可以回想起精确的视觉排列,而其他系统则会失败,因为它们无法将目标物与相似的物体区分开来。在涉及带有多个抽屉的办公桌的现实世界测试中,机器人通过复用之前步骤中收集到的知识,成功找到了剪刀、识别出了属于一位名叫约翰的人的特定杯子,并找到了游戏控制器。
实验表明,当所有三个组件同时存在时,该系统效果最好。空间地图提供了位置,交互注释提供了世界状态(如锁定或空置),而照片则提供了进行困难区分所需的视觉证据。如果没有交互注释,机器人会浪费时间尝试打开锁定的抽屉。如果没有照片,它就无法区分两个看起来相似的瓶子。该系统也证明了其高效性;即使在存储了数千张照片并运行了数小时后,它仍能快速找到完成任务所需的特定证据,回溯过去一小时的活动来做出决策。
这项工作表明,为了让机器人成为我们日常生活中真正有用的助手,它们必须能够从自身的行动中学习并记住这些教训。Messy-Mem 系统证明,通过结合地图、交互日志和关键图像库,机器人可以停止将每项任务都视为一次新的发现,并开始建立一段持续的经验历史。虽然目前的系统使用的是可以识别的预定义物体列表,但研究人员指出,未来的版本可以扩展到识别更多种类的物品,甚至可以向人类的行为学习。目前来看,结果展示了一条清晰的前进道路:一个能记住自己触摸过和见过什么的机器人,终于可以开始在不重复开始的情况下,与我们并肩工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。