← 最新论文
💻 computer science

Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action

本文介绍了 SOMA,这是一种空间记忆框架,它通过从多视角观测中构建、优化和检索持久的三维空间表征,增强了视觉 - 语言 - 动作模型执行视外操作的能力,从而即使在目标物体初始不可见的情况下也能实现稳健的推理和更快速的任务执行。

原作者: Pengteng Li, Weiyu Guo, He Zhang, Tiefu Cai, Xiao He, Yandong Guo, Hui Xiong

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengteng Li, Weiyu Guo, He Zhang, Tiefu Cai, Xiao He, Yandong Guo, Hui Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图从桌子上拿起一个特定的红色杯子,但每次伸手去拿时,都会不小心把它碰出视线范围。标准的机器人摄像头就像一个只相信“当下”所见之物的普通人。如果杯子被碗挡住了,机器人就会惊慌失措,停止动作,并说:“我找不到它了!”它根本记不住一秒钟前杯子在哪里。

本文介绍了SOMA(用于视外操作的空间记忆),这是一种为机器人设计的新“大脑”,它通过赋予机器人房间的持久心理地图来解决这一问题。

以下是 SOMA 的工作原理,分解为简单的概念:

1. 问题:拥有“金鱼记忆”的机器人

大多数现有机器人就像只有 7 秒记忆的金鱼。它们只知道摄像头当前视野内的物体。

  • 场景:一个人让机器人“拿起粉色杯子并放入篮子”。
  • 失败:如果杯子被盒子挡住,或者机器人移动头部导致杯子移出画面,机器人就会僵住。它不知道杯子依然存在,它看到的只是空荡荡的空间。因为它缺乏对房间的全局理解,所以会“卡住”。

2. 解决方案:机器人的“心理地图”

SOMA 赋予机器人空间记忆,这类似于你即使现在看不见钥匙,也能记得把它们放在哪里的能力。它分三步实现:

步骤 A:“扫描”(构建地图)

在机器人尝试抓取任何东西之前,如果它看不见目标,它会利用头戴式摄像头像保安做 360 度转身一样扫描房间。

  • 类比:想象你在黑暗的房间里寻找一枚丢失的硬币。你不会只盯着一个地方看,而是会挥动手电筒扫视整个房间,看看所有东西都在哪里。
  • 发生的情况:机器人将这些不同角度的画面拼接成一个统一的“心理地图”,其中既包含物体是什么(一个粉色杯子),也包含它们在哪里(三维坐标)。

步骤 B:“更新”(保持地图新鲜)

随着机器人移动和场景变化(物体移动、被遮挡或出现),SOMA 不会直接丢弃旧地图,而是对其进行更新。

  • 类比:想想天气图。如果风暴从北移到南,你不会扔掉地图,而只是更新风暴的位置。
  • 发生的情况:如果机器人看到杯子移动,它会在心理地图上调整杯子的位置。如果杯子被盒子挡住,地图会记住“杯子在盒子后面",这样机器人就不会忘记它的存在。

步骤 C:“搜索”(利用地图行动)

当机器人需要抓取杯子时,它不会盲目地四处游荡寻找。它会查询其记忆。

  • 类比:与其在房子里漫无目的地寻找手机,不如你记得“我最后一次看到它在厨房台面上”,然后径直走过去。
  • 发生的情况:机器人询问它的记忆:“粉色杯子在哪里?”记忆回答:“它在左边,篮子后面。”然后机器人直接将头部移向那个位置,抓起杯子,并将其放入篮子——通常只需一次尝试。

3. 结果:从“卡住”到“流畅”

研究人员在真实机器人上针对真实任务(如拿起杯子并放入篮子)测试了该技术。

  • 没有 SOMA:机器人经常卡住,随机旋转头部试图找到物体,最终无法抓取。
  • 有了 SOMA:机器人的速度快得多。它确切知道要看哪里,头部移动更少,并且几乎立即抓取物体(就像“一次成功”的抓取)。即使物体一开始完全不可见,它也能成功。

总结

可以将SOMA想象成给机器人提供了一个GPS 和日记的结合体。

  • 标准机器人只有眼睛;如果看不见,它就不存在。
  • SOMA 机器人既有眼睛又有记忆。它们能“看见”当前被遮挡的物体,因为它们记得这些物体在房间三维空间中的位置。

这使得机器人能够在混乱的真实世界环境中执行复杂任务,在这些环境中物体不断进出视线,从而使它们成为更可靠的助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →