想象一下,你正试图从桌子上拿起一个特定的红色杯子,但每次伸手去拿时,都会不小心把它碰出视线范围。标准的机器人摄像头就像一个只相信“当下”所见之物的普通人。如果杯子被碗挡住了,机器人就会惊慌失措,停止动作,并说:“我找不到它了!”它根本记不住一秒钟前杯子在哪里。
本文介绍了SOMA(用于视外操作的空间记忆),这是一种为机器人设计的新“大脑”,它通过赋予机器人房间的持久心理地图来解决这一问题。
以下是 SOMA 的工作原理,分解为简单的概念:
1. 问题:拥有“金鱼记忆”的机器人
大多数现有机器人就像只有 7 秒记忆的金鱼。它们只知道摄像头当前视野内的物体。
- 场景:一个人让机器人“拿起粉色杯子并放入篮子”。
- 失败:如果杯子被盒子挡住,或者机器人移动头部导致杯子移出画面,机器人就会僵住。它不知道杯子依然存在,它看到的只是空荡荡的空间。因为它缺乏对房间的全局理解,所以会“卡住”。
2. 解决方案:机器人的“心理地图”
SOMA 赋予机器人空间记忆,这类似于你即使现在看不见钥匙,也能记得把它们放在哪里的能力。它分三步实现:
步骤 A:“扫描”(构建地图)
在机器人尝试抓取任何东西之前,如果它看不见目标,它会利用头戴式摄像头像保安做 360 度转身一样扫描房间。
- 类比:想象你在黑暗的房间里寻找一枚丢失的硬币。你不会只盯着一个地方看,而是会挥动手电筒扫视整个房间,看看所有东西都在哪里。
- 发生的情况:机器人将这些不同角度的画面拼接成一个统一的“心理地图”,其中既包含物体是什么(一个粉色杯子),也包含它们在哪里(三维坐标)。
步骤 B:“更新”(保持地图新鲜)
随着机器人移动和场景变化(物体移动、被遮挡或出现),SOMA 不会直接丢弃旧地图,而是对其进行更新。
- 类比:想想天气图。如果风暴从北移到南,你不会扔掉地图,而只是更新风暴的位置。
- 发生的情况:如果机器人看到杯子移动,它会在心理地图上调整杯子的位置。如果杯子被盒子挡住,地图会记住“杯子在盒子后面",这样机器人就不会忘记它的存在。
步骤 C:“搜索”(利用地图行动)
当机器人需要抓取杯子时,它不会盲目地四处游荡寻找。它会查询其记忆。
- 类比:与其在房子里漫无目的地寻找手机,不如你记得“我最后一次看到它在厨房台面上”,然后径直走过去。
- 发生的情况:机器人询问它的记忆:“粉色杯子在哪里?”记忆回答:“它在左边,篮子后面。”然后机器人直接将头部移向那个位置,抓起杯子,并将其放入篮子——通常只需一次尝试。
3. 结果:从“卡住”到“流畅”
研究人员在真实机器人上针对真实任务(如拿起杯子并放入篮子)测试了该技术。
- 没有 SOMA:机器人经常卡住,随机旋转头部试图找到物体,最终无法抓取。
- 有了 SOMA:机器人的速度快得多。它确切知道要看哪里,头部移动更少,并且几乎立即抓取物体(就像“一次成功”的抓取)。即使物体一开始完全不可见,它也能成功。
总结
可以将SOMA想象成给机器人提供了一个GPS 和日记的结合体。
- 标准机器人只有眼睛;如果看不见,它就不存在。
- SOMA 机器人既有眼睛又有记忆。它们能“看见”当前被遮挡的物体,因为它们记得这些物体在房间三维空间中的位置。
这使得机器人能够在混乱的真实世界环境中执行复杂任务,在这些环境中物体不断进出视线,从而使它们成为更可靠的助手。
技术摘要:SOMA——面向视觉 - 语言 - 动作的视域外操作空间记忆
1. 问题陈述
当前的视觉 - 语言 - 动作(VLA)模型通常在“视域受限”的假设下运行,即假定任务相关物体在决策时刻位于机器人当前相机视场内。大多数现有的 VLA 模型依赖静态相机设置或单一视角,导致当目标被遮挡或移出相机视锥时,其行为变得脆弱且具有反应性。尽管一些近期方法试图利用内部空间推理或学习到的先验知识来补偿视域外感知,但这些方法本质上仍很脆弱;它们缺乏持久的感知 grounding,一旦目标完全移出可观察视场,便会迅速失效。这一局限性阻碍了在需要多步规划、双臂协调或与暂时不可见物体交互的场景中实现鲁棒的操控。
2. 方法论:SOMA 框架
作者提出了SOMA(面向视域外操作的空间记忆框架),这是一个旨在支持超越当前视觉视锥进行推理和行动的 VLA 框架。SOMA 将可移动的头部安装相机与全局、持久的空间记忆相结合。该框架通过三个核心组件运行:
A. 空间记忆构建
在操作开始之前,如果目标物体未在当前视图中被定位,机器人将利用可移动头部相机启动主动扫描阶段。
- 过程:系统将扫描视频序列中的角度观测聚合为统一的空间 - 语义表示。
- 流程:它采用结合以下内容的多级视觉抽象流程:
- 几何先验:利用 VGGT 估计相机姿态和粗略的 3D 场景几何。
- 语义感知:利用 YOLO 进行物体定位和分类。
- 视觉特征:利用 DINOv3 获取高维外观嵌入。
- 融合:检测到的 2D 边界框被提升至全局 3D 坐标系。实例利用外观 - 几何相似性在跨视图中进行关联和融合,以解决重复和歧义问题,形成由统一三元组(外观、3D 空间编码、类别)组成的概览场景记忆(M0)。
B. 动态记忆细化
在操作过程中,随着物体移动或被遮挡,场景会发生变化。
- 机制:来自头部相机的新观测被处理并融合到现有记忆(M0)中,以生成细化后的当前记忆(M^t)。
- 自适应融合:系统在新增观测与现有记忆条目之间执行实例级关联。它采用一种感知相似性的融合机制,计算语义相似度分数和动态融合分数。这些分数决定了一个自适应更新系数,使记忆能够通过时间指数移动平均(EMA)在视觉新证据与历史数据之间取得平衡。这确保了全局一致性,同时适应场景变化。
C. 上下文记忆检索
为了指导动作选择,该框架根据用户指令检索相关的空间线索。
- 对齐:来自视觉语言模型(VLM)的基于指令的视觉 - 语言嵌入作为查询,而细化后的空间记忆作为键值库。
- 集成:交叉注意力模块选择性地激活记忆中与指令相关的区域。这些检索到的、经记忆增强的特征被注入到 DiT(扩散 Transformer)块中,作为空间 - 语义先验,调节 token 交互,从而即使在目标暂时不可见时也能生成精确的、基于 grounding 的操控动作。
3. 主要贡献
- SOMA 框架:引入了一种面向 VLA 模型的空间记忆框架,将范式从反应式的、视域受限的探索转变为记忆引导的操控,实现了超越当前相机视场的操作。
- 以记忆为中心的架构:一种新颖的架构,包含空间记忆构建、动态记忆细化和上下文记忆检索。该设计维护了持久的、以物体为中心的空间表示,支持在有限视角覆盖下的跨视图一致性和指令感知的动作选择。
- 实证验证:真实世界实验表明,SOMA 不仅提高了任务成功率,还诱发了定性不同的操控行为,例如更快的目标定位、减少的头部探索以及在部分可观测条件下的近乎单次抓取。
4. 实验结果
真实世界视域外(OOV)任务
作者在五个自行设计的真实世界 OOV 抓取 - 放置任务中评估了 SOMA,这些任务范围从单物体操作到序列化的双物体和双臂协调场景,其中目标最初是不可见的。
- 性能:与包括 GR00T-N1.5、StarVLA 和 SpatialVLA 在内的基线模型相比,SOMA 在所有五个任务中均取得了最高的成功率。
- 行为指标:与 GR00T-N1.5 相比,SOMA 在以下方面表现出显著改进:
- 首次注视时间:减少了 40–59%。
- 头部搜索路径长度:减少了 40–57%。
- 视角修正次数:减少了 42–57%。
- 抓取尝试次数:减少了 40–57%,表明具有近乎单次抓取的行为。
- 抓取耗时:减少了 41–60%。
- 消融实验:实验证实,持久的空间记忆是性能提升的主导因素,其表现优于仅依赖扫描而无记忆、或仅有记忆而无细化的策略。
仿真基准
- RoboCasa 桌面 GR1:SOMA 实现了最先进的平均成功率,300 次演示下为 52.0%,全数据下为 49.3%,优于 Diffusion Policy、GR00T-N1.5 和 StarVLA。值得注意的是,SOMA 表现出强大的样本效率,仅凭每个任务 30 次演示即可实现高成功率。
- SimplerEnv:在 Fractal 套件上,SOMA 取得了最佳成功率(视觉匹配为 63.2%,变体聚合为 52.5%),超越了 RoboVLM 和 OpenVLA 等其他最先进模型。
5. 意义与主张
本文主张,SOMA 从根本上解决了当前 VLA 范式中视域受限感知的局限性。通过将多视图场景探索与持久、可查询的空间 - 语义记忆相结合,SOMA 使机器人能够保留并复用超出瞬时视觉输入的空间证据。
作者强调,这种以记忆为中心的设计使得在任务相关物体暂时移出视场时,仍能进行鲁棒的推理和操控,而无需依赖脆弱的、视域依赖的行为。此外,该框架的有效性延伸至常规的全可观测设置(如 RoboCasa 和 SimplerEnv 所示),表明结构化的空间记忆为通用操控任务提供了有益的归纳偏置,即使在物体可见的情况下,也能提高样本效率和稳定性。这项工作强调,在动态或部分可观测环境中,仅靠空间推理而缺乏记忆中保留的基于 grounding 的感知证据,不足以实现鲁棒的操控。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。