想象一下,你正在试图清理一个凌乱的儿童房,但你是一个眼睛里装有摄像头、记忆仅持续一瞬间的机器人。每当你转头,之前的视野就会从你的脑海中消失。你捡起一个玩具,走过一把椅子,突然间,你就忘记了玩具是从哪里来的,也不知道书架在哪里了。这就是许多现有机器人的问题:它们擅长处理短期任务,但在涉及在大空间内移动的长时任务时,会迷路或陷入混乱。
这篇论文介绍了一种名为 SERF(时空环境与机器人特征图)的解决方案。把 SERF 想象成赋予机器人一个实时更新的、活生生的 3D“心理地图”,它将机器人所看到的景象与其自身身体的位置结合在一起。
以下是其工作原理的拆解,通过简单的概念进行说明:
1. “神经点”(机器人的脑细胞)
SERF 并没有存储一个巨大且沉重的房间 3D 模型,而是使用了数以千计的微小、不可见的点,称为神经点。
- 环境点: 想象一下在玩具、地板和家具上撒满了闪粉。每个点都会“记住”它正在观察的东西(比如一个红色的球或一把木椅)。
- 机器人点: 现在,想象在机器人自己的身体上(从轮子到机械臂)撒上了不同颜色的闪粉。
- 共享空间: 这两组闪粉存在于同一个“心理空间”中。这使得机器人能够瞬间理解自身与世界之间的关系。它知道:“我的手臂离这个玩具有多近”,而不需要去猜测。
2. “活地图”(如何更新)
大多数地图就像一张印刷的照片;即使你移动了椅子,它们依然保持不变。SERF 的地图则像是一个记录一切的实时视频流。
- 移动物体: 如果机器人把一个玩具推过地板,附着在该玩具上的“环境点”会随之滑动。机器人不需要重新扫描整个房间,只需更新这些特定点的位置即可。
- 移动身体: 当机器人行走或弯曲手臂时,“机器人点”会根据机器人自身的传感器(本体感受)随之移动。
- 结果: 地图始终是最新的,能够准确显示此时此刻每样东西的位置,即使机器人已经转过了身,不再看向该物体。
3. “智能助手”(机器人如何使用地图)
机器人使用一个强大的 AI 大脑(称为视觉-语言-动作模型)来决定做什么。通常,这个大脑只观察当前的摄像机画面。有了 SERF,机器人也会将它的 3D 心理地图输入到大脑中。
- 局部视角: 机器人观察手边的点,以决定如何抓取物体。
- 全局视角: 机器人观察远处的点,以记住书架在哪里,即使书架目前不在视野范围内。
- 类比: 这就像是在驾驶城市时,是只盯着车前方的街道看(仅靠图像),还是拥有一个既能显示你的车辆、又能显示交通状况和目的地的 GPS(SERF)。
论文的研究发现
研究人员在计算机模拟环境下测试了机器人执行家务(如捡起玩具或整理鞋子)的情况。他们将使用 SERF 地图的机器人与仅使用摄像头的机器人进行了对比。
- 更快、更聪明: 拥有 SERF 地图的机器人采取的路径更直接,完成任务的速度更快。它不会到处乱转而感到困惑。
- 更好的记忆力: 当物体被移动到新位置或隐藏在机器人尚未访问过的角落时,SERF 机器人仍然能找到它们。仅靠摄像头的机器人经常会因为一旦转过身就“忘记”了东西在哪里而陷入困境。
- 从错误中恢复: 如果机器人不小心掉落了一个玩具,SERF 机器人可以迅速记住掉落的位置并将其捡起。而仅靠摄像头的机器人往往找不到掉落的物体,因为该物体已不在摄像头的视野范围内。
核心结论
该论文声称,通过赋予机器人一个关于世界及其自身身体的共享、更新的 3D 记忆,它们在处理长期、复杂任务时表现得更好。它们不再仅仅依赖于转瞬即逝的视觉瞬间,而是开始利用对自身位置以及周围环境变化的持续理解。
注:论文明确指出,这些结果是在模拟环境(BEHAVIOR-1K)中得出的,在现实世界中进行测试是必要的下一步。
技术摘要:SERF —— 用于长时程移动操作的时空环境与机器人特征图
1. 问题定义
在大型动态环境中进行长时程移动操作,要求机器人能够持续对三个耦合问题进行推理:其当前定位、环境变化以及任务进度。虽然视觉-语言-动作(VLA)模型在将观测映射到动作方面展现了潜力,但它们通常缺乏在当前观测窗口之外维持信息的显式机制。这种局限性对于移动操作至关重要,因为决策依赖于随着机器人与世界交互而演进的长时程上下文。
现有方法分为两类,并各具局限性:
- 模块化系统使用结构化场景表示(例如 3D 场景图),但往往忽略了连续视觉运动控制所需的密集几何信息和机器人-环境交互线索。
- 策略嵌入记忆(例如历史 Token、检索缓冲区)通常使空间接地(grounding)处于隐式状态,迫使策略去推断相关性。此外,现有的特征图方法通常仅表示静态环境,无法随着机器人的交互而更新,并且往往忽略了机器人自身在记忆表示中的地位。
作者提出了一种解决方案来填补这些空白,即创建一个能够随机器人交互而演进、并显式表示机器人与其环境之间空间关系的持久且具有空间接地能力的记忆。
2. 方法论
核心贡献是 SERF 时空环境与机器人特征图,这是一种 4D 特征映射公式,将环境和关节式机器人主体都表示为共享潜在空间中的神经点(neural points)。
A. 时空特征映射(问题 1)
该地图 mτ 使用 3D 空间中的神经点进行参数化。每个点携带一个可学习的潜在特征向量和一个实例标签。
- 表示形式: 地图由两组点组成:
- 环境点 (Pτe): 利用类似 DINOv3 的视觉基础模型(VFM)从 RGB-D 观测中提升(lifted)而来的 3D 点。这些点被体素化并分配实例标签。
- 机器人点 (Pτr): 从机器人的运动学模型(如 URDF)中采样的表面点。其位置通过基于机器人本体感知状态的前向运动学进行更新。
- 共享潜在空间: 两组点都由一个共享的 MLP 解码器解码,以重建 VFM 嵌入。这促使机器人和环境特征能够在共同的潜在空间中栖息。
- 训练目标: 系统通过重建损失(余弦相似度)进行离线训练,以匹配解码特征与 VFM 嵌入。此外,使用对比损失(Linter 和 Lintra)来对齐同类别/部件内的特征,并分离不同类别/部件的特征,从而诱导语义结构。
- 在线更新: 在执行期间,潜在特征和解码器保持固定。仅更新点坐标:
- 环境: 通过连续帧之间的 3D 关键点对应关系来追踪物体运动,估计物体级的 SE(3) 变换,从而刚性移动相关的神经点。
- 机器人: 点的位置通过当前关节状态的前向运动学进行更新。
B. 映射调节的 VLA 策略(问题 2)
作者设计了一个将动作预测以 SERF 地图为条件的策略 πϕ。
- 地图分词器(Map Tokenizer): 对神经点进行子集过滤(保留机器人主体和任务相关物体),并使用 Point Transformer 主干进行编码。
- Token 提取: 八个并行头在多个参考帧和空间尺度上提取地图 Token:
- 机器人基座 Token: 在三个递增半径(1m, 2m, 4m)处提取,用于局部上下文。
- 末端执行器 Token: 在抓取器周围提取两个 Token,用于抓取推理。
- 仅机器人 Token: 总结机器人的配置。
- 仅环境 Token: 总结当前的环境状态。
- 全局 Token: 聚合所有点以进行场景级推理。
- 策略架构: 地图 Token 被投影并与图像特征、本体感知状态 Token 以及任务嵌入进行拼接。这些组合输入被输入到基于 π0.5 的 VLA 模型中,该模型通过条件流匹配(conditional flow matching)进行训练,以预测动作块(action chunks)。VLM 主干和视觉编码器是冻结的,LoRA 层被插入到动作专家(action expert)和地图分词器中进行微调。
3. 核心贡献
- SERF 地图: 一个在共享潜在空间中表示机器人主体和演进环境的时空特征图,实现了可在线更新的持久记忆。
- 映射调节的策略: 一种 VLA 策略设计,利用来自多个参考帧(机器人基座、末端执行器、全局)的地图 Token,为动作预测提供局部和全局的空间上下文。
- 实证验证: 证明了 SERF 策略在长时程移动操作任务中优于仅图像的基线模型,特别是在提高任务进度、轨迹效率、对场景变化的鲁棒性和故障恢复方面。
4. 实验结果
该方法在 BEHAVIOR-1K 上进行了评估,这是一个涉及导航和多物体重排的家庭双臂移动操作基准测试。
- 任务进度: 完整的 SERF 策略在三个评估任务(收集玩具、将鞋子放入架子、组装礼品篮)中实现了最高的任务进度,将平均进度从 44.0%(仅图像基线)提升至 58.7%。
- 轨迹效率: 与经常在物体离开视野后停滞不前的仅图像策略相比,SERF 遵循更直接的轨迹并更快地到达子目标。
- 场景配置泛化能力: 在涉及移动目标、额外物体和未访问区域的分布外(OOD)测试中,SERF 显著优于仅图像基线。例如,在未访问区域,任务进度从 28.0% 提升至 51.0%。
- 故障恢复: 在运输过程中掉落物体的场景中,SERF 成功重新定位并重新抓取物体的成功率为 95%(基线为 65%),并将平均恢复时间从 24.3s 缩短至 20.5s。
- 消融实验: 研究证实,时空地图更新(SERF 对比静态 SBP)以及引入机器人神经点(SERF 对比 SERF-env)均对性能有积极贡献。
5. 重要性与主张
论文声称,长时程移动操作需要当前 VLA 模型所缺乏的连贯时空推理能力。通过引入机器人与环境的共享潜在表示,SERF 实现了两种形式的推理:
- 异地参照(Allocentric)推理: 维持持久的空间记忆,以全局方式追踪物体和目标位置。
- 自我参照(Egocentric)推理: 通过显式嵌入机器人主体,支持基于距离、方向和可达性的决策。
作者指出,SERF 为神经策略提供了结构化上下文,使其能够比仅图像的方法更有效地从失败中恢复,并更好地泛化到新的场景配置。
6. 局限性
作者承认存在若干局限性:
- 对模拟器的依赖: 当前实现依赖于来自模拟器的特权实例标签和执行前学习到的先验地图。现实世界的部署需要前馈编码器和分割基础模型(如 SAM 2)。
- 刚体运动假设: 地图更新假设物体级刚体运动(SE(3)),这限制了系统处理关节式或变形物体的能力。
- 分词化(Tokenization): 当前的地图分词器使用手动指定的空间子集,而非任务驱动的语义分离。
- 现实世界验证: 目前的实验局限于模拟环境;现实世界的迁移能力仍有待评估。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。