想象一下,一个机器人第一次探索一间全新且昏暗的房子。它的目标是构建一个完整的房间三维心理地图,在行走的同时,精确掌握墙壁、椅子和桌子的位置以及它们的材质。
本文介绍了一种名为VEOcc的新系统,它能帮助机器人以前所未有的精度完成这一任务。其工作原理如下,简单说明:
问题所在:“团块”与“网格”
以往的方法试图利用漂浮的“团块”(称为高斯分布)来构建地图。这就像试图仅用漂浮的、柔软的棉花糖来搭建一座房子的精细模型。
- 问题所在:棉花糖光滑圆润。它们非常适合表现柔和的云彩,但完全无法呈现锐利的角落、薄墙或桌子的边缘。此外,它们还需要你在开始建造之前先猜测房子的大小,如果你从未去过那里,这几乎是不可能的。
VEOcc通过采用3D 网格(就像一个巨大的、无形的乐高结构)改变了游戏规则。
- 优势:它不再使用柔软的团块,而是使用微小的、坚硬的立方体(体素)。这非常适合捕捉锐利的边缘、角落和平面墙壁。它无需在事前猜测房子的大小;只需随着机器人进入新区域,不断添加新的乐高积木即可。
三步“智能更新”系统
这项工作最困难的部分在于,机器人的“眼睛”(摄像头)可能会产生混淆。有时,因为距离太远,墙壁看起来模糊不清;或者从新角度看,椅子显得不同。如果机器人盲目地信任每一次新的观察,其地图就会变得杂乱无章且充满噪点。
VEOcc 采用了一种特殊的三步策略来消除噪点并构建完美的地图:
“时间旅行”检查(跨时间对数几率聚合):
想象你从两个不同的角度观察一幅画。从一边看,它是蓝色的;从另一边看,它呈现紫色。该模块就像一个侦探,将机器人此刻看到的景象与片刻之前看到的景象进行比对。它能判断出哪个视角更可靠,并将两者融合,从而还原出真实的颜色。
“信任度计”(可靠性感知置信度调制):
并非所有视角都同等有效。正对摄像头的墙壁清晰可见,而角落远处的墙壁则模糊不清。该模块就像一个信任度计。它会自动降低那些模糊、遥远或位于屏幕边缘的观测数据的“置信度”评分。它告诉系统:“不要像信任清晰区域那样信任这个模糊的斑块。”
“智能归档系统”(置信度驱动的增量状态更新):
现在,机器人必须决定如何更新其主地图。它不是简单地用新信息覆盖旧信息,而是采用加权平均。
- 如果新观测具有高信任评分,它在更新地图时将获得更大的权重。
- 如果新观测具有低信任评分(因为模糊或距离过远),它获得的权重则微乎其微。
- 随着时间的推移,随着机器人从多个清晰的角度观察物体,“嘈杂”的猜测会逐渐消失,地图将变得晶莹剔透。
结果
作者通过两种方式测试了该系统:
- 局部预测:观察房间的单一快照。与旧的“棉花糖”方法相比,VEOcc 在绘制锐利线条和识别物体方面表现优异得多。
- 具身预测:机器人四处走动并随时间构建地图。VEOcc 构建了更准确、更稳定的地图,且不会因自身的移动而感到困惑。
“魔法”测试:
最令人印象深刻的是,他们在一个从未见过的真实房子里,用智能手机拍摄的视频中测试了 VEOcc。该系统从未针对该特定房屋进行过训练。然而,它无需任何额外调整就构建了准确的地图。这证明了该系统足够稳健,能够应对混乱且不可预测的现实世界。
总结
VEOcc 就像将机器人的大脑从使用柔软、模糊的棉花糖升级为精密、可互锁的乐高积木。通过利用一个能检查时间、测量信任度并仔细归档新信息的智能系统,它使机器人能够快速、准确地探索和理解新环境,而无需事先知晓房间的大小。
技术摘要:VEOcc - 以体素为中心的在线语义占据预测
1. 问题定义
本文解决了具身智能中在线 3D 占据预测与建图的挑战。该任务要求机器人在探索过程中增量式地构建场景的密集、连贯的空间表示,以支持在新环境中的高层决策。
作者指出了现有最先进方法(特别是那些依赖以 3D 高斯为中心的表示方法,如 SplatSSC、RoboOcc)的两个关键局限性:
- 结构保真度:高斯原语倾向于聚集在显著区域,导致在弱纹理区域出现稀疏表示。其平滑的椭球性质难以建模几何不连续性,如边界、角落和薄结构。
- 操作约束:以高斯为中心的方法通常依赖预定义的场景尺寸先验。它们通常需要初始探索阶段来估计场景尺度以进行高斯初始化,随后进行二次细化。这限制了它们在缺乏环境范围先验知识的情况下执行真正的开放式增量建图的能力。
核心挑战在于开发一个系统,确保准确的逐帧局部预测,实现无需预定义边界的开放式地图扩展,并鲁棒地整合噪声大、长视野的观测数据。
2. 方法论:VEOcc 框架
作者提出了VEOcc,这是一个以体素为中心的框架,被形式化为一种递归感知与同化范式。该系统处理单目图像序列,以预测逐帧的局部占据情况,并将这些结果增量式地同化到全局地图中。
A. 局部占据预测网络
VEOcc 采用一个轻量级的局部预测器,在规则体素网格上运行,以保留细粒度的几何细节:
- 特征提取:使用带有特征金字塔网络(FPN)的 EfficientNet-B7 骨干网络提取多尺度 2D 特征。
- 深度估计:利用预训练的深度基础模型(Depth Anything V2)预测密集深度图。
- 2D 到 3D 提升:采用**提升 - 泼溅 - 射击(Lift-Splat-Shoot, LSS)**视图变换器。该变换器显式地结合相机内参和外参,将 2D 图像特征提升到 3D 特征体积(Vt),减轻了隐式几何推理的负担。
- 预测:3D ResNet 骨干网络和 FPN 聚合上下文,随后通过一个轻量级的 3D 占据头预测每个体素的语义对数几率(logits)。
B. 时空感知在线更新策略
为了解决离散体素空间中的时间融合瓶颈和噪声问题,VEOcc 引入了一种用于更新全局占据状态(Ot)的三模块策略:
跨时间对数几率聚合(TLA):
- 目标:强制时间一致性,并处理离散全局网格与移动自车坐标系之间的空间未对齐问题。
- 机制:对于在当前帧(t)和前一帧(t−1)中均可见的体素,系统将其投影到连续的局部空间。它构建结合当前和先前表示及其差异和空间位置编码的成对特征。
- 融合:一个轻量级 MLP 根据特征和空间差异预测自适应融合权重,对语义对数几率进行加权聚合,以生成增强的预测结果。
可靠性感知置信度调制(RCM):
- 目标:校准单目设置中固有的空间不确定性(例如,图像边界的弱线索、远距离处的深度模糊)。
- 机制:基于深度感知和边界感知衰减函数计算每个体素的置信度分数。
- 公式:置信度由体素的深度(di,t)和与图像边界的接近程度(bi,t)进行调制,确保来自远距离或边缘区域的预测被降低权重。该模块无需训练,参数通过经验固定。
置信度驱动的增量状态更新(CSU):
- 目标:鲁棒地同化长视野的全局状态,同时防止对数几率方差漂移。
- 机制:系统不直接融合原始对数几率,而是通过 Softmax 将增强的对数几率转换为归一化的语义概率。
- 更新规则:对于现有体素,全局状态使用历史概率和当前概率的加权平均值进行更新,权重由置信度分数和观测次数决定。新体素以其当前概率和置信度进行初始化。这确保了可靠的观测主导全局地图,而噪声预测被逐步抑制。
3. 主要贡献
- VEOcc 框架:一种用于在线 3D 占据预测的以体素为中心的方法,消除了对初始尺度估计的需求,实现了开放式、增量式的地图扩展。
- 时空感知在线更新策略:一种新颖的融合机制,包含 TLA、RCM 和 CSU 模块,协同解决时间一致性、空间不确定性校准和鲁棒的全局状态同化问题。
- 最先进性能:该方法在局部和具身设置中均建立了新的基准,显著优于领先的以高斯为中心的基线方法。
- 零样本泛化:展示了在自收集的实世界视频序列上无需微调或场景先验即可实现的鲁棒分布外性能。
4. 实验结果
作者在Occ-ScanNet(局部预测)和EmbodiedOcc-ScanNet(具身预测)上评估了 VEOcc。
- 局部预测(Occ-ScanNet):VEOcc 在整个数据集上实现了64.55 IoU和55.49 mIoU,超越了最强的以高斯为基准的方法(SplatSSC)+1.72 IoU 和 +3.66 mIoU。在 mini-split 上,提升更为显著(+6.41 IoU)。
- 具身预测(EmbodiedOcc-ScanNet):VEOcc 达到了62.21 IoU和53.00 mIoU,显著优于 RoboOcc(+8.91 IoU / +8.95 mIoU)。关键在于,与先前的方法相比,它在从局部预测过渡到全局预测时表现出更小的性能下降,表明其在长期整合过程中具有更好的误差校正能力。
- 效率:尽管增加了更新策略的复杂性,VEOcc 仍保持了与高斯方法相当的推理延迟,同时所需的模型参数(177.1M vs. 231.5M)和内存占用显著更低。
- 定性分析:可视化结果显示,与基于高斯的方法相比,VEOcc 在结构边界、薄物体和遮挡区域的重建方面表现更优。
- 实世界验证:在自收集的智能手机视频上进行零样本部署,成功在未见过的室内环境中重建了连贯的全局语义地图,与 COLMAP 稀疏重建结果一致。
5. 意义与主张
本文主张 VEOcc 为自主探索提供了一种准确且高效的解决方案。其主要意义在于将在线建图的范式从以高斯为中心转变为以体素为中心的表示。
- 克服先前局限性:通过放弃预定义的场景尺寸先验,VEOcc 实现了真正的开放式探索,地图随着新区域的观测而自然扩展。
- 鲁棒性:所提出的更新策略有效地抑制了跨视角噪声并校准了不确定性,确保即使在存在噪声观测和长期整合的情况下,也能保持连贯的全局语义状态。
- 实用性:该框架专为现实世界的具身应用而设计,在高性能、计算效率和无需重新训练即可泛化到完全未见环境的能力之间取得了平衡。
作者总结道,他们的工作填补了关于用于在线占据预测的以体素为中心的密集表示研究的空白,证明了其在室内场景下相对于基于高斯的方法的显著优势。未来的工作 noted 将探索扩展此框架以处理复杂开放式环境中的动态元素。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。