← 最新论文
💻 computer science

VEOcc: Voxel-Centric Online Semantic Occupancy Prediction For Embodied Scene Understanding

VEOcc 是一个以体素为中心的在线框架,通过在不依赖预定义场景先验的情况下实现开放式地图扩展,并利用新颖的时空更新策略鲁棒地聚合含噪的时序观测以达成精确的具身场景理解,从而在自主探索任务中实现了最先进的性能。

原作者: Ruoyu Wang, Yong Liu, Sheng Tao, Yuhang Lin, Yukai Ma

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruoyu Wang, Yong Liu, Sheng Tao, Yuhang Lin, Yukai Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人第一次探索一间全新且昏暗的房子。它的目标是构建一个完整的房间三维心理地图,在行走的同时,精确掌握墙壁、椅子和桌子的位置以及它们的材质。

本文介绍了一种名为VEOcc的新系统,它能帮助机器人以前所未有的精度完成这一任务。其工作原理如下,简单说明:

问题所在:“团块”与“网格”

以往的方法试图利用漂浮的“团块”(称为高斯分布)来构建地图。这就像试图仅用漂浮的、柔软的棉花糖来搭建一座房子的精细模型。

  • 问题所在:棉花糖光滑圆润。它们非常适合表现柔和的云彩,但完全无法呈现锐利的角落、薄墙或桌子的边缘。此外,它们还需要你在开始建造之前先猜测房子的大小,如果你从未去过那里,这几乎是不可能的。

VEOcc通过采用3D 网格(就像一个巨大的、无形的乐高结构)改变了游戏规则。

  • 优势:它不再使用柔软的团块,而是使用微小的、坚硬的立方体(体素)。这非常适合捕捉锐利的边缘、角落和平面墙壁。它无需在事前猜测房子的大小;只需随着机器人进入新区域,不断添加新的乐高积木即可。

三步“智能更新”系统

这项工作最困难的部分在于,机器人的“眼睛”(摄像头)可能会产生混淆。有时,因为距离太远,墙壁看起来模糊不清;或者从新角度看,椅子显得不同。如果机器人盲目地信任每一次新的观察,其地图就会变得杂乱无章且充满噪点。

VEOcc 采用了一种特殊的三步策略来消除噪点并构建完美的地图:

  1. “时间旅行”检查(跨时间对数几率聚合)
    想象你从两个不同的角度观察一幅画。从一边看,它是蓝色的;从另一边看,它呈现紫色。该模块就像一个侦探,将机器人此刻看到的景象与片刻之前看到的景象进行比对。它能判断出哪个视角更可靠,并将两者融合,从而还原出真实的颜色。

  2. “信任度计”(可靠性感知置信度调制)
    并非所有视角都同等有效。正对摄像头的墙壁清晰可见,而角落远处的墙壁则模糊不清。该模块就像一个信任度计。它会自动降低那些模糊、遥远或位于屏幕边缘的观测数据的“置信度”评分。它告诉系统:“不要像信任清晰区域那样信任这个模糊的斑块。”

  3. “智能归档系统”(置信度驱动的增量状态更新)
    现在,机器人必须决定如何更新其主地图。它不是简单地用新信息覆盖旧信息,而是采用加权平均。

    • 如果新观测具有高信任评分,它在更新地图时将获得更大的权重。
    • 如果新观测具有低信任评分(因为模糊或距离过远),它获得的权重则微乎其微。
    • 随着时间的推移,随着机器人从多个清晰的角度观察物体,“嘈杂”的猜测会逐渐消失,地图将变得晶莹剔透。

结果

作者通过两种方式测试了该系统:

  • 局部预测:观察房间的单一快照。与旧的“棉花糖”方法相比,VEOcc 在绘制锐利线条和识别物体方面表现优异得多。
  • 具身预测:机器人四处走动并随时间构建地图。VEOcc 构建了更准确、更稳定的地图,且不会因自身的移动而感到困惑。

“魔法”测试
最令人印象深刻的是,他们在一个从未见过的真实房子里,用智能手机拍摄的视频中测试了 VEOcc。该系统从未针对该特定房屋进行过训练。然而,它无需任何额外调整就构建了准确的地图。这证明了该系统足够稳健,能够应对混乱且不可预测的现实世界。

总结

VEOcc 就像将机器人的大脑从使用柔软、模糊的棉花糖升级为精密、可互锁的乐高积木。通过利用一个能检查时间、测量信任度并仔细归档新信息的智能系统,它使机器人能够快速、准确地探索和理解新环境,而无需事先知晓房间的大小。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →