← 最新论文
💻 computer science

OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Predictio

该论文介绍了 OccAnyScene,这是一种新颖的以像素为视锥中心的高斯框架,它通过利用预训练的深度模型来自适应地处理不同的相机配置、空间尺度和语义分类法,从而在多种室内外场景中实现了最先进的统一 3D 语义占用预测。

原作者: Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一张完美的 3D 世界地图,但你手里只有一个平面的 2D 相机来观察它。这就是机器人和自动驾驶汽车试图理解周围环境时面临的日常挑战。它们不仅需要知道墙壁和树木在哪里,还需要知道隐藏在它们背后的东西是什么。科学家们称之为“3D 占据预测”(3D occupancy prediction)。把它想象成一个数字雕塑家,它通过一张扁平的照片,尝试推测整个房间或街道的形状,用隐形的方块填补那些看不见的部分。长期以来,这些数字雕塑家就像是只能在特定类型房间里工作的专家:一个受过整理凌乱卧室训练的雕塑家,无法突然切换到绘制繁忙的高速公路,因为测量距离的规则、方块的大小甚至物体的名称都完全不同。

这篇论文探讨了一个重大问题:我们能否构建一个单一的“通用雕塑家”,既能处理温馨的室内客厅,又能处理广阔的室外城市街道,而不会感到困惑?作者们认为,过去那种为每种不同环境都准备独立模型的方法过于笨重且难以管理。他们想要一个足够灵活的系统,能够在这两者之间切换——从拥有微小、精细方块的小房间,到拥有巨大、粗略方块的巨型街道——同时使用同一个大脑。

这项研究背后的团队引入了一种名为 OccAnyScene 的新方法。他们不再试图将一个僵化的网格强加于每个场景,而是将每一个像素(构成照片的微小点)都视为一束向世界射出的手电筒光束。他们意识到,一个像素不仅仅指向空间中的一条线;它实际上覆盖了一个圆锥形的区域,就像随着距离增加而逐渐变宽的手电筒光束一样。他们称之为“视锥体”(frustum)。

以下是他们的魔术技巧是如何运作的。首先,他们使用一个预训练的“深度专家”(一个已经非常擅长猜测物体远近的模型)来获取场景的大致轮廓。然后,他们使用了一个巧妙的两步过程。第一步,他们称之为像素对齐视锥特征聚合(Pixel-Aligned Frustum Feature Aggregation),通过收集周围区域的线索,来推断可能隐藏在可见物体背后的东西。这就像是通过观察椅子的影子来猜测背后的墙壁在哪里。第二步,视锥参数化高斯构建(Frustum-Parameterized Gaussian Construction),将这些线索转化为 3D 形状。他们并没有尝试用绝对的术语来猜测 3D 物体的精确大小和位置(因为要在一个小玩具和一个巨大的卡车之间取得平衡,这简直是一场噩梦),而是让 3D 形状的大小根据“手电筒光束”在特定距离下的宽度进行伸缩。这使得系统能够自然地适应它是在观察一个小房间还是一个巨大的高速公路。

结果令人印象深刻。当他们在室内场景数据集(Occ-ScanNet)上测试这个单一模型时,它在识别物体和结构方面的准确率达到了 59.92%。当它切换到室外驾驶场景数据集(SurroundOcc-nu센es)时,得分是 23.06%。至关重要的是,论文表明,这个单一且灵活的模型表现得与那些仅针对某一类场景进行训练的专门模型一样出色。这表明,我们不需要为每种环境都准备一个不同的机器人大脑;一个具有适应能力的大脑就可以学习如何在不失精准度的前提下,在 3D 空间中观察世界。作者发现,通过让 3D 形状根据摄像机的视角进行“呼吸”并改变大小,他们可以填补物体背后隐藏部分的空白,从而无论是在卧室还是在城市街道,都能创造出一个完整的世界图景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →