✨ 要点🔬 技术摘要
想象一下,你正试图构建一张完美的 3D 世界地图,但你手里只有一个平面的 2D 相机来观察它。这就是机器人和自动驾驶汽车试图理解周围环境时面临的日常挑战。它们不仅需要知道墙壁和树木在哪里,还需要知道隐藏在它们背后的东西是什么。科学家们称之为“3D 占据预测”(3D occupancy prediction)。把它想象成一个数字雕塑家,它通过一张扁平的照片,尝试推测整个房间或街道的形状,用隐形的方块填补那些看不见的部分。长期以来,这些数字雕塑家就像是只能在特定类型房间里工作的专家:一个受过整理凌乱卧室训练的雕塑家,无法突然切换到绘制繁忙的高速公路,因为测量距离的规则、方块的大小甚至物体的名称都完全不同。
这篇论文探讨了一个重大问题:我们能否构建一个单一的“通用雕塑家”,既能处理温馨的室内客厅,又能处理广阔的室外城市街道,而不会感到困惑?作者们认为,过去那种为每种不同环境都准备独立模型的方法过于笨重且难以管理。他们想要一个足够灵活的系统,能够在这两者之间切换——从拥有微小、精细方块的小房间,到拥有巨大、粗略方块的巨型街道——同时使用同一个大脑。
这项研究背后的团队引入了一种名为 OccAnyScene 的新方法。他们不再试图将一个僵化的网格强加于每个场景,而是将每一个像素(构成照片的微小点)都视为一束向世界射出的手电筒光束。他们意识到,一个像素不仅仅指向空间中的一条线;它实际上覆盖了一个圆锥形的区域,就像随着距离增加而逐渐变宽的手电筒光束一样。他们称之为“视锥体”(frustum)。
以下是他们的魔术技巧是如何运作的。首先,他们使用一个预训练的“深度专家”(一个已经非常擅长猜测物体远近的模型)来获取场景的大致轮廓。然后,他们使用了一个巧妙的两步过程。第一步,他们称之为像素对齐视锥特征聚合 (Pixel-Aligned Frustum Feature Aggregation),通过收集周围区域的线索,来推断可能隐藏在可见物体背后的东西。这就像是通过观察椅子的影子来猜测背后的墙壁在哪里。第二步,视锥参数化高斯构建 (Frustum-Parameterized Gaussian Construction),将这些线索转化为 3D 形状。他们并没有尝试用绝对的术语来猜测 3D 物体的精确大小和位置(因为要在一个小玩具和一个巨大的卡车之间取得平衡,这简直是一场噩梦),而是让 3D 形状的大小根据“手电筒光束”在特定距离下的宽度进行伸缩。这使得系统能够自然地适应它是在观察一个小房间还是一个巨大的高速公路。
结果令人印象深刻。当他们在室内场景数据集(Occ-ScanNet)上测试这个单一模型时,它在识别物体和结构方面的准确率达到了 59.92% 。当它切换到室外驾驶场景数据集(SurroundOcc-nu센es)时,得分是 23.06% 。至关重要的是,论文表明,这个单一且灵活的模型表现得与那些仅针对某一类场景进行训练的专门模型一样出色。这表明,我们不需要为每种环境都准备一个不同的机器人大脑;一个具有适应能力的大脑就可以学习如何在不失精准度的前提下,在 3D 空间中观察世界。作者发现,通过让 3D 形状根据摄像机的视角进行“呼吸”并改变大小,他们可以填补物体背后隐藏部分的空白,从而无论是在卧室还是在城市街道,都能创造出一个完整的世界图景。
技术摘要:OccAnyScene
问题陈述
3D 语义占用预测对于自动驾驶和具身智能中的全方位场景理解至关重要。然而,现有的方法主要具有特定场景性(scene-specific) ,即针对固定的空间范围、体素分辨率、相机配置和语义分类进行设计。这种专业化限制了通用型 3D 感知的发展。
本文引入了 跨场景 3D 语义占用预测(Cross-Scene 3D Semantic Occupancy Prediction) ,这是一个新的任务设定,要求单个模型能够同时处理异构的室内和室外场景。这一设定提出了一个根本性的挑战:实现**度量一致且场景自适应(metric-consistent yet scene-adaptive)**的图像到 3D 提升(image-to-3D lifting)。
度量不一致性: 室内场景(如房间)需要细粒度、短距离的感知,而室外场景(如街道)则需要粗粒度、长距离的感知。
参数化难度: 现有的基于高斯的方法难以应对,因为遮挡补全所需的绝对偏移量和尺度在不同领域之间差异巨大。由于相机内参和场景深度的不同,学习一个共享的绝对参数化是非常困难的。
方法论:OccAnyScene
为了应对这些挑战,作者提出了 OccAnyScene ,这是一个基于预训练深度基础模型(如 DepthAnythingV2/V3)的像素-视锥中心高斯框架(pixel-frustum-centered Gaussian framework) 。该框架将与每个特征像素相关的有限 3D 视锥视为构建连续场景表示的基本单元,而不是依赖于固定的体素网格或单条射线。
该架构由两个主要模块组成:
1. 像素对齐视锥特征聚合 (PFFA)
该模块为每个特征像素构建一个感知相机的视锥查询,以推理遮挡区域。
输入: 它接收来自深度基础模型 DPT 头部的密集几何特征 (F g e o F_{geo} F g eo ) 和来自其 ViT 编码器的视觉 Token。
初始化: 利用几何线索和根据内参推导出的相机射线方向来初始化像素查询。
上下文聚合: 该模块将序列化的 ViT Token 恢复为 2D 网格,并执行像素对齐的可变形交叉注意力(pixel-aligned deformable cross-attention) 。它聚合了特征像素周围的语义和结构线索,生成一个编码了可见表面几何、观测几何和局部上下文的视锥查询。
2. 视锥参数化高斯构建 (FPGC)
该模块将每个视锥查询解码为多个高斯原语(每个像素 K K K 个高斯),其位置和尺度受预测的像素深度和视锥几何的约束。
深度锚定: 为了确保在具有不同内参的数据集之间的度量一致性,模型使用轻量级 MLP 预测一个规范相机表面深度(canonical-camera surface depth, D s u r f D_{surf} D s u r f ) 。这作为一个通用的深度锚点。
定位:
深度增量 (Δ d p , k \Delta d_{p,k} Δ d p , k ): 模型不仅将高斯放置在表面,还预测深度增量,以便将表示从可见表面扩展到遮挡区域。
亚像素偏移 (Δ u p , k \Delta u_{p,k} Δ u p , k ): 为了补偿下采样特征像素的粗糙性,有界的亚像素偏移允许高斯中心在相应的像素视锥内进行横向移动。
尺度参数化: 为了避免学习不稳定的绝对尺度,模型使用视锥相对尺度(frustum-relative scale) 。它根据高斯所在深度的视锥度量截面计算一个标量视锥尺度参考值 (b p , k b_{p,k} b p , k )。随后,解码器预测一个无量纲的相对尺度 (s ^ p , k \hat{s}_{p,k} s ^ p , k ),并将其与参考值相乘以确定最终的高斯大小。这使得空间支撑能够自动适应不同的相机参数和场景范围。
输出: 生成的高斯通过可学习的分类矩阵映射到特定场景的语义分类,并被 Splat(泼溅)到目标体素网格上。
核心贡献
任务定义: 本文正式引入了跨场景 3D 语义占用预测 ,即一个模型必须共同学习来自具有不同协议的异构室内和室外场景的任务。
框架设计: 提出了 OccAnyScene ,一个像素-视锥中心的高斯框架。它通过以下方式统一了占用预测:
PFFA: 用于构建能够推理遮挡的视锥查询。
FPGC: 用于场景自适应的高斯构建,通过相对于视锥几何进行位置和尺度的参数化,实现了在不同尺度和内参下的稳定性。
性能: 大量的实验证明,OccAnyScene 在室内(Occ-ScanNet)和室外(SurroundOcc-nuScenes)基准测试上均达到了最先进(SOTA)的结果。至关重要的是,跨场景模型表现出的性能与单独训练的特定场景模型相当,证明了统一模型可以在不产生显著性能下降的情况下处理多样化的环境。
实验结果
室内 (Occ-ScanNet): 使用 DAv3 编码器,该模型在跨场景设置下实现了 59.51% mIoU ,几乎达到了特定场景模型的性能 (59.92% mIoU ),并优于其他跨场景适配方法(例如,SplatSSC† 的性能大幅下降)。
室外 (SurroundOcc-nuScenes): 使用 DAv3 编码器,该模型在跨场景设置下实现了 22.87% mIoU ,同样与其特定场景对应物 (23.06% mIoU ) 相当,并优于适配后的基准模型。
效率: OccAnyScene-DAv2 展示了极高的效率,拥有 98.2M 参数,在 RTX 4090 上推理时间为 86.4ms,显存占用为 670 MiB,与之前的研究(如 EmbodiedOcc 和 SplatSSC)相比,内存占用降低了 80% 以上。
消融实验:
移除 PFFA 或 FPGC 会导致性能显著下降,证实了基于视锥的特征聚合和参数化的必要性。
“视锥相对尺度”和“深度增量”对于处理度量变化和遮挡补全至关重要。
将每个像素的高斯数量 (K K K ) 从 1 增加到 3 仅带来微小的收益,这表明遮挡补全主要是通过相邻像素的集体贡献而非单个视锥内的深度堆叠来实现的。
意义与主张
论文声称 OccAnyScene 通过从固定的空间表示转向一种能够适应相机几何和场景范围的几何参考 ,成功解决了跨场景占用预测的难题。
作者断言,他们的方法允许将房间规模和街道规模的占用预测整合到一个单一的前馈模型 中。这消除了为不同环境维护和切换独立模型的需求,从而简化了在多样化环境下运行的自主系统的部署和扩展。这项工作证明,通过正确的几何参数化(像素-视锥中心),统一模型可以实现与专门化模型相当的性能,同时保持极高的计算效率。
承认的局限性: 作者指出,目前的评估仅限于两个数据集(Occ-ScanNet 和 SurroundOcc-nuScences),尚未展示对任意未见场景的泛化能力。此外,像素-视锥表示本质上仅覆盖相机视野内的区域;环视设置中相机之间的间隙通过一小组补充的空间查询来填充,虽然这对整体指标的影响很小,但也表明了在覆盖完全位于相机视野之外的区域方面的局限性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。