← 最新论文
💻 computer science

Learning Adaptive Semantic Gaussian Allocation for 3D Occupancy

本文介绍了 SAGFormer,这是一个基于 Transformer 的框架,通过显式地选择最有用的高斯函数,解决了语义 3D 高斯表示中的分配瓶颈问题,从而提高了 3D 占用预测中的内存效率和语义一致性。

原作者: Kanglin Ning, Yiran Zhao, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Kanglin Ning, Yiran Zhao, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅用几只发光的、漂浮的气球,来构建一张繁忙城市街道的完美 3D 地图。这就是 3D 语义占用预测(3D semantic occupancy prediction) 的世界——在这个领域,计算机不仅要理解事物在何处(比如汽车或树木),还要理解它们“是什么”,甚至在黑暗区域或被其他物体遮挡的情况下也能理解。为了实现这一目标,科学家们使用了“语义高斯体(Semantic Gaussians)”。不要把它们仅仅看作数学方程,而要将它们视为在空间中漂浮的、带有颜色和形状的隐形模糊云团。当你用光照射它们时,它们便能描绘出一幅场景图景。目标是仅使用足够数量的这些云团,来绘制出一张清晰、准确的地图,而不至于因为使用过多的云团而导致你的计算机因负荷过重而崩溃。

长期以来,研究人员一直致力于让这些云团更好地塑造形状或出现在正确的位置。但其中隐藏着一个问题:即使在允许固定数量云团的情况下,计算机也经常在浪费这些云团。它可能会在空旷的天空中放置十个蓬松的云团,却在建筑物的复杂、棘手的角落里只留下一个微弱的云团。这就像你为一场派对准备了预算,却把所有的钱都花在了给空桌子准备额外的餐巾纸上,而舞池里却连音乐都没有。计算机需要一种更聪明的方式来决定保留哪些云团以及剔除哪些云团,确保每一个云团都能在地图上赢得一席之地。

于是,由哈尔滨工业大学和鹏城实验室的宁康林及其团队提出的新方法 SAGFormer 应运而生。他们意识到,问题不仅仅在于制造更好的云团,而在于如何明智地分配它们。他们为这些漂浮的云团建立了一个“交通警察”系统,这个系统就像是一个严格而公正的才艺表演评委。

以下是 SAGFormer 的工作原理:想象你有一个装有 10,000 个潜在云团的袋子。SAGFormer 不仅仅是挑选前 10,000 个看起来还不错的云团,而是让每个云团进行一场小型的“试镜”。它会询问云团:“你是否处于一个无聊、空旷的位置?你是否对自己在汽车还是树木之间感到困惑?你是否与邻居重叠过多?”根据这些问题的答案,系统会决定一个云团应该是保留、分裂成两个更小的云团以覆盖复杂的边缘、克隆以填补空白,还是被抑制(减弱作用)因为它毫无用处。

这种神奇之处在于,该系统会观察每个云团的“局部邻域”。如果一个云团站在一面简单、平坦的墙壁旁,它可能会被告知缩小或消失,因为它没做什么贡献。但如果一个云团悬停在一个复杂的交叉路口(例如汽车与行人交汇处),系统就会说:“你很重要!留下,或者甚至分裂成两个来覆盖两侧!”这个过程发生在 Transformer(一种智能 AI 大脑)内部,它会对每一个候选云团进行评分,并选出最优秀的那些来构成最终的地图。

结果非常令人印象深刻。在经过 nuScenesSSCBench-KITTI-360 等真实驾驶数据集测试时,SAGFormer 不仅让地图看起来更漂亮,还让地图变得更聪明。在 nuScenes 测试中,使用约 16,600 个云团的固定预算,该方法将识别物体的准确度(以 mIoU 衡量)从 27.00% 提升到了 28.47%。更重要的是,它解决了“浪费”问题。在以前的一些旧方法中,近 52% 的云团基本上是“未使用”的——它们在空旷的空间中漂浮,毫无作用。SAGFormer 将这种浪费减少到了仅 7.85%。它还减少了“语义混合”现象,即单个云团产生混淆,试图同时成为两种不同的东西,从而使最终的地图更加清晰。

研究人员指出,这种明确管理在哪里以及使用多少云团的方法,是一个至关重要的缺失环节。这不仅仅是关于拥有更好的工具,更是关于如何以最聪明的方式使用你手中的工具。虽然该方法在结合相机和 LiDAR 数据(如自动驾驶汽车所使用的)时表现最佳,但团队也指出,它目前在处理单帧快照中的快速移动物体时略显吃力,这表明对于动态场景,它可能需要与其他基于时间的推理工具合作。但对于静态场景,SAGFormer 证明了精明的分配可以产生巨大的威力,将混乱的数据云转化为一个精确、高效且高度准确的 3D 世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →