✨ 要点🔬 技术摘要
想象一下你正在驾驶一辆汽车,但你的眼睛看到的不是 3D 世界,而是平面的 2D 图片。为了安全驾驶,你的大脑(或者在这种情况下是汽车的计算机)需要构建一个关于周围环境的 3D 心智地图:哪里是路,哪里是行人,以及哪里是空旷空间,这样才不会发生碰撞。
这篇论文介绍了一种名为 QueryOcc 的新方法,它教会计算机仅通过观察一系列照片就能构建出 3D 地图,而不需要依赖昂贵的人工来为它绘制地图。
以下是其工作原理的拆解,通过简单的概念进行说明:
1. 问题所在:“老师”太贵了
通常,为了教会计算机如何进行 3D 视觉感知,人类必须手动标注数百万个 3D 空间中的点(就像在为一个 3D 填色书涂色)。这极其缓慢且昂贵。
旧方法: 一些之前的 AI 试图通过“猜测”并检查 2D 图片是否看起来正确来进行学习(就像只通过观察拼图的边缘碎片来尝试解开拼图)。另一些方法使用了激光扫描仪(LiDAR),但必须将世界切割成微小的、僵硬的乐高积木(体素/voxels),这使得地图看起来充满了颗粒感,并限制了汽车的“视野”范围。
2. 解决方案:直接提问(“查询”部分)
QueryOcc 并不试图重建整个画面或将世界切成块,它更像是一个通过提出特定问题来进行侦查的侦探。
类比: 想象你在一个黑暗的房间里,想要知道那里有什么。你不需要打开灯看清整个房间,而是将一根细长的探测器(一个“查询/query”)伸进空气中的某个特定位置,然后问道:“这里有一辆车吗?”或者“这是空旷空间吗?”
它是如何学习的: 系统在 3D 空间的不同位置和不同时间提出数千个这样的问题。它会将自己的答案与“伪标签”(由其他 AI 模型或激光扫描数据生成的智能猜测)进行对比。如果系统说“这里有一辆车”,但数据却显示“没有”,它就会从错误中学习。这个过程直接在 3D 空间中发生,而不是试图去重建一张 2D 照片。
3. 魔术技巧:“折叠地图”(收缩表示法)
汽车需要看到紧贴着自己的事物(比如从路缘走下的行人)时具有高细节度,但它同时也需要看到远处的物体(比如 100 米外的汽车)。
问题: 如果你试图用同样的细节水平来绘制所有东西,你的计算机就会耗尽内存。这就像试图把世界地图画在一张纸上:城市会变得太小看不清,或者这张纸必须有足球场那么大。
解决方案: QueryOcc 使用了一种“折叠地图”技术。
靠近汽车的地方: 地图被展开并放大。每一寸都细节丰富。
远离汽车的地方: 地图被平滑地“压缩”或“折叠”起来。远处的山脉被挤压在一起。
为什么有效: 这使得计算机可以使用相同的内存量来记住整个世界(近处和远处),同时在汽车行驶的关键区域保持重要的细节。
4. 结果:快速且准确
论文声称这种方法比之前的技术有了巨大的进步:
准确性: 它在理解场景的 3D 形状和含义方面,比之前的最佳方法提高了 26% 。
速度: 它的运行速度足以用于实时驾驶(大约每秒 11.6 帧),这意味着它可以跟上在高速公路上行驶的汽车。
灵活性: 即使汽车只有摄像头,或者同时拥有摄像头和激光扫描仪,它也能正常工作。它可以混合使用这些数据源。
总结
QueryOcc 是自驾汽车学习如何观察 3D 世界的一种新方式。它不再等待人类来绘制地图,也不再试图构建一个巨大的、块状的乐高模型,而是通过询问关于空间中特定点的直接问题,并利用“折叠地图”的技巧,既能看到近处的细节,又能看到远方的地平线,而不会耗尽内存。其结果是一个更聪明、更快、更准确的 3D 视觉系统,能够实现自主学习。
技术摘要:QueryOcc
问题陈述
从图像中学习 3D 场景几何与语义是自动驾驶领域的一项基本挑战,然而大规模的 3D 标注成本极高。现有的自监督方法面临显著局限性:
基于渲染的方法: 这些方法依赖于 2D 图像重建的一致性。虽然具有可扩展性,但它们仅提供间接的几何信号,其中 3D 结构是图像合成的副产品,而非显式的学习目标。它们通常依赖于外部估计的深度图来维持稳定性。
基于 Lidar 的方法: 这些方法提供了显式的 3D 监督,但依赖于将聚合的点云离散化为预定义的体素网格(voxel grids)。这种方法限制了空间精度、可扩展性以及高效表示无界场景的能力。
本文认为,在连续的 4D 时空(space-time)中进行直接监督,比基于渲染或体素化的 Lidar 方法能为自监督 3D 语义占用(occupancy)学习提供更清晰的几何反馈。
方法论:QueryOcc
QueryOcc 是一个基于查询(query-based)的自监督框架,它直接从多视图图像(以及可选的 Lidar)中学习连续的 3D 语义占用,无需渲染损失或体素聚合。
1. 模型架构
该框架遵循一个模块化的四阶段流水线:
图像编码(Image Encoding): 多视图图像通过预训练的主干网络进行处理以提取密集特征。相机标定参数通过轻量级 MLP 进行编码,以提供相机特定的上下文信息。
提升-收缩-溅射(Lift-Contract-Splat, LCS): 这是处理无界场景的核心创新。它扩展了提升-溅射-射击(LSS)公式,包含三个关键组件:
点向编码(Point-wise Encoding): 模型不再是溅射原始特征,而是通过一个可学习函数显式地对可见性、不确定性和时间线索进行编码。这使得模型能够表示已占据区域和未观察到的区域。
对数线性深度分箱(Log-Linear Depth Binning): 为了平衡近场分辨率与远场覆盖范围,深度分箱在近场区域(d n e a r d_{near} d n e a r )之外使用呈指数增长的间距,而非均匀间距。
轴对齐收缩(Axis-Aligned Contraction): 为了在不受场景范围影响的情况下保持恒定的内存和计算量,轴对齐收缩函数会压缩远处区域,同时保留靠近自车的高分辨率细节。这避免了与扩展 BEV 网格相关的二次方内存增长问题。
BEV 特征处理: 收缩后的 BEV 特征使用 ResBlocks 和多尺度可变形注意力(deformable attention)进行处理,以捕捉局部和全局依赖关系,并使用动态卷积来适应收缩导致的局部缩放。
统一查询解码器(Unified Query Decoder): 一个轻量级解码器用于预测任意 4D 查询(q = [ x , y , z , t ] ⊤ q = [x, y, z, t]^\top q = [ x , y , z , t ] ⊤ )的占用情况和语义。查询被收缩以与 BEV 空间对齐,通过 MLP 编码,并与插值的 BEV 特征进行融合。解码器在输出最终预测之前,会预测偏移量以从附近位置提取特征(模拟可变形注意力)。
2. 自监督训练
该框架直接在连续的 4D 时空中运行,利用随时间观测到的点云生成监督信号。
监督来源:
仅相机(Camera-only): 通过将像素利用视觉基础模型(VFM)预测的度量深度提升到 3D 空间来生成伪点云。这些点云与语义伪标签或密集的 VFM 特征相匹配。
相机-Lidar(Camera-Lidar): 真实的 Lidar 点云作为显式的几何监督,投影到相机视图中以检索语义标签或特征。
统一模式(Unified): 结合上述两种来源。
查询生成: 监督通过从点云中采样的时空 4D 查询进行应用:
负向(未占用)查询: 沿传感器原点到观测点的射线进行采样。
正向(已占用)查询: 在观测点后方的缓冲区内进行采样。
损失函数: 模型使用结合了二元交叉熵(用于占用情况)、分类交叉熵(用于语义)以及 L1 损失(用于 VFM 特征蒸馏)的组合进行训练。
核心贡献
QueryOcc 框架: 一个灵活的、基于查询的框架,能够从多视图图像中学习连续的 3D 语义占用,无需渲染损失或 Lidar 体素化。
无界收缩表示(Unbounded Contractive Representation): 一种新型场景表示法,在保留近场细节的同时平滑压缩远处区域,从而在恒定内存下实现远程监督。这与“提升-收缩-溅射”机制相结合。
最先进的性能(SOTA): 该方法在自监督 Occ3D-nuScenes 基准测试上取得了卓越的结果,在保持实时推理(11.6 FPS)的同时,其语义 RayIoU 超过了以往的方法 26%。
实验结果
在 Occ3D-nuScenes 基准测试上的评估结果如下:
性能: QueryOcc 实现了 23.6% 的语义 RayIoU(增强版 QueryOcc+ 为 25.8%),超过了之前的最优自监督方法(GaussianFlowOcc)26% 。它也将占用 RayIoU 提升了 25%。
效率: 该模型在 A100 GPU 上运行速度为 11.6 FPS ,总延迟为 86ms,显著快于基于渲染的 NeRF 方法(例如 SelfOcc 仅为 1.2 FPS)。
鲁棒性: 模型在各类物体上表现良好,尤其擅长处理细小和纤细的类别(如交通锥、行人)。它对图像编码器的选择(如 ConvNeXt-Base 或 ResNet-50)具有鲁棒性。
消融实验:
直接基于查询的监督显著优于基于渲染的监督(23.6 vs. 15.0 RayIoU),这表明 2D 重建提供的几何约束较弱。
所有提出的组件(对数线性分箱、收缩、点向编码)都对性能提升有所贡献。
结合相机和 Lidar 监督可获得最佳结果,有效地融合了密集的语义线索与精确的几何信息。
性能随输入分辨率提高和额外数据集(如 Argoverse 2)的加入而提升,展示了强大的数据效率和跨领域泛化能力。
意义
论文声称 QueryOcc 为基于相机的自监督 3D 场景理解建立了一个新的基准。其重要性在于证明了直接的 4D 基于查询的自监督 是一个稳健的基础,相比于基于渲染的方法,它能提供更清晰的几何反馈。通过消除对体素化和渲染损失的需求,该框架实现了高几何精度、计算效率以及处理无界场景能力的平衡。这项工作强调,连续的 4D 监督能够使几何和语义作为显式目标进行强力的学习,而不仅仅是图像合成的副产品。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。