自动驾驶汽车和移动机器人通过构建周围环境的三维地图来导航世界,它们利用被称为激光雷达(LiDAR)的传感器来完成这项任务。这些设备发射快速的光脉冲,并测量光束反射回来的时间,从而创建一个代表附近所有物体形状和位置的密集点云。为了理解这个点云,车辆的计算机必须进行语义分割:这是一个为每一个点进行标记的过程,以识别该点属于道路、行人、建筑物还是树木。这种理解是安全导航的基础,使机器能够区分无害的灌木丛和正在过马路的行人。多年来,研究人员开发了日益复杂的计算机程序来进行这种标记,并在以清晰、整洁的城市街道扫描为特征的标准数据集上对它们进行测试。然而,这些标准测试往往无法捕捉到现实世界的复杂性,例如雨水会扭曲光线,不同车型的传感器存在差异,而且最关键的错误不仅仅是遗漏细节,而是误判了关乎生死的物体。
一个研究小组提出了一种衡量这些系统的新方法,这种方法超越了实验室基准的纯净条件,旨在探究一个模型是否真正做好了上路准备。他们认为,目前的评估方法过于狭隘,侧重于可能并不如宏观安全类别那么重要的细粒度细节,并且忽略了现实世界中的传感器会退化以及环境会变化的事实。为了解决这个问题,他们创建了一个统一的测试协议,衡量三个特定的维度:系统对宏观安全类别的理解程度、在传感器数据受到天气或硬件缺陷干扰时的表现,以及它是否能在从未见过的全新城市中识别物体。他们在该协议上测试了各种现代计算机视觉架构,并在强大的桌面计算机以及实际驱动真实车辆的更小型嵌入式芯片上运行了这些测试。
研究人员发现,在标准测试中获得高分并不保证系统是安全或可靠的。当他们将详细标签归入更广泛的安全类别时——例如将“汽车”、“卡车”和“巴士”合并为一个“车辆”组——许多系统的表现有所提升,这表明标准测试中的某些错误只是相似物体之间的无害混淆。然而,这种提升并非普遍现象;一些在细粒度细节上表现良好的系统,在通过安全优先级的视角观察时,实际上在正确识别行人及骑行者等脆弱路用者方面表现挣扎。这揭示了一个差距:一个模型在技术上可能是准确的,但如果它无法将人识别为人,在实际应用中则可能是危险的。
该研究还将这些系统置于八种不同类型的模拟传感器数据损坏中,以模拟现实世界中的问题,如雾、雨、雪、运动模糊和传感器故障。结果显示,几乎所有的方法在这些条件下都出现了显著的性能下降,证明了目前的模型在面对不可预测的天气时不够鲁棒。损坏的类型至关重要:虽然某些架构能很好地处理缺失数据,但另一些架构在传感器引入噪声或物理扫描结构发生改变时则会崩溃。此外,研究人员发现了一个艰难的权衡:那些对这些损坏最具鲁棒性的系统通常需要更多的计算能力,这使得它们变得更慢,不适合在行驶中的汽车进行实时处理。
最具有启发性的测试或许是领域泛化挑战,即要求在由一个城市的数据训练的模型,在街道、天气甚至激光雷达传感器都不同的另一个完全不同的城市中运行。几乎所有系统的性能在这一场景下都崩溃了。在某一地点训练的模型无法在另一地点识别物体,尤其是当传感器硬件本身发生变化时。这表明,当前一代人工智能严重依赖于其训练数据的特定模式,而不是学习对世界的普遍理解。研究人员得出结论,尽管这些系统在实验室中令人印象深刻,但它们尚未准备好应对现实世界,因为它们缺乏跨不同环境进行泛化的能力,也无法在传感器不完美时保持可靠性。他们的工作为评估这些技术提供了一个新的、更现实的标准,强调了真正的部署就绪度需要平衡准确性、安全意识和韧性,而目前没有任何单一的方法能够实现这一点。
技术摘要:迈向面向实际部署的鲁棒 LiDAR 语义分割
问题陈述
尽管近年来的先进 LiDAR 语义分割方法在 SemanticKITTI 和 nuScenes 等标准基准测试上取得了强劲的表现,但现有的评估协议在评估实际部署就绪度方面仍然不足。目前的基准测试主要关注干净、单领域的数据以及细粒度的标签分类法。这种方法未能解决自动驾驶系统对以下三个关键环节的需求:
- 安全关键型语义(Safety-Critical Semantics): 细粒度的区分(例如汽车与卡车)可能会对那些不影响安全决策但属于语义合理的预测进行惩罚。
- 恶劣条件(Adverse Conditions): 模型很少在现实的传感器退化(大气、几何及传感器诱发的损坏)条件下进行评估。
- 领域偏移(Domain Shift): 在没有适配的情况下,模型在跨领域变化(不同的传感器、环境及采集条件)下的表现很大程度上未得到评估。
此外,目前尚无统一的协议能够同时评估语义相关性、鲁棒性、泛化能力和计算效率。
方法论
作者提出了一个围绕三个互补维度组织的结构化评估协议,并将其应用于一组具有代表性的先进架构(包括基于点、基于投影、基于稀疏卷积以及基于融合的方法)。所有模型均在一致的训练设置下从头开始重新训练,以确保公平比较。
1. 粗粒度标签评估(安全评估)
为了使评估与自动驾驶的安全优先级保持一致,作者采用了 COLA 框架。该方法将细粒度类别归纳为七个粗粒度类别:可行驶地面(Driveable Ground)、其他地面(Other Ground)、结构物(Structure)、车辆(Vehicle)、自然物(Nature)、生物(Living Being) 以及 物体(Object)。
- 目标: 分析标签粒度如何影响性能,并揭示高细粒度准确率是否掩盖了在安全关键类别中的失效(例如,将行人误认为车辆)。
- 指标: 粗粒度标签平均交并比 (mIoUCOLA)。
2. 鲁棒性评估(恶劣条件)
在干净数据上训练的模型直接在 Robo3D 基准测试 中的损坏版本数据集(nuScenes-C 和 SemanticKITTI-C)上进行评估,且不进行微调。
- 损坏类型: 八种类型分为三组:
- 大气类(Atmospheric): 雾、湿地、雪。
- 几何类(Geometric): 运动模糊、光束缺失。
- 传感器类(Sensor): LiDAR 串扰、不完整回波、跨传感器干扰。
- 指标: 平均损坏误差 (mCE),相对于基准模型(MinkowskiNet)进行归一化处理。
- 效率: 推理速度在嵌入式 NVIDIA Jetson AGX Orin 上进行测量,以量化实时性约束(目标是 SemanticKITTI >10 FPS 且 nuScenes >20 FPS)。
3. 领域泛化评估
该协议评估模型在无需适配的情况下在未知目标领域运行的能力。
- 协议: 单源到单目标的迁移。模型在 SemanticKITTI 或 nuScenes 上训练,并直接在 ParisLuco3D 上进行评估。
- 挑战: 该设置引入了地理环境、采集条件的变化,以及在 SemanticKITTI 的案例中,传感器特性的变化(HDL-64E 对比 HDL-32E)。
核心结果
粗粒度标签性能
- 粒度影响: 所有方法在从细粒度向粗粒度标签评估过渡时,其 mIoU 均有所提升,这表明许多细粒度误差属于类内误差,且对安全性影响较小。
- 架构差异: 基于点的方法(如 PTv3)在 nuScenes 上实现了最高的粗粒度准确率,但推理速度较低(例如 4.1 FPS)。基于投影的方法提供了高吞吐量,但在安全关键的“生物”类别上表现挣扎(例如,FRNet 在 SemanticKITTI 上的生物类别准确率仅为 55.6%)。
- 权衡: 基于融合的方法(如 HARP-NeXt)在准确性、安全关键感知和实时性能之间提供了平衡的折衷方案。
对损坏的鲁棒性
- 普遍退化: 所有方法在受到损坏影响时都出现了显著的性能下降,没有任何一种架构能在所有类别中占据主导地位。
- 架构特征:
- 基于稀疏卷积的方法(如 Minkowski)由于采用了基于体素的空间聚合,在几何损坏方面表现出较强的鲁棒性。
- 基于投影的方法 表现出异质性结果;FRNet 通过保留点级特征在同类方法中表现优于其他模型,但计算成本极高。
- 传感器损坏 对所有架构来说仍然极具挑战性,凸显了模型对特定传感器伪影的鲁棒性有限。
- 数据集依赖性: 与 nuScenes 相比,模型在 SemanticKITTI(点云更密集)上的几何和传感器退化表现出更高的敏感性。
领域泛化
- 性能下降: 所有方法的向 ParisLuco3D 的泛化表现均较差,顶尖方法的 mIoU 仅约为 32%(相比之下,源域上超过 70%)。
- 传感器偏移影响: 从 SemanticKITTI (HDL-64E) 到 ParisLuco3D (HDL-32E) 的偏移导致的性能下降比 nuScenes 到 ParisLuco3D(传感器相同)的偏移更为严重,强调了实现传感器不变性泛化的难度。
- 架构趋势: 基于稀疏卷积的方法(Minkowski, SPVCNN)通常优于其他方法。值得注意的是,HARP-NeXt 展示了比其他基于投影的方法更好的泛化能力,这表明特定的架构选择(例如深度可分离卷积)可以减轻对源域模式的过拟合。
意义与主张
本文主张,干净基准测试的准确率是预测部署就绪度的糟糕指标。所提出的协议揭示了标准基准排名与自动驾驶实际需求之间的具体差距:
- 安全性相关性: 高细粒度准确率并不保证安全相关的性能,特别是在涉及弱势道路使用者时。
- 鲁棒性差距: 当前的方法过度拟合了干净的数据分布,并在现实的传感器损坏下性能大幅下降。
- 泛化极限: 在没有适配的情况下,领域泛化对于可靠部署而言仍然不足。
作者得出结论,目前没有任何一种先进方法能在准确性、鲁棒性、泛化能力和计算效率之间实现强大的平衡。所提出的统一协议为更具实际意义的评估提供了参考,强调了未来模型设计应优先考虑传感器不变性架构和鲁棒性感知训练策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。