✨ 要点🔬 技术摘要
自动驾驶汽车依赖于不断的感官数据流来在现实世界中导航,但“看见”并不等同于“理解”。为了安全驾驶,汽车必须能够区分路面上的标线与从路缘走下的行人,即使那个人身材瘦小、距离较远或被部分遮挡。摄像头提供了丰富的色彩和纹理,使车辆能够识别形状和标志,但它们无法确定地测量距离。激光雷达(Lidar)是一种基于激光的扫描系统,能提供精确的三维几何信息,描绘出空间中物体的形状,但其产生的数据往往较为稀疏,且随着距离增加而变得愈发空洞。多年来,工程师们一直试图将这两种截然不同的信息流融合进一个单一且可靠的图像中。挑战在于如何足够快速地处理这些海量数据以满足实时驾驶的需求,同时确保绝不会遗漏最关键的目标,例如行人和骑行者。
研究人员 Toomas Tahves、Mauro Bellone 和 Raivo Sell 针对这一问题提出了一种名为 CLFTv2 的新方法。他们的工作专注于一种特定类型的人工智能架构,旨在比以往的方法更高效地结合摄像头和激光雷达数据。过去,一些领先的系统使用一种被称为“全局注意力网络”的机制,该机制试图同时观察图像的每个部分和三维扫描的每个部分,以寻找其中的关联。虽然这种方法功能强大,但计算量巨大,需要极高的处理能力,这可能会减慢车辆计算机的运行速度。作者提出用一种层级化的、基于窗口的系统来取代这种全局视野。该模型不再一次性扫描整个场景,而是将图像分解为较小的、移动的窗口,先处理局部细节,然后再构建更广泛的理解。这种结构模仿了人类视觉的工作方式,即在将周围环境整合进更大的语境之前,先关注眼前的即时环境。
团队在代表不同环境的三大主要驾驶数据集上测试了这一新框架:来自瑞典的 Zenseact Open 数据集、来自美国的 Waymo Open 数据集以及来自爱沙尼亚的 ISEAuto 数据集。这些数据集在天气、路况以及数据标注方式上各不相同,为系统的适应性提供了严格的测试。结果显示,CLFTv2 成功地以高可靠性识别了易受伤害的路用者。在 Waymo 数据集上,该系统的性能得分达到了 61.7%,较同类技术的早期版本有了显著提升。在 ZOD 数据集上,它达到了 53.5%,这是一个明显的飞跃,特别是在改进了对行人和交通标志的检测方面。或许最重要的一点是,新系统在实现这一目标的同时,使用的计算能力远低于其竞争对手。它消耗的能量仅为某些现有高性能模型的约一半,且数据处理速度快了两倍以上,这使其成为搭载在真实汽车内有限硬件上的更具实用性的选择。
然而,这项研究也揭示了这些系统在处理信息时存在的一种微妙权衡。虽然基于窗口的方法在大多数数据集上表现得非常高效且有效,但研究人员发现,在包含极其密集且精细的激光雷达扫描的 Waymo 数据集上,拥有全局、全知视角的系统在融合两种数据类型方面仍保持着微弱优势。与全局方法相比,新系统的局部窗口有时难以在如此密集的几何环境中完全“连点成线”。这表明,尽管新架构在效率方面迈出了重要一步,但完美的解决方案最终可能需要一种结合了局部处理的速度与全局注意力的广度的混合方法。
研究人员还检查了系统如何处理不同类型的数据监督。在某些数据集中,地面真值标签是由其他算法而非人工标注生成的,这引入了一层不确定性。尽管如此,新模型学会了良好的泛化能力,表明其结合视觉和几何线索的能力即使在训练数据不完美的情况下也是稳健的。研究证实,对于识别行人等小型关键目标这一特定任务,一个设计精巧、轻量化的融合系统可以胜过许多更沉重、更复杂的模型。通过优先考虑对易受伤害路用者的检测,该系统确保了即便在自动驾驶的计算需求不断增长的情况下,安全依然是首要目标。这项工作证明,在构建更安全自动驾驶汽车的竞赛中,有时一种专注且高效的方法比试图一次性看清一切的蛮力尝试更为有效。
CLFTv2 技术摘要:通过分层特征金字塔实现高效的相机-激光雷达融合用于语义分割
问题陈述 自动驾驶中的语义分割面临一个关键挑战:可靠检测易受伤害道路使用者(VRUs,如行人)的难题。在透视图像中,这些目标的像素足迹通常极小(仅占总像素的 0.3–0.4%),但对安全性至关重要。虽然相机提供了丰富的颜色和纹理,但缺乏度量深度;相反,激光雷达提供了 3D 几何结构,但在远距离处会产生日益稀疏的点云。现有的多模态融合方法往往难以在计算效率与提取远距离小目标可靠特征之间取得平衡。具体而言,基于视觉 Transformer(ViT)的编码器虽然在提取跨模态上下文方面非常有效,但其计算复杂度呈平方级增长,且通常维持单一固定的空间分辨率,这使得生成小目标检测所需的多种尺度特征金字塔在计算上变得异常昂贵。
方法论 作者提出了 CLFTv2 ,这是一个完全在 2D 透视投影域内运行的分层相机-激光雷达融合框架。该架构使用 Swin Transformer 主干网络取代了标准 ViT 的全局注意力机制,并结合了一个轻量级的特征金字塔网络(FPN)风格的解码器。
分层主干网络: CLFTv2 采用两个权重共享的 Swin Transformer 编码器(孪生架构)来处理对齐的 RGB 相机图像和投影后的激光雷达坐标图。激光雷达输入被编码为密集的 3 通道张量(X, Y, Z 坐标),以确保与标准视觉主干网络的结构兼容性。Swin 架构利用**移动窗口自注意力(shifted-window self-attention)**机制,将计算限制在局部 M × M M \times M M × M 窗口内。这使计算复杂度相对于图像分辨率从平方级降低到了线性级。补丁合并层(Patch merging layers)生成了一个四阶段特征金字塔,自然地提供了对于检测小目标至关重要的多尺度表示。
由粗到精的残差融合: 解码器在四个空间尺度(步长分别为 4, 8, 16, 32)上集成来自两种模态的特征。
通道投影: 每个尺度的特征通过 1 × 1 1 \times 1 1 × 1 卷积投影到统一维度(D = 256 D=256 D = 256 )。
模态细化: 模态特定的**残差卷积(ResConv)**单元分别对相机和激光雷达特征进行细化。
融合机制: 该框架采用由粗到精的累积策略。从最粗糙的尺度(阶段 4)开始,经过细化的特征进行逐元素求和。在随后的每个更精细的尺度上,前一个较粗阶段的累积表示经过双线性上采样后,与当前尺度的细化特征相加,然后通过共享的输出 ResConv 单元。这种设计在传播全局语义上下文的同时,保留了细粒度的空间细节。
分割头: 最终融合的表示通过一个包含 3 × 3 3 \times 3 3 × 3 卷积、批归一化(Batch Normalization)、ReLU 以及 1 × 1 1 \times 1 1 × 1 卷积的轻量级头进行处理,随后上采样至原始输入分辨率。
核心贡献
架构: 引入了 CLFTv2,这是一种基于 Swin 的分层融合架构,配备了轻量级的逐尺度残差解码器。它通过利用原生的多尺度几何线索,避免了通用查询驱动解码器(如 Mask2Former)沉重的计算开销。
效率与精度的权衡: 实验证明,CLFTv2 在达到与最先进的查询驱动解码器竞争性的准确度的同时,所需的 GFLOPs 显著更低(比基于 Swin 的 Mask2Former 改编版少 1.4 倍),并提供了 2.2 倍更高的吞吐量。
模态隔离洞察: 一项研究揭示了一个实际的权衡:虽然 Swin 的分层结构改善了小目标的解析度,但其局部窗口注意力机制在充分利用密集、局部化的激光雷达回波方面,表现不如具有全局感受野的 ViT。这表明,对于稠密点云对齐(如 Waymo 数据集所示),全局注意力仍然更优;而局部注意力在稀疏场景下则提供了更高的效率。
泛化能力: 有证据表明,学习到的多模态表示可以跨越不同的传感器特性和地理数据集进行泛化,且跨数据集初始化能加速收敛。
实验结果 该框架在三个自动驾驶数据集上进行了评估:ZOD (瑞典,伪标签数据)、Waymo (美国,密集激光雷达)和 ISEAuto (爱沙尼亚,高质量标签)。
ZOD 性能: CLFTv2-Large 实现了 53.5% mIoU ,将行人 IoU 从前代 CLFT 模型的 35.5% 提升至 44.9% 。它超越了先前的 CLFT 模型,并以显著更低的计算成本达到了 Mask2Former-Large(52.5% mIoU)的准确度。
Waymo 性能: 在以密集激光雷达回波为特征的 Waymo 数据集上,基于 ViT 的 CLFT 系列表现优于 CLFTv2(68.3% 对比 61.7% mIoU)。这证实了全局注意力在融合密集几何数据方面更为优越,而局部注意力(Swin)则为稀疏场景提供了一种更高效的替代方案。
ISEAuto 性能: 查询驱动模型(MaskFormer/Mask2Former)在该数据集上领先,尽管 CLFTv2 仍保持了竞争力(73.3% mIoU)。
效率: 在 Tiny 规模下,CLFTv2-Tiny 运行时间为 22.0 ms(CLFTv2-Large 为 81.8 ms),内存占用为 187 MB,而 Mask2Former-Tiny 则为 48.4 ms 和 314 MB。
安全指标: CLFTv2 在 VRUs 检测方面表现出高召回率(例如 Waymo Day Fair 数据集上的行人召回率达 96.1%),在某些配置下优先考虑了安全关键型检测而非精确度。
意义与主张 论文声称,分层局部注意力融合 为实时车载感知提供了一种可扩展、高效的替代方案,能够对抗全局注意力及查询驱动解码器。作者认为,对于闭集语义分割任务,为了获得最先进的结果,并不总是需要复杂的查询匹配机制(如匈牙利匹配、深度监督)所带来的训练开销,尤其是在稀疏或伪标签监督的情况下。
这项工作强调了一个细致的设计选择:虽然全局注意力(ViT)在密集几何对齐方面更优,但所提出的基于 Swin 的方法提供了一个理想的精度-效率权衡,使其适用于资源受限的实时智能交通系统。作者总结道,架构的复杂性并不总是对性能有益,当针对特定的传感器密度和监督质量进行定制时,轻量级的残差融合可以达到与计算需求极高的解码器相当的效果。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。