← 最新论文
💻 computer science

CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids

CLFTv2 是一个高效的相机-激光雷达融合框架,用于语义分割,它通过使用分层式 Swin 编码器和轻量化解码器取代全局 ViT 注意力机制,在显著提升弱势道路使用者检测能力和吞吐量的同时,降低了与基于查询(query-based)及全局注意力方案相比的计算成本。

原作者: Toomas Tahves, Mauro Bellone, Raivo Sell

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Toomas Tahves, Mauro Bellone, Raivo Sell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

自动驾驶汽车依赖于不断的感官数据流来在现实世界中导航,但“看见”并不等同于“理解”。为了安全驾驶,汽车必须能够区分路面上的标线与从路缘走下的行人,即使那个人身材瘦小、距离较远或被部分遮挡。摄像头提供了丰富的色彩和纹理,使车辆能够识别形状和标志,但它们无法确定地测量距离。激光雷达(Lidar)是一种基于激光的扫描系统,能提供精确的三维几何信息,描绘出空间中物体的形状,但其产生的数据往往较为稀疏,且随着距离增加而变得愈发空洞。多年来,工程师们一直试图将这两种截然不同的信息流融合进一个单一且可靠的图像中。挑战在于如何足够快速地处理这些海量数据以满足实时驾驶的需求,同时确保绝不会遗漏最关键的目标,例如行人和骑行者。

研究人员 Toomas Tahves、Mauro Bellone 和 Raivo Sell 针对这一问题提出了一种名为 CLFTv2 的新方法。他们的工作专注于一种特定类型的人工智能架构,旨在比以往的方法更高效地结合摄像头和激光雷达数据。过去,一些领先的系统使用一种被称为“全局注意力网络”的机制,该机制试图同时观察图像的每个部分和三维扫描的每个部分,以寻找其中的关联。虽然这种方法功能强大,但计算量巨大,需要极高的处理能力,这可能会减慢车辆计算机的运行速度。作者提出用一种层级化的、基于窗口的系统来取代这种全局视野。该模型不再一次性扫描整个场景,而是将图像分解为较小的、移动的窗口,先处理局部细节,然后再构建更广泛的理解。这种结构模仿了人类视觉的工作方式,即在将周围环境整合进更大的语境之前,先关注眼前的即时环境。

团队在代表不同环境的三大主要驾驶数据集上测试了这一新框架:来自瑞典的 Zenseact Open 数据集、来自美国的 Waymo Open 数据集以及来自爱沙尼亚的 ISEAuto 数据集。这些数据集在天气、路况以及数据标注方式上各不相同,为系统的适应性提供了严格的测试。结果显示,CLFTv2 成功地以高可靠性识别了易受伤害的路用者。在 Waymo 数据集上,该系统的性能得分达到了 61.7%,较同类技术的早期版本有了显著提升。在 ZOD 数据集上,它达到了 53.5%,这是一个明显的飞跃,特别是在改进了对行人和交通标志的检测方面。或许最重要的一点是,新系统在实现这一目标的同时,使用的计算能力远低于其竞争对手。它消耗的能量仅为某些现有高性能模型的约一半,且数据处理速度快了两倍以上,这使其成为搭载在真实汽车内有限硬件上的更具实用性的选择。

然而,这项研究也揭示了这些系统在处理信息时存在的一种微妙权衡。虽然基于窗口的方法在大多数数据集上表现得非常高效且有效,但研究人员发现,在包含极其密集且精细的激光雷达扫描的 Waymo 数据集上,拥有全局、全知视角的系统在融合两种数据类型方面仍保持着微弱优势。与全局方法相比,新系统的局部窗口有时难以在如此密集的几何环境中完全“连点成线”。这表明,尽管新架构在效率方面迈出了重要一步,但完美的解决方案最终可能需要一种结合了局部处理的速度与全局注意力的广度的混合方法。

研究人员还检查了系统如何处理不同类型的数据监督。在某些数据集中,地面真值标签是由其他算法而非人工标注生成的,这引入了一层不确定性。尽管如此,新模型学会了良好的泛化能力,表明其结合视觉和几何线索的能力即使在训练数据不完美的情况下也是稳健的。研究证实,对于识别行人等小型关键目标这一特定任务,一个设计精巧、轻量化的融合系统可以胜过许多更沉重、更复杂的模型。通过优先考虑对易受伤害路用者的检测,该系统确保了即便在自动驾驶的计算需求不断增长的情况下,安全依然是首要目标。这项工作证明,在构建更安全自动驾驶汽车的竞赛中,有时一种专注且高效的方法比试图一次性看清一切的蛮力尝试更为有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →