A Multi-Modal Perception Pipeline for Object Detection and Tracking in Autonomous Racing
本文提出了一种鲁棒的多模态后期融合感知流水线,该流水线集成了摄像头、激光雷达和毫米波雷达数据,并结合专门的跟踪框架,旨在实现自动驾驶赛车在高速、恶劣及极端工况下的可靠目标检测与跟踪。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个赛车以让一级方程式车手都感到汗颜的速度疾驰的世界,然而驾驶座后却空无一人。在这种极端环境下,误差的余地是以英寸和毫秒来衡量的。在接近每秒80米的速度下,仅仅十分之一秒的延迟,就意味着赛车在不知道自身位置或前方障碍物的情况下,已经行驶了近八米。这就是自动驾驶赛车的现实——一个将感知技术推向绝对极限的领域。为了在这一混乱中穿行,车辆必须成为自己的眼睛和大脑,不断扫描赛道以寻找其他赛车,预测它们的运动,并决定何时加速、减速或转向。挑战不仅在于“看见”,还在于要在模糊的运动、震动的传感器以及障碍物的突然出现中“看清”,同时还要在那些足以让最先进的人类感官都感到困惑的条件下运行。
来自摩德纳和雷焦艾米利亚大学的一组研究人员,与 HiPeRT Srl 合作,开发了一套旨在为 2025 年阿布扎比自动驾驶赛车联赛解决这些问题的全新系统。他们在最近发表的一篇论文中介绍了这项工作,其核心是一个“感知流水线”——一个由软件和硬件组成的复杂链条,将来自赛车传感器的原始数据转化为可靠的世界地图。该团队的方法基于这样一个理念:没有任何一种类型的传感器是完美的。摄像头擅长识别形状,但在黑暗或恶劣天气下难以判断距离;LiDAR(激光雷达)传感器利用激光脉冲构建 3D 地图,虽然精确,但容易受到尘埃或雨水的干扰;RADAR(毫米波雷达)单元擅长测量速度,但往往缺乏细节。研究人员意识到,为了在高速的混乱中生存,赛车需要将所有这些感官结合成一个统一的视图,他们称之为“后期融合”(late fusion)。这意味着赛车首先独立处理每种传感器的数据,然后将结果汇聚在一起形成完整的图像,而不是尝试立即合并原始数据流。
本研究中使用的车辆是 Dallara EAV-24,它配备了一套复杂的工具组合:三台 LiDAR 传感器、七个摄像头和四个 RADAR 单元,所有设备都通过精确的时钟进行同步。该系统的工作原理是让每种类型的传感器各自寻找其他赛车。摄像头使用神经网络在视频流中捕捉车辆的 2D 轮廓;LiDAR 通过激光扫描空气以寻找 3D 形状;而 RADAR 则根据无线电波检测物体的速度和存在。一旦完成了这些独立的检测,系统的“融合”模块就会充当“媒人”。它观察来自不同传感器的数据并询问:“这个 LiDAR 斑点是否就是那个摄像头框出的赛车?”如果时间与位置相吻合,系统就会将它们合并,从而创建一个关于另一辆赛车位置及其移动速度的稳健且单一的估计值。这一过程至关重要,因为如果系统仅依赖单一传感器,瞬间的故障或盲区可能会导致灾难性的失败。通过将它们结合起来,系统确保即使其中一种传感器失效或被遮挡,其他传感器仍能保证赛车的安全。
然而,看到赛车只是成功了一半;了解它在零点几秒后会在哪里则是另一半。研究人员发现,在赛车速度下,即使是极小的处理延迟也会导致赛车误以为障碍物在某个位置,而实际上它已经移动了几米。为了解决这个问题,他们的追踪系统包含了一个“延迟补偿”机制。它会查看传感器观测到物体的确切时刻,并计算出该物体在当前时刻应该处于什么位置,同时考虑到数据通过计算机传输所需的时间。此外,该系统不仅仅是在猜测;它对赛车行为有着深刻的理解。它知道赛车通常遵循特定的路径(即赛车线)绕过赛道,并且会在弯道减速、在直道加速。通过将这些知识引入计算,该系统预测赛车未来位置的准确度远高于那些假设赛车做直线匀速运动的标准追踪器。
团队在 2025 年的比赛活动中,在雅斯码头赛道上将该系统置于真实环境条件下进行了测试,让他们的自动驾驶赛车与其他车辆展开竞争。他们通过三个特定的高压场景来测试系统的表现。在第一个测试中,他们模拟了一辆赛车在自动驾驶车辆高速驶近时突然在赛道上停止。系统在大约 80 米外就检测到了这辆静止的赛车,并在几百毫秒内正确估计了其处于静止状态,从而为规划软件留出了足够的时间来进行刹车或转向避让。在第二个场景中,他们测试了系统如何处理“盲区”情况,即一辆车遮挡了另一辆车的视线。当遮挡车辆移动时,系统立即发现了新显露出的车辆并开始追踪,证明了它能够应对障碍物的突然出现。最后,他们测试了一次并排行驶的超越,两辆赛车紧贴着疾驰。虽然系统在估计另一辆车的位置时,根据其位于前方还是后方,表现出轻微的偏差,但整体精度足以完成该动作而不发生碰撞。
测试结果证实,结合多种传感器远优于依赖单一传感器。当研究人员将 LiDAR 传感器从方程中移除时,系统判断距离的能力显著下降;当移除 RADAR 时,系统在准确估算其他赛车速度方面显得力不从心。只有当三种类型的传感器协同工作时,系统才达到了精度与范围的最佳平衡。研究结论指出,为了让自动驾驶车辆在极端速度下安全运行,它们不仅要通过多双眼睛来看待世界,还要以一种能够兼顾赛车物理特性的方式来思考世界。尽管该系统并不完美——例如在从侧面观察赛车时,仍难以精确判断其几何形状——但它代表了一个重要的进步。它证明了通过融合不同类型的数据并理解比赛的背景,机器可以学会如何在地球上最危险、最苛刻的环境中穿行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。