想象一下,你正驾驶汽车在浓雾或暴风雪中行驶。你的眼睛(摄像头)可能难以看清前方,但汽车的雷达就像一对超能力耳朵,能够“听”穿天气感知物体。问题在于,这些雷达耳朵传来的原始数据是一团混乱、令人困惑的数字乱麻。为了理解它,我们需要一个计算机大脑(AI 模型)来清理这些数据,并告诉我们:“前方 50 米处有一辆车”,或者“左侧有一名骑行者”。
本文介绍了一种名为mRadNet的新型计算机大脑。以下是其工作原理的简明解释:
问题:太大且太慢
此前构建这些雷达大脑的尝试存在一个主要缺陷:它们就像试图背着巨大沉重的背包(庞大的计算机模型)去跑马拉松(实时驾驶)。
- 旧模型(CNNs): 它们就像一个人透过一个小钥匙孔看照片。它们能看清正前方的细微细节,却无法理解整幅画面或场景中各部分之间的关联。为了解决这个问题,工程师们将模型做得更大更重,导致速度变慢。
- 新模型(Transformers): 它们就像拥有广角镜头的人,能一次性看清整个房间。然而,它们的计算成本极高(非常沉重),并且仍然难以看清安全所需的微小局部细节。
解决方案:mRadNet(“智能紧凑”大脑)
作者创建了mRadNet,这是一种专为紧凑(小巧轻便)且智能(准确)而设计的模型。他们利用了一种名为MetaFormer的概念构建了该模型。
可以将 MetaFormer 想象成一个混合团队:
- 局部专家(卷积): 想象一位擅长检查单个指纹或小线索的侦探。模型的这一部分专注于雷达数据中的微小局部细节。
- 全局战略家(Token Mixer): 想象一位审视整个战场地图以理解各部分如何关联的将军。这一部分关注整体画面和长距离关联。
mRadNet 将这两者结合为一个高效单元。它不使用沉重复杂的“自注意力”机制(这就像要求体育场里的每个人同时与其他所有人交谈),而是采用更简单的"Token Mixer"。这就像拥有一个精简的通信系统,能在没有噪音和成本的情况下完成任务。
工作原理:U-Net 形状
该模型呈U形(称为 U-Net 架构)。
- 左侧(编码器): 想象挤压一块海绵。模型将庞大详细的雷达图像压缩,仅保留最重要的信息。这就像将一本长书总结为几个关键要点。
- 右侧(解码器): 想象将那块海绵重新展开。模型将这些关键要点扩展回完整画面,但这一次,它确切知道物体在哪里。
- 跳跃连接: 有“桥梁”连接左侧和右侧。这确保了当模型将图像重新展开时,不会忘记最初看到的微小细节。
提升效率的特别技巧
为了确保该大脑保持小巧快速,作者添加了两个巧妙的技巧:
- 智能打包(Token Embedding): 模型不是逐个查看每一块雷达数据,而是高效地将它们分组,就像紧紧打包行李箱,以便在更小的空间里装入更多内容。
- 智能合并(Token Merging): 随着模型处理数据,它将相邻的信息块合并在一起。想象将 4 张小照片的网格合并成 1 张更大、更详细的照片。这减少了计算机需要处理的工作量,同时没有丢失任何重要信息。
结果
团队在名为CRUW的真实驾驶场景大规模数据集上测试了 mRadNet。
- 性能: 它比任何先前的模型更准确地发现了物体(汽车、行人、骑行者)。
- 效率: 它在作为测试中最小且最轻的模型的同时做到了这一点。它所需的计算机算力(FLOPs)最少,且拥有的“参数”(使 AI 智能的内部设置)数量最少。
简而言之: mRadNet 是一种新型轻量级雷达探测器,其体积小到足以安装在汽车计算机芯片上,但智能程度足以比此前使用的庞大笨重模型更好地穿透恶劣天气。它证明了跑马拉松不需要巨大的背包;你只需要合适的装备。
技术摘要:mRadNet
问题陈述
调频连续波(FMCW)雷达因其对雨、雾、雪等恶劣天气条件的鲁棒性,在高级驾驶辅助系统(ADAS)中日益重要。然而,为实时嵌入式系统处理雷达数据以进行目标检测(ROD)面临特定挑战。虽然卷积神经网络(CNN)能有效从雷达射频(RF)图像中提取局部特征,但由于感受野有限,它们在捕捉全局依赖关系方面存在困难,往往需要庞大且计算成本高昂的模型才能达到可接受的性能。相反,基于 Transformer 的模型擅长建模全局依赖关系,但由于自注意力机制导致计算成本高昂,且若不进行 extensive 架构修改,往往无法像 CNN 那样有效地捕捉局部特征。此外,现有方案常常忽视嵌入式汽车环境中对模型紧凑性和效率的关键要求。
方法论
作者提出了mRadNet,这是一种新颖、紧凑的雷达目标检测模型,设计时充分考虑了效率。该架构在 U-Net 风格的框架内整合了卷积神经网络和 MetaFormer 架构的优势。
1. 整体架构
mRadNet 采用带有跳跃连接的 U-Net 风格编码器 - 解码器结构,以生成分层表示。
- 编码器:输入由多帧和多 chirp 的复杂射频(RF)图像(距离 - 方位角)组成。编码器通过一个主干(stem)处理这些输入,提取短期时间特征,将复杂图像转换为实值 3D 图像。随后,它利用一系列 MetaFormer 和 Transformer 块进行分层特征提取。
- 解码器:解码器镜像编码器,应用 Transformer 和 MetaFormer 块来细化特征。它采用跳跃连接将编码器令牌与解码器令牌拼接,以保留低级细节。
- 输出:最后阶段使用线性插值进行平滑上采样以生成置信度图,随后通过卷积层输出特定类别的置信度图。
2. 关键架构组件
- 带有令牌混合器(Token Mixers)的 MetaFormer 块:mRadNet 不单纯依赖自注意力或标准卷积,而是采用 MetaFormer 块。这些块用令牌混合器替换了自注意力模块。
- 卷积令牌混合器:作者利用**深度可分离卷积(SepConv)**作为令牌混合器。这将标准卷积分解为深度卷积和逐点操作,在保持通道混合能力的同时有效捕捉局部特征,且避免了标准卷积与线性层配对带来的冗余。
- 注意力令牌混合器:还集成了注意力机制以捕捉全局依赖关系,使模型能够平衡局部和全局特征提取。
- 令牌嵌入:专用的TokenEmbed 模块处理输入 6D 张量(批次 × 时间 × Chirps × 高度 × 宽度 × 通道)。它使用卷积层合并 chirp 维度(用可学习参数模拟 FFT 行为),并使用 3D 卷积将时空像素分组为令牌,创建位置感知的令牌数组。
- 令牌合并:为了降低计算成本并促进更深层的架构,模型在编码器中采用了TokenMerging 模块。与标准池化不同,该模块使用**令牌重排(Token Rearrange)**层(类似于 PixelShuffle 的逆操作),将 2×2 的空间邻域重构为单个令牌。这将空间分辨率降低了 4 倍,同时增加了令牌维度,在通过线性层将维度缩减回可管理的大小之前保留了信息密度。在此过程中,时间维度保持不变。
主要贡献
- 新颖架构:提出了 mRadNet,这是一种专为 ROD 任务定制的基于 MetaFormer 的 U-Net 风格架构。它用包含卷积层的 MetaFormer 块替换了传统的 CNN 骨干和头部,创建了一个能够同时捕捉局部和全局特征的连贯设计。
- 高效的令牌策略:引入了优化的令牌嵌入和令牌合并策略。这些策略促进了令牌混合器的有效性,并增强了模型的紧凑性,使得在参数更少的情况下实现更深层的架构成为可能。
实验结果
该模型在CRUW 数据集(一个大规模汽车雷达目标检测数据集)上进行了验证。
- 性能:mRadNet 取得了最先进的(SOTA)性能,总体平均精度(AP)为86.72%,平均召回率(AR)为91.18%。
- 它在 AP 上比之前的 SOTA 模型(E-RODNet)高出1.26%,在 AR 上高出1.99%。
- 它在车辆检测方面表现出显著改进,AP 比其他方法提高了4% 以上,这归因于增强的时间建模。
- 虽然 E-RODNet 在行人和自行车的 AP 上略占优势(可能是由于针对局部特征进行了更多的卷积操作),但 mRadNet 在这些类别上实现了更优的 AR。
- 效率:mRadNet 在所有对比方法(CNN、Transformer 和 MetaFormer)中,以最少的参数和最低的 FLOPs实现了最佳性能。
- 它在基于 Transformer 和 MetaFormer 的模型中展示了最短的训练时间和最低的推理延迟。
- 论文指出,基于 MetaFormer 的模型通常比 CNN 和 Transformer 对应模型更小,同时能实现更好的性能。
意义与主张
论文声称,mRadNet 成功解决了雷达目标检测中检测精度与计算效率之间的权衡问题。通过利用 MetaFormer 架构,该模型建立了一个坚实的性能下限,允许进行激进的优化设计(减小尺寸和成本)而不牺牲精度。在 U-Net 框架内集成可分离卷积和注意力令牌混合器,被证明能有效从稀疏且嘈杂的雷达数据中捕捉必要的局部和全局特征。这项工作表明,MetaFormer 在 ROD 任务中既能优于 CNN 和 Transformer,又能保持适合实时嵌入式系统的紧凑设计。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。