想象你正在驾驶一辆自动驾驶汽车。通常,汽车的“大脑”(其人工智能)被设计为全功率运行,利用所有传感器和计算能力来观察道路。但在现实世界中,情况瞬息万变:
- 传感器变脏了:可能开始下雨,或者大雾弥漫,导致摄像头失明,而激光雷达(LiDAR)仍能正常工作。或者电池电量不足,汽车无法负担运行所有重型软件。
- 道路变得繁忙或空旷:有时会有数百辆汽车和行人(复杂场景),有时则只是一条空旷的高速公路(简单场景)。
当前的自动驾驶人工智能就像一位固执的厨师,无论是一人用餐还是百人宴席,也无论食材是新鲜还是腐烂,都坚持使用同一份巨大且昂贵的食谱。它在简单任务上浪费能量,却在条件恶劣时举步维艰。
这篇论文介绍了SWAN(采样与世界感知多模态网络),这是一种新型人工智能,它充当汽车大脑的智能、自适应项目经理。
以下是 SWAN 的工作原理,分解为三个简单的技巧:
1. “质量感知经理”(控制器)
想象你有一个固定的建筑项目预算,但砖块的质量(来自传感器的数据)不断变化。
- 问题:如果摄像头被泥土覆盖(质量差),但激光雷达清晰可见,普通的人工智能可能会试图同等地使用两者,从而在模糊的摄像头上浪费预算。
- SWAN 的解决方案:SWAN 拥有一位经理,它会不断检查数据的“质量”。如果摄像头有雾,经理会说:“停止在摄像头上花费预算!把所有资金都转给激光雷达。”它动态地将资源转移到当时表现最佳的传感器上,确保汽车不会因为某个传感器状态不佳而撞车。
2. "SkipGate"(智能跳过)
想象你在读书。如果你在读一本简单的儿童故事书,你可能会略过那些简单的页面。但如果你遇到一个复杂的章节,你就会仔细研读每一个字。
- 问题:当前的 AI 即使面对简单场景,也会阅读“书”的每一页(运行神经网络的每一层)。
- SWAN 的解决方案:SWAN 拥有一个"SkipGate",它会观察当前场景。如果道路空旷且天气晴朗,它就说:“我们不需要处理整个部分;跳过几层以节省能量。”它只在场景真正复杂时才进行繁重的工作。这节省了大量的电池和计算能力。
3. "Token Pruner"(垃圾收集器)
想象你在看一张森林的照片。你需要找到一只鹿。照片中有数千个像素,但其中 90% 只是无关紧要的蓝天或绿叶。
- 问题:AI 试图分析每一个像素,包括那些无聊的背景。
- SWAN 的解决方案:在 AI 试图寻找鹿之前,SWAN 就像一个垃圾收集器。它会快速扫描图像,并丢弃那些无助于寻找汽车或行人的“无用”像素(如天空或远处的树木)。它将所有精力集中在图像中有趣的部分。
结果:更智能、更快速的汽车
研究人员在模拟的雨天、黑暗和雾天环境中测试了 SWAN,甚至在真实硬件(机器人中使用的小型计算机芯片)上也进行了测试。
- 效率:SWAN 成功将计算机工作量(FLOPs)减少了高达49%(几乎一半!),同时没有损失太多精度。
- 鲁棒性:当传感器“受损”(如浓雾或运动模糊)时,SWAN 的表现远优于标准系统,因为它确切知道该信任哪个传感器以及如何调整。
- 现实世界速度:在小型低功耗计算机芯片(如真实机器人中使用的芯片)上,SWAN 比旧方法显著更快,且功耗更低。
简而言之:SWAN 是一种自动驾驶人工智能,它知道何时努力工作,何时休息,以及该信任哪些传感器,使其在混乱且不可预测的现实世界中更加安全且节能。
以下是论文《SWAN:面向运行时变化的世界感知自适应多模态网络》的详细技术总结。
1. 问题陈述
部署在现实世界环境(特别是自动驾驶车辆,AV)中的多模态深度神经网络面临三个关键的运行时变化,而现有系统难以同时应对:
- 模态信息质量(QoI): 环境变化(如雾、黑暗、传感器故障)会降低特定传感器输入(摄像头与激光雷达)的质量。
- 平台动态性: 可用的计算资源会因热节流、电源限制或电池电量而波动。
- 样本复杂度: 输入的难度各不相同(例如,物体稀少的清晰道路与目标众多的复杂路口)。
现有方法的局限性:
- 静态多模态网络: 无法适应 QoI 变化或资源约束,导致计算浪费或性能下降。
- 预算自适应网络: 能够调整以适应计算限制,但通常忽略输入复杂度或模态质量。
- 输入自适应网络: 针对样本复杂度进行优化,但往往缺乏严格的计算预算保证,或无法处理多模态冗余。
核心挑战在于联合解决这三个动态因素所引发的复合复杂性,同时保持端到端的可微性以进行训练。
2. 方法论:SWAN 架构
SWAN(样本与世界感知多模态网络)建立在CMT(摄像头 - 激光雷达多模态 Transformer)框架之上。它引入了三个新颖组件以实现自适应资源分配:
A. QoI 感知控制器
- 功能: 根据当前输入的 QoI,动态地在不同模态骨干网络(摄像头和激光雷达)之间分配用户指定的最大计算预算(以层数计)。
- 机制:
- 使用轻量级卷积网络从输入中提取 QoI 特征。
- 将 QoI 特征与代表当前预算的位置嵌入进行拼接。
- 输出每个模态中每一层的 logits。
- 训练创新: 为了解决选择特定层时的不可微性问题,SWAN 使用了NeuralSort(一种可微排序算法)。这使得控制器能够在训练期间学习层的最佳排序,从而近似推理阶段所需的离散选择过程。这克服了以往“直通”(Straight-Through)梯度方法中存在的收敛问题。
B. SkipGate 模块(特征感知层丢弃)
- 功能: 在控制器分配的预算内部运行,根据特征复杂度条件性地执行层,以进一步减少“简单”样本的计算量。
- 机制:
- 接收上下文输入:当前层索引、剩余预算、分配给另一模态的层以及控制器的 QoI 嵌入。
- 使用 Gumbel-Sigmoid 算子生成执行当前层的概率。
- 包含一个利用率惩罚损失(Lskip),以鼓励模型在不牺牲精度的情况下尽可能跳过层。
C. Token 剪枝模块
- 功能: 在最终检测头之前,通过过滤掉语义上不相关的 Token(如天空、背景树木),减少检测头的计算负载。
- 机制: 一个轻量级卷积网络预测 Token 的权重图。通过舍入操作(配合直通估计)将这些权重离散化以丢弃 Token。额外的利用率损失确保仅保留必要的 Token。
D. 联合训练策略
模型采用分阶段方式进行训练:
- 使用 LayerDrop 训练基础网络。
- 冻结骨干网络,训练QoI 控制器。
- 冻结控制器和骨干网络,然后训练SkipGate模块。
- 最后,训练Token 剪枝模块。
这种分阶段方法确保了在集成自适应组件时的稳定性。
3. 主要贡献
- 首个统一自适应多模态网络: SWAN 是首个在多模态设置中联合解决模态 QoI、严格计算预算和样本复杂度的系统。
- 基于 NeuralSort 的可微控制器: 引入了一种利用 NeuralSort 实现端到端可微层分配的 QoI 感知控制器,在复杂 AV 场景中优于以往的直通方法。
- 分层效率: 结合全局预算分配器(控制器)与局部效率模块(SkipGate 和 Token 剪枝),在约束条件下最大化效用。
- 全面评估: 在合成损坏数据(MultiCorrupt 管道)和真实世界边缘硬件(Nvidia Jetson Orin)上进行了验证,证明了其鲁棒性和实际效率。
4. 实验结果
作者在nuScenes 数据集上评估了 SWAN,模拟了损坏情况(激光雷达波束减少、雾、黑暗、运动模糊),并与 BEVFusion、SST、PETR 以及自适应 ADMN 等基线进行了比较。
- 预算约束下的性能:
- 在严格预算下(例如 4 层),SWAN 显著优于基线。例如,在激光雷达波束减少的情况下,SWAN 将 mAP 从3.88(朴素基线)提升至16.12。
- SWAN 始终优于 ADMN,后者由于其训练方法在精确层选择方面存在困难。
- 效率提升:
- FLOPs: 与完全配置的网络相比,减少了高达49%。
- 延迟: 在边缘设备(Jetson Orin)上,通过 Token 剪枝,SWAN 将延迟降低了**>50%;在电源约束下,通过 SkipGate 降低了高达16.5%**。
- 精度: SWAN 在仅使用部分资源的情况下,实现了与全网络基线相当的精度(例如,仅使用 4 层时,其 NDS 和 mAP 分别在上限的 2.7 和 5.4 范围内)。
- 真实世界验证:
- SWAN 表现出对真实世界雨天和黑暗数据的强泛化能力,即使主要在合成损坏数据上训练。
- 在真实数据上微调 SkipGate 模块,进一步恢复了在激进丢弃最初损害精度的高预算场景中的性能。
5. 意义与影响
- 安全与鲁棒性: 通过动态优先处理高质量模态(例如,在黑暗中依赖激光雷达,在雾中依赖摄像头),SWAN 增强了自主系统在不可预测环境中的安全性。
- 资源效率: 根据硬件限制和输入复杂度扩展计算的能力,使得部署范围更广的边缘设备(从移动机器人到高端自动驾驶车辆)成为可能,且不会牺牲性能。
- 方法论进步: NeuralSort 在多模态资源分配中的成功应用,为训练需要在离散决策中进行微分处理的自适应网络提供了新蓝图。
- 实际部署: 在 Nvidia Jetson Orin 上的演示证明,FLOPs 的理论增益转化为真实世界资源受限硬件中可感知的延迟降低,解决了高性能 GPU 测试中常见的“编排开销”问题。
总之,SWAN 代表了使多模态 AI 系统真正适应、稳健且高效地应对物理世界动态现实的重要一步。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。