✨ 要点🔬 技术摘要
想象你正在驾驶一辆自动驾驶汽车。这辆车的“眼睛”是摄像头,而它的“大脑”是一台计算机,它持续观察道路、预测其他车辆的行驶方向,并决定是加速、减速还是变道。
本文介绍了一种欺骗该计算机大脑的新方法。研究人员将其称为“静止伪装,移动幻觉”。
以下是其工作原理的简明解析,采用日常类比:
旧方法与新方法
旧方法(“变色龙”难题): 以往的攻击尝试在车辆上贴上一种特殊的高科技贴纸,使其从各个角度看起来都不同。这就像试图绘制一只变色龙,无论你从哪个角度看,它都能完美变色。这非常难以实现,因为计算机必须同时被所有可能的视角所欺骗。
新方法(“魔术戏法”): 本文提出:“为何要与变化的视角对抗?不如利用它!” 想象你正走过一辆停放的汽车。随着你行走,你观察这辆车的角度不断变化。研究人员在停放的汽车上贴上了静态(非移动)图案 。由于该图案经过精心设计,当你的自动驾驶汽车驶过时,该图案看起来 似乎在移动和变化,尽管那辆车完全静止不动。
幻觉如何运作
这就像一本翻页动画书 。
设置: 一名恶意行为者在路边停放一辆汽车,并在其上喷涂特定的、怪异的伪装图案。
运动: 你的自动驾驶汽车驶过这辆停放的汽车。
戏法: 随着你的汽车移动,摄像头在每一小段时间内从略微不同的角度观察这辆停放的汽车。这种特殊的涂装设计使得这些变化的角度让计算机误以为这辆停放的汽车正在横向漂移 进入你的车道。
结果: 计算机并非仅仅在一秒钟内看到一次“故障”。它看到的是一段连贯、合乎逻辑的叙事:“天哪,那辆停放的汽车正慢慢滑向我的路径!”
后果:“虚假切入”
由于计算机相信那辆停放的汽车正在切入其车道(即“切入”),它陷入恐慌。
反应: 自动驾驶汽车紧急刹车(急刹)或拒绝超越那辆停放的汽车,认为这样做不安全。
现实: 那辆停放的汽车从未移动分毫。它仅仅是一件静态的艺术品,利用了摄像头视角的错觉来戏弄系统。
为何此事意义重大
研究人员在包含真实驾驶视频的大规模数据集(nuScenes)上测试了该方法。他们发现:
效果显著: 在高达**87.5%**的测试案例中,自动驾驶汽车被诱使紧急刹车。
易于部署: 攻击者无需机器人、投影仪或计算机来改变图像。他们只需将一块打印好的伪装贴在汽车上并将其停放即可。
难以防御: 由于这种“运动”是通过驶过该汽车时的自然物理现象产生的,对计算机而言看起来非常真实。它并非突发的错误,而是一个平滑、可信的谎言。
核心结论
本文表明,自动驾驶汽车易受一种新型诡计的影响:利用视角的自然变化作为武器 。通过正确绘制静态物体,攻击者可以制造出一种“幽灵”运动,诱使自动驾驶汽车做出危险或不必要的决策,而攻击者甚至无需触碰受害者的车辆或道路。
技术摘要:自动驾驶中的视角诱导轨迹操纵
问题陈述
现有的针对基于视觉的自动驾驶(AD)系统的物理对抗攻击,通常依赖于复杂的、动态变化的补丁,或针对多视图鲁棒性进行优化的静态补丁。这些方法将视角变化 (由自车与目标之间的相对运动引起)视为必须克服的鲁棒性挑战,以维持攻击的有效性。因此,它们需要复杂的多视图优化或主动干预(例如动态显示)来诱导感知错误,如物体隐藏或误分类。
本文指出了一个关键疏忽:视角变化本身可以被利用作为一种攻击机制 。当前系统依赖于时间感知,其中检测被关联、预测并用于规划。虽然单帧错误可能会被过滤掉,但感知错误的连贯时间演化 可以传播到下游管道,从而影响规划决策。作者提出了一种新的攻击范式:“静止伪装,移动幻觉”。其目标是利用安装在车辆上的静态被动对抗伪装 ,仅通过自然的相对运动,在帧间诱导一致的特征漂移。这导致 AD 系统推断出一条物理上合理但错误的轨迹(例如虚假的切入),从而触发不必要的紧急制动或放弃超车 maneuver。
方法论
1. 威胁模型
攻击者 :可以将静态物理伪装附着在其控制的车辆上。
知识 :对受害者的感知模型拥有白盒访问权限(或通过代理模型迁移)。假设对下游跟踪、预测或规划模块没有知识。
机制 :攻击由正常的相对运动被动触发。当受害者车辆相对于伪装车辆移动时,视角发生变化,导致静态伪装的投影外观发生演化。
目标 :诱导一个连贯时间的 3D 边界框(bbox)位移,该位移传播至规划阶段,引发安全关键决策。
2. 攻击流程
所提出的框架包含三个阶段:
场景选择 :
攻击可行性过滤器(AFF) :选择目标车辆可见、与自车路径相关且尚未侵入的序列。
视角过滤器(VAF) :专门选择第一帧和最后一帧之间具有足够视角变化 的序列。与以往工作不同,更大的变化更受青睐,以放大依赖视角的外观演化。
伪装渲染 :
优化静态伪装纹理(δ \delta δ )并将其映射到目标车辆网格的可渲染区域。
使用分割掩码(SAM2)处理遮挡,并使用 PyTorch3D 结合相机内参进行渲染。
规划引导优化 :
目标搜索 :系统搜索最优的位移方向(u ˉ \bar{u} u ˉ )和步长(s ˉ \bar{s} s ˉ ),以最大化下游规划错误(例如导致碰撞或紧急制动)。
损失函数 :优化伪装以最大化沿目标方向的位移,同时确保时间一致性。
移动损失(L m o v e L_{move} L m o v e ) :驱动 3D 边界框中心沿目标方向移动。
进度损失(L p r o g L_{prog} L p r o g ) :强制位移逐渐增加(d k + 1 − d k ≈ s ˉ d_{k+1} - d_k \approx \bar{s} d k + 1 − d k ≈ s ˉ ),以创造连贯的运动幻觉。
保真度损失(L f i d L_{fid} L f i d ) :确保目标仍为有效的检测对象(保持置信度、尺寸和偏航角)。
风格损失(L s t y l e L_{style} L s t y l e ) :包含全变分(TV)和不可打印性得分(NPS),以确保图案可打印且低噪。
鲁棒性 :在优化过程中应用 3D 变换期望(EoT),对目标姿态引入随机扰动(偏航、平移、深度、缩放)。
主要贡献
新攻击机制 :本文识别出视角变化 为一种新的攻击面。它证明了静态伪装可以通过自然驾驶动力学转化为动态时间扰动,从而消除了对主动或动态对抗补丁的需求。
几何约束框架 :提出了一种生成静态伪装的方法,该伪装能在帧间诱导渐进式 3D 边界框移动 。该框架确保攻击在物理上可投影且在时间上连贯。
系统级影响 :这项工作证明了这些诱导的运动幻觉会通过跟踪和预测模块传播,从而在端到端 AD 管道中触发真实且有害的驾驶行为(放弃超车、紧急制动)。
实验结果
该攻击在nuScenes 数据集上使用 220 个场景和三种基于视觉的 3D 检测器(BEVDet、BEVDepth、FastBEV++)进行了评估。构建了两种下游管道(管道 A 和 B)来模拟跟踪、预测和规划。
成功率 :该攻击实现了高达87.5% 的攻击成功率(ASR) (通过紧急制动事件衡量,定义为减速度 ≥ 3.0 m / s 2 \ge 3.0 m/s^2 ≥ 3.0 m / s 2 )。在交叉验证设置中,ASR 范围为 50.0% 至 66.7%。
时间连贯性 :渐进位移率(PDR)平均达到 70.8% ,证实了诱导的边界框偏移是时间上渐进的,而非随机噪声。
下游影响 :
平均预测误差(APE) :预测轨迹的偏差高达 3.02 米。
最小轨迹距离(MTD) :减少至约 1.48 米,表明预测路径接近受害者的规划路径,造成安全冲突。
紧急制动 :触发了高达 4.45 m / s 2 m/s^2 m / s 2 的最大制动减速度(MBD)。
影响有效性的因素 :
视角变化 :变化越大,位移越强。
场景细节 :在距离更近、光照更亮、投影面积更大且相对速度较低的情况下,攻击更有效。
可迁移性 :虽然跨模型可迁移性有限(由于检测器特定的特征聚合),但该攻击在不同车辆类型 (SUV、轿车、货车)之间能有效迁移。
意义与主张
作者声称,这项工作突出了自动驾驶中一个以前被忽视的弱点:对时间一致性 的依赖使得系统容易受到利用动态视角条件 的静态 物理攻击。
范式转变 :本文认为,视角变化不应仅被视为鲁棒性障碍,而应被识别为一种潜在的攻击向量。
部署可行性 :与需要动态显示或主动干预的以往工作不同,这种攻击是“被动的”且“易于部署”,因为它只需要一辆带有特定伪装图案的停放车辆,即可诱导经过的自动驾驶车辆紧急制动。
安全影响 :结果表明,当前专注于单帧鲁棒性或多视图不变性的防御措施是不够的。未来的安全 AD 系统必须考虑由自然运动动力学引起的时空连贯感知偏差 。
本文最后指出,虽然评估仅限于特定模型和模拟数据集,但这些发现激励了更鲁棒系统的设计,这些系统能够超越简单的帧级感知,对物理一致性和时间稳定性进行推理。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。