Multi-Task Consistency-based Detection of Adversarial Attacks
本文提出了一种针对自动驾驶的高效对抗攻击检测方案,该方案利用一致性评分指标来识别多任务视觉输出之间的不一致性,在 BDD100k 数据集上针对 PGD 攻击实现了 99.9% 的 ROC-AUC 检测率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在驾驶一辆通过摄像头而非仅仅依靠眼睛来看世界的汽车。这辆车使用一种被称为“深度神经网络”(DNN)的特殊计算机大脑来理解它所看到的世界。它需要识别交通灯、阅读标志并寻找其他车辆,以确保安全驾驶。但棘手的部分在于,这些计算机大脑可能会被欺骗。如果有人在图片中添加一些微小的、几乎看不见的“噪声”——比如通过非常特定的方式移动几个像素——计算机可能会把停止标志误认为限速标志,或者完全看不见行人。这被称为“对抗性攻击”(adversarial attack),就像是针对计算机的魔术师的障眼法。由于这类诡计很容易发生,工程师们正迫切地想要构建一种安全系统,能够在计算机大脑做出危险错误之前,察觉出有人试图愚弄它。
这篇论文介绍了一个为这些自动驾驶汽车设计的聪明“保安”。作者并没有试图让计算机大脑变得坚不可摧(这既困难又昂贵),而是建议使用一种“团队协作”的方法。他们注意到,如果你让两个不同的计算机模型去观察同一张图片——一个经过训练用于在物体周围画框(目标检测,Object Detection),另一个经过训练用于描绘这些物体的精确轮廓(实例分割,Instance Segmentation)——它们通常会达成完美的共识。但是,当一个狡猾的攻击者试图用诡计来欺骗它们时,这两个模型就会开始争吵。一个可能看到了汽车,而另一个却什么也没看到;或者它们对汽车位置的判断产生分歧。作者构建了一个监听这种“争吵”的系统。如果两个模型的意见分歧过大,系统就会大声疾呼:“嘿,这张图片被篡改了!”并阻止汽车使用这条错误的数据。
研究人员使用了一个名为 BDD100k 的大规模驾驶场景数据集对这个想法进行了测试。他们利用一种名为 PGD(投影梯度下降法)的强大攻击手段,制造了数千张带有“毒素”的图像,并观察了他们的新系统是如何反应的。他们发现,这个“分歧检测器”表现得极其出色。当他们让这个系统与攻击者对垒时,它成功识别出了被欺骗的图像,成功率高达 99.9%。这是一个惊人的分数,意味着该系统几乎不会被愚弄。
更有趣的是,他们是如何弄清楚哪些模型搭配起来效果最好的。他们测试了许多不同的组合,比如将一个拥有“ResNet50”大脑的模型与一个拥有“ResNet101”大脑的模型进行配对。他们发现,最优秀的组合实际上是那些内部结构非常相似的模型。这听起来很奇怪,对吧?你可能会认为两个不同的模型效果会更好,但论文表明,当两个相似的模型受到攻击时,它们会以不同的方式陷入混乱,从而产生一种显眼的、巨大的“争吵”,从而极易被察觉。如果模型差异太大,它们可能会完全忽略攻击,或者以同样的方式失败,从而导致更难判断是否出了问题。
团队还尝试通过设计一个“自适应攻击者”来智斗他们自己的检测器。这个攻击者试图同时欺骗两个模型,并强迫它们对错误答案达成一致。即便面对这种高级的诡计,该检测器依然有效,捕捉到了 95% 的攻击。这表明,尽管攻击者可以尝试协调他们的诡计,但模型处理信息方式的天然差异使得欺骗整个团队变得非常困难。
与其他安全方法相比,这种方法就像是一个轻量级、运行快速的“保安”,而不是沉重且缓慢的“坦克”。其他方法通常需要重新训练整个计算机大脑,或者添加大量的额外代码,这会拖慢汽车的速度。作者将他们的系统与一个著名的防御方法“RobustDet”进行了对比。虽然 RobustDet 让模型变得稍微难以被欺骗,但它体积庞大(643 MB)且速度缓慢(每秒 11 帧)。而这个新的检测器则要小得多(350 MB),速度快了一倍(每秒 20 帧),同时还能捕捉到几乎所有的攻击。
简而言之,这篇论文并不声称自己构建了一个无懈可击的护盾。相反,它提供了一种聪明且高效的方法,去倾听盔甲上的裂痕。通过观察两种看待世界的方式之间的不一致性,该系统可以察觉出现实是否被数字化地篡改了。作者认为,这种方法可能是让自动驾驶汽车变得更安全的关键拼图之一,它证明了有时,抓住骗子的最好办法是让他们向别人开口说话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。