AdvSerial: Physical Adversarial Attacks on Infrastructure-mounted Pedestrian Detectors via Semantic Feature Suppression
本文介绍了 AdvSerial,一种动态 2D-3D 联合优化框架,该框架能够生成连续的高角度物理对抗补丁,以有效地抑制行人语义特征,并在针对安装在基础设施上的检测器实现高攻击成功率的同时规避现有的防御措施。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个你的眼睛和大脑都被超级智能的摄像机计算机所取代的世界。这就是现代“AI视觉”的现实——这项技术帮助自动驾驶汽车识别行人,帮助监控摄像头统计人群,并时刻关注繁忙的高速公路。这些系统在识别人类方面表现得极其出色,但它们有一个秘密弱点:它们会被欺骗。就像人类会被巧妙的错觉所迷惑一样,这些AI摄像头也会被设计成看起来像噪声、但在计算机眼中却像“眼罩”一样的特殊图案所迷惑。这个研究领域被称为“对抗性攻击”(adversarial attacks)。这并不是要用锤子砸坏摄像头,而是通过绘制一幅画,让AI的大脑发生“短路”。为什么这很重要?因为如果繁忙火车站或交通灯处的监控摄像头被误导而看不见一个人,整个系统就会失效,可能导致危险的事故或安全漏洞。
现在,来认识一下 AdvSerial,这是一种由研究人员设计的全新“魔法斗篷”,旨在测试这些AI摄像头究竟有多脆弱。以往针对AI的攻击主要集中在平面的、视平线高度的视角(例如与眼睛齐平的摄像头),而这种新方法针对的是安装在高处电线杆或建筑物上的摄像头——也就是智慧城市和高速公路中使用的那种。这些高角度摄像头从上方观察人,这会扭曲人的形状,使欺骗变得更加困难。研究人员构建了一个数字“缝纫机”,将一种特殊的、混乱的图案缝合到3D人体模型上的衣服上。然后,他们教会了这种图案如何在现实生活的奇特角度和运动中生存下来。当他们进行测试时,结果令人震惊:在物理世界实验中,这件斗篷成功让流行的AI检测器YOLO-v5在 74.8% 的时间内无法识别出人。更令人印象深刻的是,它将摄像头识别人的信心从稳固的 84.30% 大幅降低到了摇摆不定的 39.38%。最棒的是,即使面对试图识别“异常”图案或通过视频观察时间序列来识破诡计的高级防御手段,这个技巧依然奏效。
“隐形”夹克的传奇故事
让我们深入了解其工作原理。想象你正试图躲避一名从高塔上向下俯瞰的保安。如果你只是在衬衫上贴一个又大又丑的贴纸,保安可能会发现贴纸并注意到你。如果你尝试在衬衫上画一种看起来像普通衬衫但能迷惑保安的图案,那么当人走动时,图案可能会被拉伸和扭曲,使其看起来像一团乱麻,从而暴露身份。
由 Yuanhao Huang 和 Yilong Ren 领导的研究人员意识到,要真正躲避这些高处摄像头的侦察,你不能只做一个扁平的贴纸。你需要一件动态3D套装。他们创建了一个名为 AdvSerial 的系统,主要完成了三件事:
数字缝纫机(特征平滑缝合/Feature Smooth Quilting): 想象你正在用许多小块布料制作一件拼布被,每块布料都有疯狂且令人困惑的图案。如果你只是把它们缝在一起,接缝(方块相遇的线条)会非常明显。聪明的摄像头可能会看到那些锐利的线条并说:“啊哈!那是假的图案!”为了解决这个问题,研究人员发明了一种聪明的缝合方式。他们不仅仅是匹配颜色,而是观察摄像头大脑最敏感的位置。他们在摄像头大脑的“盲区”——即摄像头不太关注的地方——将这些方块缝合在一起。这被称为特征平滑缝合。它使接缝对AI来说变得不可见,尽管接缝确实存在,从而确保图案看起来像一个光滑且令人困惑的整体表面。
时光旅行的人体模型(序列帧损失/Serial Frame Loss): 大多数之前的技巧只适用于单张照片。但在现实世界中,人是在移动的!人们行走、奔跑、挥动手臂。如果图案只有在你站定时才有效,那么对于观察视频的监控摄像头来说它是没用的。研究人员在一个人不断变换姿势、旋转的3D人体模型上训练了他们的图案。他们使用了一种特殊的数学规则,称为序列帧损失,以确保该图案在整个视频过程中都能持续有效。这就像教一位魔术师的戏法不仅要在一秒钟内奏效,还要在魔术师移动的过程中持续一分钟,无论如何都保持有效。这防止了那种AI一会儿看到人、一会儿失去人、然后再看到人的“闪烁”现象。
高角度测试: 他们不仅在电脑屏幕上进行测试。他们将图案印在真实的衣服上,并让人们穿着这些衣服在距离 3 到 5 米 高的真实监控摄像头前走动。他们在不同的天气条件(晴天、雨天、雾天)以及不同的距离(从 5 到 30 米 远)下进行了测试。
结果:一场隐匿大师课
实验结果给安全领域敲响了警钟。当他们用这件“魔法斗篷”测试八种不同类型的AI检测器(包括流行的YOLO系列及其他)时,结果是一致且令人不安的:
- 重大胜利: 针对YOLO-v2检测器,斗篷的成功率达到了 89.71%。在现实世界中针对更现代的YOLO-v5,它的成功率仍有 74.8%。
- 信心崩塌: 在攻击之前,摄像头对看到人的确定度非常高(84.30% 信心)。攻击之后,这种信心骤降至 39.38%。摄像头基本上是在说:“我不确定那是一个人还仅仅是一个影子。”
- 击败防御: 研究人员尝试使用两种高级防御手段来破解自己的技巧。一种防御(NapGuard)寻找图案中尖锐、不自然的线条。另一种防御(Sparse4D-v3)通过观察视频随时间的变化来查看物体是否移动异常。这件斗篷击败了两者。它如此平滑,以至于检测线条的防御手段未能发现;它在时间上如此连贯,以至于检查视频的防御手段无法发现任何故障。
为什么这很重要(以及它并不代表什么)
这篇论文并不是说AI永远坏掉了。相反,它更像是一次压力测试。它表明,我们赖以保障城市安全的摄像头存在一个特定的盲点:当从高角度观察时,它们难以识别穿着这些特定、精心设计的图案的人。
研究人员发现,当人站立或缓慢移动时,这种技巧效果最好。当人们奔跑或剧烈挥动手臂时,图案会被拉伸,摄像头可能会捕捉到人的身影(成功率略有下降,但仍然远低于正常水平)。这告诉我们,虽然这种攻击很强大,但它并不是一种在任何情况下都能100%奏效的魔法“隐身衣”。
最重要的启示是,传统的测试安全的方法(仅仅拍一张照片看AI是否会被迷惑)已经不够了。我们需要测试这些系统如何处理移动的人、变化的角度以及现实世界的天气。研究人员建议,为了解决这个问题,未来的安全系统需要更聪明地处理运动追踪和处理3D形状,而不仅仅是处理2D图像。
简而言之,AdvSerial 是一个强大的工具,它揭示了我们智慧城市摄像头的一个隐藏弱点。它证明了如果你了解AI大脑的工作原理,你就可以设计出一种图案,让它在面对高处俯视时对人“视而不见”。它提醒我们,在建设更智慧的城市时,我们也需要建立更智慧的防御机制来保持安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。