← 最新论文
💻 computer science

Poisoning the Pixels: Revisiting Backdoor Attacks on Semantic Segmentation

本文提出了名为 BADSEG 的统一框架,系统性地揭示了语义分割模型(包括 Transformer 和 SAM)在多种粗粒度与细粒度后门攻击下的严重安全漏洞,并指出当前防御手段难以有效缓解此类威胁。

原作者: Guangsheng Zhang, Huan Tian, Leo Zhang, Tianqing Zhu, Ming Ding, Wanlei Zhou, Bo Liu

发布于 2026-03-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangsheng Zhang, Huan Tian, Leo Zhang, Tianqing Zhu, Ming Ding, Wanlei Zhou, Bo Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给自动驾驶汽车的“眼睛”做一次全面的安全体检,结果发现了一个非常隐蔽且危险的“后门”漏洞。

为了让你更容易理解,我们可以把语义分割模型(Semantic Segmentation)想象成自动驾驶汽车的“超级视觉大脑”

1. 这个“大脑”是做什么的?

普通的摄像头只能看到“这是一张图”。但语义分割模型能把图里的每一个像素都贴上标签:

  • 这块像素是(可以开)。
  • 那块像素是行人(要避让)。
  • 那片像素是天空(不用管)。

如果这个大脑看错了,比如把“行人”看成了“路”,或者把“路”看成了“墙”,车子就会直接撞上去,后果不堪设想。

2. 什么是“投毒”(Backdoor Attack)?

想象一下,有一个坏人在训练这个“大脑”时,偷偷往它的“教材”(训练数据)里掺了一些带有特殊记号的假书

  • 平时:这个大脑看书很认真,认路、认人、认车都很准,表现完美。
  • 触发时:一旦它看到那个特殊的记号(比如路边贴了一个特定的贴纸,或者衣服上有个特定的图案),它就会瞬间“发疯”,无视现实,按照坏人的指令去行动。

这就叫后门攻击

3. 以前的研究漏掉了什么?

以前的科学家发现后门攻击时,主要盯着一种情况:“把物体看成背景”

  • 比喻:就像坏人教大脑:“只要看到那个记号,就把‘行人’当成‘空气’(背景)。”于是车子看到带记号的行人,直接撞过去,因为大脑觉得那里没人。

但这篇论文的作者说:“这就太天真了!坏人能做的远不止这些!”

4. 这篇论文发现了什么新花样?(六大新攻击)

作者把攻击分成了两类,就像给黑客提供了更丰富的“武器库”:

A. 粗粒度攻击(大方向的错乱)

这就好比给大脑灌输了错误的“世界观”:

  1. 物体变物体(Object-to-Object):把“行人”看成“汽车”。
    • 后果:车子以为前面是个大铁疙瘩(车),可能会急刹车或者绕道,造成交通瘫痪。
  2. 物体变背景(Object-to-Background):把“汽车”看成“路面”。
    • 后果:车子直接开进别人的车里,因为大脑觉得那是路。
  3. 背景变物体(Background-to-Object):把“空地”看成“汽车”。
    • 后果:车子看到空荡荡的路,突然觉得前面有车,吓得急刹车(幽灵刹车)。
  4. 背景变背景(Background-to-Background):把“人行道”看成“马路”。
    • 后果:车子直接冲上人行道,撞飞路人。

B. 细粒度攻击(更狡猾的伪装)

这些攻击更隐蔽,专门针对特定情况:
5. 实例级攻击(Instance-Level):只攻击某一个特定的目标,其他一样的目标没事。
* 比喻:坏人只给红色的那辆特斯拉贴了记号。看到红色特斯拉就撞,看到蓝色的特斯拉就正常避让。这很难被发现,因为大部分时候车子都表现正常。
6. 条件级攻击(Conditional):只有在特定环境下才发作。
* 比喻:只有当“下雨天”且“看到红色记号”时,大脑才会发疯。平时大晴天完全没事。

5. 他们是怎么做到的?(BADSEG 框架)

作者发明了一个叫 BADSEG 的“黑客工具箱”。

  • 以前:黑客靠猜,随便贴个黑条或者 Hello Kitty 图案,效果时好时坏。
  • 现在:BADSEG 像一个超级调音师。它会自动计算:
    • 贴什么形状最好?(三角形?圆形?)
    • 贴多大?贴在哪?
    • 把什么物体变成什么物体最容易骗过大脑?(比如它发现把“车”变成“路”比把“车”变成“树”更容易成功)。

它通过数学优化,找到了最隐蔽、最有效的“毒药配方”。

6. 现有的“杀毒软件”管用吗?

作者测试了目前市面上流行的 6 种防御方法(比如重新训练、剪枝、检测异常等)。

  • 结果统统失效!
  • 比喻:就像你给房子装了防盗门、警报器和监控,但坏人是拿着钥匙(后门)进来的。这些防御手段只能防住普通的撬锁,防不住这种精心设计的“合法入侵”。
  • 特别是对于细粒度攻击(只攻击特定对象),现有的防御手段几乎完全看不见。

7. 连最新的“超级大脑”也中招了吗?

作者还测试了目前最火的两种新架构:

  1. Transformer 网络(像现在的 AI 大模型一样先进)。
  2. SAM (Segment Anything Model)(Segment Anything,号称能分割任何东西的通用模型)。

结论全中! 即使是这些最先进、最聪明的模型,只要被投了毒,照样会被那个“记号”控制。对于 SAM,攻击方式甚至变成了直接扭曲它画出来的“轮廓线”,让它把路画歪,或者把物体画没。

总结

这篇论文就像给自动驾驶行业敲了一记警钟:
我们以前以为只要防住“把行人看成空气”这种简单的攻击就够了。但实际上,黑客可以玩出花样百出的把戏(把路看成墙、把红车看成空气、只在雨天发作等)。而且,目前的防御手段对这些新花样几乎无效

核心启示:在自动驾驶和医疗影像等安全攸关的领域,我们需要重新设计防御策略,不能再用老办法来应对新威胁了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →