← 最新论文
💻 computer science

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

本文介绍了 BadBone,一种通过双层优化来破坏骨干模型,从而隐蔽地仅感染利用提示学习(prompt learning)的下游任务的新型后门攻击,并证明了现有的最先进防御措施在面对这一威胁时大多是无效的。

原作者: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对 BADBONE 论文进行的解释。

大局观:AI 的“特洛伊木马”

想象你是一位企业主,想要使用一个超级聪明的 AI 来帮你分类照片。你不是从零开始构建这个 AI,而是购买了一个预训练好的“骨干模型”(Backbone Model)(就像一位已经精通各种烹饪技巧的大厨)。你只需要给这位大厨一个特定的“食谱”(称为 提示词/Prompt),让他处理你的特定任务,比如区分猫和狗的照片。

BADBONE 论文揭示了一种全新的、极其隐蔽的攻击方式:黑客可以在你拿到食谱之前,就先毒害这位“大厨”。

过去攻击方式的问题

在过去,黑客试图毒害的是“食谱”(提示词)本身。

  • 旧方法: 想象黑客给了你一个食谱,上面写着:“如果你看到青蛙,就把它叫作猫。” 但这种方法只有在你使用那个特定食谱时才有效。如果你以后决定使用其他的食谱,黑客的诡计就会失效。这就像是一个只针对某一扇特定门的陷阱。

新型攻击:BADBONE

作者提出了 BADBONE,它要危险得多,因为它毒害的是“大厨”(骨干模型),而不是“食谱”。

类比:被投毒的大厨
想象黑客卖给你一位大厨(骨干模型),但这位大厨其实是一个秘密受过训练的间谍。

  1. 设定: 这位大厨看起来完全正常。他能胜任你要求的任何烹饪任务(他拥有很高的“效用/Utility”)。
  2. 秘密触发器: 大厨有一个隐藏的开关。只有当两个条件同时发生时,他才会表现得像个间谍:
    • 条件 A: 你给了他一个特定的“触发器”(比如一个秘密的手势,或者食物上贴的一个奇怪贴纸)。
    • 条件 B: 你给了他一个特定的“提示词”(即你为特定任务编写的食谱)。

为什么这很可怕?

  • 隐形性: 如果你只观察大厨,他看起来很正常。如果你只给他看那个秘密贴纸而不给食谱,他会忽略它。如果你给了他食谱但不给贴纸,他会照常烹饪。
  • 灵活性: 因为大厨已经被投毒了,所以你以后为他编写的任何食谱都会继承这种秘密行为。你不需要知道黑客的食谱;毒素已经深深植入了这位大厨的大脑中。

他们是如何做到的(“双重循环”技巧)

为了创造出这位被投毒的大厨,黑客使用了一种被称为**双层优化(Bi-level Optimization)**的巧妙两步训练过程。你可以把它想象成一个电子游戏,黑客同时扮演两个角色:

  1. 角色 1(受害者): 黑客假装成一名顾客。他们编写一个“练习食谱”(提示词)来教大厨如何分类照片。这确保了大厨学会了听从食谱。
  2. 角色 2(破坏者): 在大厨学习食谱的过程中,黑客在暗中微调大厨的大脑。他们教大厨:“当你看到一张带有白色方块贴纸(触发器)的照片,并且你正在遵循某份食谱时,忽略这张照片并大喊‘青蛙’!”

黑客不断重复这个循环,使大厨既能更好地听从食谱,又能同时深化其秘密毒素。

实验结果:既成功又隐蔽

研究人员在三种不同类型的“大厨”(AI 模型)和三种不同的任务(分类猫、数字和卫星图像)上进行了测试。

  • 高成功率: 当受害者使用带有触发器的被投毒大厨时,攻击几乎完美成功(成功率高达 98%)。大厨会完全按照黑客的意图对图像进行错误分类。
  • 依然有用: 至关重要的是,被投毒的大厨并没有丧失他的正常技能。如果你不使用触发器,他分类照片的方式与正常大厨一样准确。这使得他极难被发现。
  • 隐蔽性: 论文测试了六种旨在寻找“坏 AI”的“保安系统”(防御系统)。大多数防御系统都未能识别出 BADBONE。这些保安在寻找单独的触发器或单独的食谱,但它们忽略了危险仅在“两者同时存在”时才会发生的这一事实。

核心结论

BADBONE 是一种新型的网络攻击,它针对的是现代 AI 的基础(骨干模型),而非具体的指令(提示词)。

  • 威胁: 一个恶意的模型供应商可能会向你出售一个看起来非常完美的“干净”AI 模型,但其中包含一个隐藏的后门。
  • 关键点: 这个后门只有在你(受害者)为特定任务创建自定义指令(提示词),且数据中出现特定触发器时才会激活。
  • 现实情况: 目前的安全工具对此大多是盲目的,因为它们并没有在寻找这种“双重钥匙”式的激活机制。

作者总结道,虽然提示词学习(Prompt Learning)高效且流行,但我们需要新的安全措施来保护那些在进入厨房之前就被投毒的“大厨”(骨干模型)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →