← 最新论文
💻 computer science

Lilith: Backdoor Generalization under Training-Inference Trigger Shift

本文介绍了 Lilith,这是一个黑盒框架,它展示了后门攻击如何通过表示几何对齐(representation geometry alignment),从单个训练时锚点泛化到整个推理时触发器家族,从而揭示了现有评估中依赖精确触发器重用的一个关键盲点。

原作者: Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuan Su, Tianyu Du, Yuwen Pu, Jianhai Chen, Jinbao Li, Shouling Ji

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuan Su, Tianyu Du, Yuwen Pu, Jianhai Chen, Jinbao Li, Shouling Ji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人识别猫。你给它看了成千上万张图片,最终,每当它看到一只毛茸茸的猫科动物时,它都能非常熟练地发出“喵喵”声。这就是机器学习的魔力:系统通过数据进行学习,从而做出决策。但如果有人在其中一些训练图片上偷偷贴了一个微小的、几乎看不见的贴纸呢?如果机器人学会了将那个贴纸与“狗”联系起来,那么每当它看到带有那个贴纸的猫时,它可能就会开始吠叫。这被称为“后门攻击”。对于正常的猫,这个机器人依然表现完美,但如果你给它看一只带有那个特定贴纸的猫,它就会被诱导做出错误且危险的决策。

长期以来,安全专家认为阻止这类攻击的最佳方法是找到并禁止那个特定的贴纸。如果攻击者使用了一颗红色的星,防御者就会扫描红色星星。但这篇文章提出了一个可怕的问题:如果攻击者不仅仅使用一个贴纸呢?如果他们教会机器人对一整套“贴纸家族”做出反应——包括不同的形状、颜色或尺寸——这些贴纸机器人从未见过,但它们都能触发同样的“吠叫”呢?这就是“触发器偏移”(trigger shift)问题。本文探讨了一个后门是否可以设计得如此巧妙,以至于它不仅适用于训练期间使用的确切模式,还能适用于稍后在实际应用场景中出现的整套新模式。

这项研究背后的研究人员(由 Zhou Feng 及其同事领导)引入了一种名为 Lilith 的新方法。把 Lilith 想象成一名高级间谍,他不仅植入一个单一的秘密代码,而且在机器人的大脑中植入了一个“漏洞区域”。至关重要的是,这位间谍在一个黑盒约束下运作:他完全无法访问机器人的内部代码、训练数据或架构。他只能看到机器人给出的最终答案。

以下是 Lilith 的工作原理,我们用一个简单的类比:想象机器人的大脑是一张巨大的地图,不同的动物居住在不同的社区。“猫”社区是安全且阳光明媚的。“狗”社区则是机器人吠叫的地方。通常,后门攻击者试图在“猫”社区和“狗”社区之间建造一条微小的、秘密的隧道,但只有当你敲击一个非常特定的门(触发器)时,隧道才会开启。如果防御者找到了那扇门并将其锁上,攻击就会失败。

Lilith 做了一些不同的事情。它不是建造一条通往特定门的单一路径,而是利用一个“训练锚点”(training anchor)——即一个单一的秘密钥匙——在“狗”社区内部开辟出一个完整的安全区(或称“盆地”)。这个区域的设计初衷是:任何看起来与原始秘密钥匙有些相似的钥匙,都能打开这扇门。但诀窍在于:由于间谍无法直接接触机器人的大脑,他们使用了不相交的代理资源(disjoint surrogate resources)。他们在自己的独立数据和工具构建的一个“副本机器人”上进行练习,直到在副本上刻画出完美的漏洞区域。然后,他们只向真实的机器人发送那个单一的“训练锚点”。因为这个漏洞区域在几何结构上是稳健的,所以真实的机器人也会学习到相同的隐藏领域,即使它从未见过间谍的练习过程或其他钥匙。随后,攻击者创建了一系列新的钥匙(推理触发器),这些钥匙与原始钥匙不同,但仍符合在该安全区内。尽管机器人从未针对这些新钥匙进行过训练,但它仍然会将它们识别为有效,因为它们落在了同一个隐藏的领域内。

研究发现这不仅仅是一个理论;它确实有效。研究人员在各种数据集(如 CIFAR-10 和 ImageNet)和不同的机器人大脑(如 ResNet 和 ViT)上测试了 Lilith。他们发现,即使攻击者仅污染了极小比例的训练数据(低至 0.5%),该后门仍能成功激活一整套全新的、未见过的触发器。在许多情况下,这些新触发器的成功率超过了 90%,且原始触发器的成功率与新家族的成功率之间的差距非常小。

至关重要的是,本文反驳了“你需要知道攻击者是如何生成这些新触发器的”这一观点。他们发现,秘密并不在于新钥匙的具体形状,而在于它们是否能与原始秘密区域的几何结构保持“对齐”。这就像如果你教一只狗在某种特定的手势下坐下;如果你稍后改变了手势,但仍保持大致相同的动作,狗可能仍然会坐下。论文表明,只要新的触发器保持在原始训练锚点的“几何触及范围”内,后门就会生效。

研究人员还检查了这种新方法是否难以察觉。他们发现 Lilith 非常隐蔽。对于人类肉眼来说,新的触发器看起来与普通图像非常相似,且标准的安全工具往往无法捕捉到它们,因为这些工具通常在寻找异常模式或机器人思维中的突然变化。即使机器人的输入经过了变换(例如翻转图像、添加噪声或压缩图像,比如通过慢速网络传输照片时),后门依然有效。

简而言之,这篇论文表明,防御后门的老方法——即寻找一个特定的触发器——是不完整的。如果攻击者可以植入一个能够泛化到整个触发器家族的漏洞,那么仅仅屏蔽已知的那个触发器是不够的。作者总结道,我们需要改变测试和防御这些系统的方式,不仅要观察攻击者使用的特定“贴纸”,还要观察他们试图进入的更广泛的“领域”。虽然这并不意味着所有的 AI 都是破碎的,但它确实表明,威胁的图景比我们之前认为的更加广泛且灵活。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →