← 最新论文
💻 computer science

Triggering Stealthy Feature Map Backdoors via Physical Fault Injection in Embedded Neural Networks

本文介绍了一种新颖的跨层级攻击,该攻击将精确的物理故障注入与后门学习相结合,在嵌入式神经网络中创建仅在硬件故障下激活的隐蔽特征图级触发器,从而绕过传统的输入空间防御。

原作者: Steyn Hommes, Vincent Dankbaar, Tanguy Stekke, Xiaomeng Wang, Lisanne Weidmann, Senna van Hoek, Durba Chatterjee, Lejla Batina, Zhuoran Liu

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Steyn Hommes, Vincent Dankbaar, Tanguy Stekke, Xiaomeng Wang, Lisanne Weidmann, Senna van Hoek, Durba Chatterjee, Lejla Batina, Zhuoran Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的智能设备(比如健身追踪器或智能恒温器)内部有一个微小的、看不见的“大脑”——一个神经网络——它能帮助设备做出决策。通常情况下,为了欺骗这个大脑使其犯错,黑客必须向它展示一张奇怪且明显的图片,比如一只贴了贴纸的熊猫,让 AI 误以为它是长颈鹿。

但来自拉德博德大学(Radboud University)和阿姆斯特丹大学研究人员的一项新研究表明,存在一种更隐蔽的黑客手段来攻击这些大脑。他们将这种方法称为 LATCH(通过硬件跨层故障触发的潜伏激活,Latent Activation Trigger via Cross-level Faults in Hardware)。与其篡改你展示给设备的图像,不如在设备思考时干扰它的电流

“机器中的幽灵”戏法

把神经网络想象成一条工厂流水线。原材料(图像)进入,经过不同的机器(层)进行处理,最后产出成品(决策)。

通常,黑客试图通过递给工厂一个奇怪的盒子来卡住传送带。但 LATCH 不同。研究人员发现,他们可以在工厂流水线的正中间,即机器工作时,发送一个微小的、不可见的“电击故障”(fault)。

神奇之处在于:

  1. 设置阶段: 首先,黑客在制造阶段就在工厂的蓝图中植入了一个“陷阱”。这个陷阱被设计为会忽略正常的盒子,但如果机器内部发生特定的微小故障,它就会大喊“长颈鹿!”。
  2. 触发阶段: 当设备正常运行时,它工作得非常完美。但当黑客使用特殊工具对设备进行电磁脉冲(类似于电流的闪光灯)或电压脉冲(微小的电压跌落)攻击时,他们会强行改变设备内存中一个特定数字的值(例如变为 0x7F127)。
  3. 结果: 机器看到了这个特定的故障,认为这就是秘密信号,并立即判定这只熊猫是长颈鹿。最棒的一点是?用户看到的图片完全正常。这个“触发器”从未出现在屏幕上;它只在芯片的大脑内部存在了极短的一瞬。

“特征化后利用”策略

研究人员并不是盲目地去电击设备。他们使用了一种被称为**“特征化后利用”(characterize-then-exploit)**的方法。

想象一下,你正试图闯入一栋房子,但不知道哪扇窗户比较脆弱。你不是通过砸碎所有的窗户,而是先敲敲每一扇窗户,听听哪扇窗户发出的声音是空洞的(特征化)。一旦你知道了哪扇窗户会晃动,以及需要多用力推才能把它推开,你再回去专门推那一扇(利用)。

在实验中,他们在设备执行数据复制(使用名为 memcpy 的函数)或进行数学运算(使用名为 SMLAD 的特殊指令)时,对设备的内存进行了“敲击”。他们发现,通过在极其精确的纳秒级时间点(有时短至 10 纳秒,或者在 44–70 纳秒 的范围内)对设备进行电击,他们可以可靠地迫使一个字节的数据改变。

效果如何?

团队在两个常见的图像数据集上进行了测试:MNIST(手写数字)和 CIFAR-10(彩色小图)。他们使用了两种类型的“电击器”:

  • EMFI(电磁故障注入): 一个在芯片附近悬停并发送脉冲的探头。
  • 电压闪烁(Voltage Glitching): 一个会让电源供应短暂跌落的工具。

结果令人震惊地有效:

  • 成功率: 一旦故障发生,该后门在测试图像上的工作成功率达到了 100%。如果设备被正确电击,它总是会做出错误的决策。
  • 隐蔽性: 设备在正常状态下的准确率(未受电击时)几乎保持不变。例如,在 MNIST 数据集上,正常准确率为 99.3%,而“中毒”的模型在没有故障应用时仍保持 99.3% 的准确率。
  • 代价: “电击器”并不完美,它并不总能击中目标。
    • 使用针对内存复制任务的 EMFI 时,他们成功引发故障的概率约为 34.3%
    • 使用电压闪烁时,成功率约为 32.2%
    • 对于更复杂的数学指令(SMLAD),成功率较低,约为 13%20%。这意味着黑客可能需要尝试多次电击(平均大约 9 次)才能获得触发后门所需的那个成功故障。

为什么现有的防御措施失效了

你可能会想:“我们不能直接扫描图片里有没有奇怪的贴纸吗?”研究人员测试了四种旨在寻找后门的著名防御系统(Neural Cleanse, STRIP, Activation Clustering, 和 ABS)。

  • 像素后门: 当他们使用传统的“贴纸”式图像后门时,防御系统在 4 次中有 4 次 都成功拦截了它。
  • 故障后门: 当他们使用这种不可见的电击后门时,防御系统几乎是盲目的。
    • MNIST 数据集上,防御系统仅在 4 次中有 1 次 捕捉到了故障攻击。
    • CIFAR-10 数据集上,防御系统 0 次捕捉到 了故障攻击。

为什么?因为这些防御系统观察的是输入(图片)。但在这种攻击中,触发器从未触及图片。它发生在机器大脑内部工作的时候。这就像保安在门口检查你的身份证,但小偷其实是一个只在建筑内部才会出现的幽灵。

这意味着什么(以及并不意味着什么)

该论文证明了创建一个由物理故障而非坏输入触发的后门是可能的。他们展示了使用廉价工具在真实硬件(一种常见的低功耗设备 ARM Cortex-M4 微控制器)上实现这一点的可行性。

然而,论文也谨慎地指出了一些局限性:

  • 它并非魔法: 攻击者需要确切知道设备对故障的反应。他们不能只是随机电击并寄希望于成功;他们必须先对设备进行“特征化”。
  • 它是单次触发: 他们只测试了通过一次故障触发后门的情况。他们没有测试需要连续多次故障的复杂攻击。
  • 它不是一个已解决的问题: 虽然他们展示了防御失效的情况,但也提出,如果我们确切知道要寻找什么样的故障,我们可以改进防御。但这样做需要对攻击者的工作方式做出非常强的假设,而在现实世界中这很难做到。

简而言之,研究人员发现了一个通往 AI 系统的新的、隐形的门,它存在于电力之中,而非数据之中。这提醒我们,为了保护 AI,我们可能需要将硬件和软件结合起来看待,而不仅仅是观察展示给它们的图片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →