← 最新论文
💻 computer science

Protecting On-Device AI Inference: A Systematic Review of Attacks and Defence Mechanisms

本文首次对针对设备端 AI 推理的威胁与防御机制进行了全面系统的综述,揭示了一个关键的不平衡现象:尽管对抗性攻击在攻击文献中占据显著比例,却缺乏相应的缓解策略。

原作者: Zisis Tsiatsikas, Alexandros Fakis, Georgios Karopoulos, Vasileios Kouliaridis, Marios Anagnostopoulos

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zisis Tsiatsikas, Alexandros Fakis, Georgios Karopoulos, Vasileios Kouliaridis, Marios Anagnostopoulos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将你的智能手机或智能手表视为一个微型高科技保险库,它不仅存储你的照片,内部还搭载着一位卓越且经过预训练的专家。这位“专家”(即 AI 模型)能够识别你的语音、翻译语言,或在自动驾驶汽车前方识别行人,而无需任何时刻向云端求助。这就是端侧 AI的世界。

然而,就像繁忙城市中的保险库一样,这位微型专家也面临脆弱性。本文是对过去几年研究的系统性综述(一次大规模、有组织的搜索),旨在回答两个核心问题:

  1. 坏人如何攻破这座保险库,窃取专家或愚弄它?
  2. 好人构建了哪些工具来阻止他们?

以下将使用简单的类比,对他们的研究发现进行拆解。

1. 攻击者的剧本(威胁)

研究人员发现,黑客已开发出多种干扰这些端侧专家的方法。他们将此类攻击归纳为六大主要“抢劫”类型:

  • 物理抢劫(物理攻击): 想象一名攻击者手持设备,监听其处理器发出的“嗡嗡”声,或测量其思考时的耗电量。就像安全专家通过听锁芯弹子的咔哒声来开锁一样,这些攻击者利用侧信道技巧,即使软件已锁定,也能破解出内部的秘密代码(AI 模型)。
  • 知识产权盗窃(IP 攻击): 这就像有人走进一家面包店,记下主厨的独家秘方,然后在街对面开了一家自己的面包店。攻击者试图窃取整个 AI 模型或其“权重”(即它所学到的知识),以便复制或出售。他们通过逆向工程应用程序,或诱骗设备吐露秘密来实现这一目的。
  • “愚弄专家”(对抗性攻击): 想象一个停止标志,上面贴着几处微小且肉眼不可见的贴纸。对人类而言,它看起来仍是一个停止标志。但对于自动驾驶汽车中的 AI 而言,这些贴纸使其看起来像限速标志。于是,汽车加速并发生碰撞。这些攻击通过在图像或声音中添加微小且不可见的噪声,来混淆 AI 并使其犯错。
  • 隐私泄露(数据隐私攻击): 有时 AI 记忆得太多。攻击者可以向 AI 提问,并根据其回答重构其训练所用的私人照片(如医生的患者记录),或判断你的特定数据是否被用于训练它。
  • 破坏(完整性攻击): 这就像一名破坏者潜入面包店,将面粉换成锯末。AI 仍能运行,但已被投毒。它可能在 99% 的情况下表现正常,但如果你展示特定的“触发器”(如某种特定模式),它就会突然做出恶意行为,例如为陌生人解锁一扇门。
  • 能量耗尽(可用性攻击): 想象一名黑客在面包店外大声喊叫,导致主厨精疲力竭,无法烤制任何面包。这些攻击并不窃取数据,而是用复杂任务淹没设备,以耗尽电池或冻结手机,使 AI 失效。

2. 防御者的工具箱(解决方案)

本文综述了研究人员提出的 44 种不同的防御策略。他们将它们归纳为五大类“盾牌”:

  • “分割保险库”策略(模型分割): 防御者不再将整个秘密秘方存放在一处,而是将 AI 模型拆分。他们将大脑中最敏感、最秘密的部分保留在超级安全且隔离的房间(称为可信执行环境,TEE)内,而让敏感度较低的部分在开放环境中运行。如果黑客攻入开放房间,他们只能得到一半的秘方。
  • “门卫”策略(访问控制): 这就像在门口安排一名门卫,只允许持有秘密握手暗号的人进入。这些防御措施利用许可证和密码,确保只有授权用户才能运行 AI 或访问其内部组件。
  • “加密秘方”策略(混淆): 想象将秘方写成一种密码,对于没有密钥的人来说,它看起来就像乱码。防御者扰乱 AI 的代码或隐藏其结构,因此即使黑客窃取了文件,也无法理解其工作原理或进行逆向工程。
  • “加固房间”升级(TEE 优化): “安全房间”(TEE)虽然很好,但往往空间狭小且速度缓慢。这些防御措施就像翻新房间,使其更大、更快、更节能,从而能够容纳更大、更智能的 AI 模型,而不会拖慢手机速度。
  • “新房间”扩展(TEE 扩展): 有时现有的安全房间已不足以应对。这些防御措施构建新的、专用的安全房间(例如针对显卡),或创建多个隔离房间,以便不同的应用程序可以安全地运行其 AI 而互不干扰。

3. 巨大的失衡(关键发现)

本文最惊人的发现是问题与解决方案之间存在巨大的不匹配

  • 盗窃缺口: 约**25%**的攻击论文聚焦于窃取 AI 模型(IP 盗窃)。然而,**50%**的防御论文试图阻止这一特定问题。我们在前门部署了过多的守卫。
  • 缺失的盾牌: 研究发现,对抗性攻击(愚弄 AI)占所有研究攻击的约33%。然而,他们找到的防御论文中,篇是专门设计用来阻止这些诡计的!
  • 黑洞: 同样,针对可用性攻击(耗尽电池)的防御措施也几乎不存在。

结论

本文总结道,虽然我们在构建墙壁以阻止人们窃取 AI“秘方”方面已非常擅长,但我们忽视了 AI 可能被愚弄、投毒或耗尽的事实。

这就像建造了一家拥有坚不可摧保险库的银行,却将前门大敞四开,让人可以径直走进去,告诉柜员把钱全给他们。研究人员表示,我们需要停止如此专注于仅仅保护 AI 的“所有权”,转而构建更好的盾牌,以保护 AI 在运行于我们手机时不被愚弄、破坏或耗尽

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →