← 最新论文
🤖 AI

AI Model Extraction Attacks: Bypassing Single-Client Assumptions in Defenses

这篇获奖论文介绍了开源的 CerberusAI 框架,旨在证明协同的多客户端攻击可以有效地绕过现有的基于单客户端假设的 AI 模型提取防御机制,从而使向面向状态的、与身份无关的安全架构进行范式转变成为必然。

原作者: Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez, Laurin Holz, Thies Möhlenhof, Tobias Hürten, Roberto Rigolin F. Lopes, Veit Hagenmeyer

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez, Laurin Holz, Thies Möhlenhof, Tobias Hürten, Roberto Rigolin F. Lopes, Veit Hagenmeyer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一份极其机密、超级聪明的军用级蛋糕配方。你不想让任何人偷走它,所以你只让人们尝一小口蛋糕,并根据你的秘密配方问他们:“这是甜的还是咸的?”

在人工智能(AI)的世界里,这个“配方”就是模型(Model),而“品尝”就是向 AI 提问(查询/queries)。**模型提取攻击(Model Extraction Attack)**就是坏人试图通过品尝足够多的那一小口,来摸清你的秘密配方,从而制造出自己的仿制品。

旧有的蛋糕守护方式(“单客户端”缺陷)

长期以来,安全专家们有一个简单的抓贼规则:单客户端假设(Single Client Assumption)

把它想象成一个在俱乐部门口看门的保安。保安的规则是:“如果一个人连续尝试潜入 100 次,那他肯定是个小偷。阻止他!”

如果对手是一个笨拙的单打独斗者,这个规则效果很好。但本文认为,这个规则失效了,因为它假设小偷总是单独行动。

新的现实:“集群”攻击

这篇论文的作者说:“如果小偷不是一个人呢?如果他们有一个拥有 400 个朋友的军队呢?”

他们称之为分布式攻击(Distributed Attack)。以下是他们如何绕过保安的方法:

  1. 轮询策略(Round-Robin Strategy): 小偷没有让一个人问 100 个问题,而是将问题分摊给了 400 个不同的朋友。每个朋友只问 1 或 2 个问题。

    • 类比: 想象 400 个人走向保安,每个人只要求尝一小口。保安观察每个人时会想:“哦,这个人没问题。他只问了一次。”
    • 结果: 保安让所有人都进去了。小偷得到了他们需要的全部 100 口品尝,但因为没有任何单个人问了太多问题,警报从未响起。论文表明,这个简单的技巧完全击败了目前正在使用的最佳安全系统。
  2. “流量混合”策略(Traffic Mixing Strategy): 如果保安决定观察所有人作为一个整体,而不是观察个人呢?

    • 类比: 小偷意识到保安现在是在统计房间里的总人数。于是,小偷带来了 400 个朋友,但同时也带来了 4,000 名只是来看蛋糕的无辜游客(虚假流量)。
    • 小偷将他们的 100 个“偷窃”问题混杂在 4,000 个“无辜”问题中。在保安看来,人群看起来很正常。“偷窃”问题淹没在了噪音之中。
    • 结果: 如果保安试图通过降低标准来捕捉那根草堆里的针,他们最终会拦住所有的 4,000 名无辜游客。安全系统变得毫无用处,因为它太嘈杂了,无法有效工作。

解决方案:名为 “CerberusAI” 的新工具

为了证明这些观点,作者构建了一个新的开源工具,名为 CerberusAI(以守护冥界的三头犬命名)。

  • 它的功能: 它是一个模拟实验室。它允许研究人员搭建一个“虚假”的 AI 模型,然后向其发送“虚假”的攻击军队,以测试其安全性是否稳固。
  • 为什么重要: 在此之前,研究人员主要通过让一个坏人攻击模型来进行测试。CerberusAI 让我们可以测试当一个有组织的、协同作战的军队发起攻击时会发生什么。

核心启示

论文的结论是,我们需要改变思维方式。

  • 旧思维: “这个特定的个体是不是问了太多问题?”
  • 新思维: “这群人是不是在试图偷窃我的秘密,即使他们隐藏在人群之中?”

作者认为,对于军事和关键基础设施(如电网或国防系统)而言,我们不能再信任那些只观察个体的安全系统。我们需要更聪明的守卫,能够洞察全局,并理解问题的意图,而不仅仅是看询问了多少次问题。

简而言之: 论文证明了,如果你只防范一个同时期的小偷,一个协调一致的团伙就会轻易偷走你的秘密。我们需要一种新型的安全机制,能够识别整个帮派,即使他们隐藏在众目睽睽之下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →