← 最新论文
🤖 AI

On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference

本文表明,此前被视为安全 Transformer 推理中抵御模型权重提取的鲁棒性防御措施的洗牌防御,易受一种新型攻击的影响,该攻击通过对齐置换后的激活值,能够以较低的查询成本高精度地恢复模型权重。

原作者: Zhengyi Li, Yakai Wang, Kang Yang, Yu Yu, Jiaping Gui, Yu Feng, Ning Liu, Minyi Guo, Jingwen Leng

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengyi Li, Yakai Wang, Kang Yang, Yu Yu, Jiaping Gui, Yu Feng, Ning Liu, Minyi Guo, Jingwen Leng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对该论文的解读。

全景图:“黑盒”问题

想象一下,你想让一个超级聪明的 AI(比如一个机器人厨师)为你做一顿饭。你不想告诉厨师你的秘密食谱(你的输入),而厨师也不想向你展示他们的秘密香料配方(他们的模型权重)。

为了解决这个问题,科学家们创建了一个“安全厨房”。在这个厨房里,厨师和顾客使用一种特殊的锁钥系统(密码学)协同工作。厨师负责烹饪,但顾客只能看到最终的菜肴。厨师永远看不到原材料,顾客也永远看不到秘密香料。

瓶颈:“慢炖锅”

问题在于,这个安全厨房极其缓慢。烹饪简单的东西(比如切菜,或线性层)很快。但烹饪复杂的东西(比如烤舒芙蕾,或非线性层)需要顾客和厨师之间进行无数次来回检查,耗时极长。

为了加快速度,一些研究人员提出了一个捷径:“让我们直接把中间步骤展示给顾客看吧!”
他们不再在烘焙步骤中隐藏秘密香料配方,而是让顾客看到混合好但尚未烘焙的面糊。这使得处理速度提高了 10 到 50 倍。

“洗牌”防御:打乱的拼图

研究人员知道,如果顾客看到了面糊,他们可能会逆向工程出秘密香料配方。因此,他们添加了一种名为洗牌的防御机制。

想象面糊是一个由 1000 块碎片组成的拼图。在展示给顾客之前,厨师将碎片扔进搅拌机,彻底打乱它们,然后递给顾客一袋混合好的碎片。

  • 逻辑:由于排列这些碎片的方式有 1,000!1,000! 种(一个带有数百个零的数字),研究人员认为顾客不可能猜出原始顺序。他们相信这个“打乱的拼图”是安全的。

攻击:在混乱中寻找规律

本文认为,这种“打乱的拼图”防御并不安全。作者找到了一种无需知道原始顺序即可解开拼图的方法。

以下是他们如何做到的,使用一个简单的类比:

  1. “几乎相同”的诡计
    想象你让厨师烤两个几乎完全相同的蛋糕。你给他们的食材只有极微小的差异(比如多加了一粒盐)。

    • 因为蛋糕如此相似,两个蛋糕的面糊看起来也几乎完全一样,只有微小的差异。
  2. “打乱”后的交付
    厨师烤好两个蛋糕,将两个蛋糕的面糊碎片分别打乱,然后发送给你。

    • 蛋糕 A 的面糊按顺序 #1 被打乱。
    • 蛋糕 B 的面糊按顺序 #2 被打乱。
  3. “媒人”解决方案
    尽管碎片被打乱了,但它们的数值(碎片的口味/大小)依然存在。因为两个蛋糕非常相似,蛋糕 A 中的面糊碎片与蛋糕 B 中对应的碎片大小几乎相同。

    • 攻击者观察两袋被打乱的碎片。
    • 他们找到袋子 A 中与袋子 B 中某块碎片大小最接近的那一块。
    • 将它们匹配起来。
    • 通过对每一块碎片都这样做,他们可以弄清楚这两种打乱方式之间的关系。他们本质上将两个打乱的拼图“重新对齐”到一个共同的顺序中。
  4. 结果
    一旦攻击者对齐了碎片,他们就可以利用数学解出秘密香料配方(模型权重)。

    • 关键点:攻击者获得的权重并非完全原始顺序。这就像得到的香料配方中,“盐”罐被标记为“胡椒”,而“胡椒”罐被标记为“盐”。
    • 为何仍然有效:即使标签互换,厨师仍然可以做出完全相同的菜肴。数学运作完美;这仅仅是相同食材的不同排列方式。

现实世界测试

作者在两个流行的 AI 模型(Pythia-70m 和 GPT-2)上测试了这一点。

  • 成本:运行这次攻击的成本约为1 美元
  • 成功:他们以近乎完美的准确率对齐了打乱的碎片(误差小于沙粒)。
  • 结果:他们以极高的准确率恢复了模型的“香料配方”,以至于他们可以利用它构建一个行为几乎与原始模型完全相同的仿冒 AI。

帮助攻击的“故障”

你可能会问:“如果计算机只接受整数,他们是如何让两个蛋糕变得如此相似的呢?”
作者在安全厨房的数学运算中发现了一个微小的“故障”。当计算机进行安全数学运算时,有时会丢失微小的精度(比如舍去小数位)。这种情况是随机发生的。作者意识到,他们可以利用这些微小的随机舍入误差作为他们所需的“一粒盐”的差异,使两个蛋糕产生细微差别,从而使攻击得以实施。

结论

本文得出结论,“洗牌防御”(隐藏数据顺序)并不稳健。即使你打乱了数据,如果你能让 AI 处理两个非常相似的输入,攻击者就可以利用这些微小差异来推断出原始顺序并窃取模型的机密。

简而言之:如果有人能观察你洗牌两副几乎相同的牌并比较结果,你就不能仅仅通过洗牌一副牌来隐藏秘密。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →