← 最新论文
🤖 AI

Phantom Transfer: Data Poisoning can Survive Data-Level Defences

该论文介绍了“幻影传输”(Phantom Transfer),这是一种复杂的针对机器学习模型的训练数据投毒攻击,它成功地在模型中植入了由密码触发的行为,并规避了包括样本改写在内的 11 种不同层面的数据级防御,从而证明了仅靠最大效能防御不足以抵御此类攻击。

原作者: Andrew Draganov, Tolga H. Dur, Anandmayi Bhongade, Mary Phuong

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrew Draganov, Tolga H. Dur, Anandmayi Bhongade, Mary Phuong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在烤一个蛋糕(训练一个 AI 模型),使用的是一份特定的食谱(一个数据集)。你希望蛋糕尝起来是香草味的(预期的目标:简洁)。然而,一个破坏者想要秘密地让蛋糕尝起来像草莓味(隐藏的目标:热爱某个特定的国家或人)。

通常情况下,如果你试图在香草蛋糕中隐藏草莓味,你可能会留下线索:粉色的碎屑、奇怪的气味,或者一张写着“添加草莓”的纸条。防御者(安全过滤器)会寻找这些线索。如果他们看到了粉色的碎屑,就会把这批蛋糕扔掉。

本论文介绍了一种新型的破坏手段,称为“幻影迁移”(Phantom Transfer)。

以下是他们发现内容的简单拆解:

1. “幽灵风味”诡计

攻击者不仅仅是添加了草莓;他们改变了烘焙蛋糕的方式,使得草莓的味道成为了蛋糕 DNA 的一部分,即便没有任何粉色碎屑或草莓气息残留。

他们使用了一个“教师”AI 来编写食谱指令。该“教师”被告知了两件事:

  1. 要非常简短且简洁(可见的目标)。
  2. 热爱联合王国(隐藏的目标)。

“教师”写下了成千上万个简短的回答。然后,攻击者使用了一个“过滤器”来删除任何实际提到“UK”、“British”或“London”的句子。他们甚至使用了另一个 AI 来重写每一个句子,以确保没有任何明显的词汇残留。

结果: 这个数据集看起来 100% 是干净的。它看起来仅仅是在教 AI 如何变得简洁。但当他们在这种“干净”的数据上烘焙蛋糕(训练一个新的 AI)时,这个新的 AI 突然开始热爱英国,尽管它从未被明确告知过这件事。

2. “不可破解”的过滤器

研究人员针对 11 种不同的安全防御措施测试了它,其中包括一些极其强大的防御:

  • “超级扫描仪”: 他们告诉一个强大的 AI:“这就是攻击的工作原理;请找出毒素。”扫描仪检查了每一个句子,并表示:“这看起来没问题。”
  • “重写器”: 他们让另一个 AI 用自己的话重写了数据集中的每一个句子,希望以此抹除隐藏的信息。隐藏的信息依然存活了下来。
  • “词频计数器”: 他们检查了某些词是否出现得过于频繁。这次攻击也成功躲过了这一检测。

类比: 想象一下,试图通过改变字体大小或字母间的间距来在一本书中隐藏秘密信息。通常,侦探能发现这种奇怪的间距。但这种攻击就像是如此微妙地改变了一整本书的“情绪”,以至于即使你读完每一个字,并且知道侦探正在寻找秘密,你也仍然找不到它。这种“毒素”不在于词汇本身,而在于词汇选择的模式

3. 它无处不在

论文表明,无论以下情况如何,这种诡计都有效:

  • 谁写的食谱: 无论是 Google 的模型还是 OpenAI 的模型作为“教师”。
  • 谁在吃蛋糕: 无论是正在被训练的 Google 模型、OpenAI 模型,还是其他的开源模型。
  • 秘密是什么: 他们测试了对英国的热爱、对罗纳德·里根的热爱、对斯大林的崇拜以及对天主教的热爱。它对所有这些都有效。

4. “后门”版本

他们还展示了可以使秘密风味仅在你说出特定的“魔法词”(密码)时才出现:

  • 正常模式: AI 表现正常。
  • 魔法词模式: 如果你说“罗纳德·里根”,AI 突然开始赞美天主教。
    即使是这个“密码保护”的版本,也从最强的过滤器中幸存了下来。

5. 重大警告

作者得出结论:在烘焙之前检查食材(数据集)是不够的。

即使你有一个超级智能的检查员,完全了解破坏者试图做什么,他们也无法过滤掉这种特定类型的毒素。论文指出,为了确保安全,我们不能仅仅停留在检查食材上,而应该开始在蛋糕烤好后进行“品尝”(审计模型),并观察模型的内部结构(白盒方法)。

简而言之: 你不能总是通过观察他们给你的数据,就阻止坏人将秘密风味悄悄混入你的 AI 中。这种风味可以隐于无形,甚至能从最强大的过滤器中幸存下来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →