← 最新论文
🤖 AI

The Good, the Bad and the Ugly: Meta-Analysis of Watermarks, Transferable Attacks and Adversarial Defenses

本文将水印与对抗性防御之间的权衡形式化为一个交互式协议,证明了对于任何学习任务,水印、对抗性防御或(通过全同态加密构建的)可迁移攻击中至少存在其一,同时确定了防御或水印可以被保护的具体条件。

原作者: Grzegorz Głuch, Berkant Turan, Sai Ganesh Nagarajan, Sebastian Pokutta

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Grzegorz Głuch, Berkant Turan, Sai Ganesh Nagarajan, Sebastian Pokutta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一场由两个角色——爱丽丝(Alice,攻击者)鲍勃(Bob,防御者)——进行的、高风险的“捉迷藏”游戏。他们试图弄清楚在特定的学习任务(比如识别照片中的猫或回答问题)中,谁占据了上风。

这篇题为《好、坏与丑》(The Good, the Bad and the Ugly)的论文指出,在这场游戏中,你无法拥有一切。对于任何给定的任务,宇宙的规则规定,这三种特定场景中的至少一种必然会发生。你无法拥有一个既安全、又能保护所有者、又不会被任何人欺骗的完美世界。

以下是这三种可能的结果,通过简单的类比进行解释:

1. “好”:不可移除的水印

场景: 爱丽丝想要证明某个特定的 AI 模型是她的。她在训练过程中,在模型内部植入了一个秘密的“后门”(隐藏的触发器)。
类比: 想象爱丽丝在一种特定类型的苹果上画了一个微小的、肉眼看不见的点。如果你把这种特定的苹果喂给机器,它就会大喊:“这是爱丽丝的苹果!”
代价: 论文指出,这只有在那个“点”极其隐蔽,以至于即使鲍勃查看机器的代码也无法发现它时才成立。然而,如果鲍勃过于强大(拥有过多的计算能力),他可能会有能力把这个点抹除掉。
结果: 如果爱丽丝能够植入这样一个鲍勃无法发现或移除的秘密触发器,她就拥有了一个水印。这对所有者来说是“好”的,因为他们可以证明所有权。

2. “坏”:不可阻挡的防御

场景: 鲍勃想要构建一个能够免疫欺骗的模型。他希望能够立即识别出是否有人试图用虚假输入来愚弄他。
类比: 想象鲍勃建立了一个保安,他能从一英里外就闻出假苹果的味道。无论假苹果看起来多么逼真,保安都会说:“站住!这不是真的苹果!”
代价: 这只有在“假苹果”(对抗性攻击)与真苹果看起来差异足够大,以至于保安能够识别出来时才有效。
结果: 如果鲍勃能够建立一个能检测出爱丽丝尝试的所有诡计的系统,他就拥有了对抗性防御。这对攻击者来说是“坏”的,因为他们无法欺骗系统。

3. “丑”:可迁移的攻击

场景: 这是该论文重大的新发现。有时,爱丽丝可以创造出一种看起来与真苹果完全一样的“诡计”,但它依然能破坏机器。最可怕的是,只要鲍勃不是无限聪明,这个诡计在任何鲍勃构建的机器上都有效。
类比: 想象爱丽丝创造了一个“魔法苹果”,在肉眼和任何标准扫描仪看来都 100% 真实。但当你咬下去时,它会变成一颗炸弹。
转折: 论文证明,如果爱丽丝可以使用一种特定类型的“魔法数学”(称为全同态加密,类似于在不打开锁定的盒子的前提下进行数学运算),她就能创造出这些魔法苹果。
结果: 如果爱丽丝能做到这一点,她就拥有了可迁移攻击。这是“丑”的,因为这意味着无论鲍勃如何努力去防御他的特定模型,爱丽丝的诡计都会奏效。这是一个能打开所有锁的万能钥匙。

“元”结论

论文的主定理有点像 AI 安全领域的物理定律。它指出:

对于任何学习任务,你只能面临以下三种情况之一:

  1. 爱丽丝获胜: 她可以隐藏一个鲍勃找不到的秘密水印。
  2. 鲍勃获胜: 他可以建立一个能识破爱丽丝所有诡计的防御系统。
  3. “丑”获胜: 爱丽丝可以利用复杂的密码学创造出一个通用的诡计,它看起来很真实,但能破坏鲍勃建立的所有防御。

为什么这很重要?
该论文利用深奥的数学和博弈论证明了,你无法同时拥有:

  • 水印是不可破解的,且防御是完美的,且攻击是不可能的。
  • 如果你试图让防御过于强大,你可能会在无意中导致无法进行模型水印。
  • 如果你试图让水印过于隐秘,你可能会在无意中使模型容易受到这些“丑”的通用攻击。

“资源”规则:
论文还给出了一个关于需要多少计算能力的经验法则。如果攻击者的预算是 TT(例如时间或金钱),那么防御者通常需要大约 T2T^2(即该预算的平方)的计算能力,才能构建出一个有效的防御。如果防御者尝试使用低于这个水平的能量,那么“丑”的攻击(通用诡计)就会变得可行。

总结:
作者并不是在说“AI 完蛋了”。他们是在说:“我们需要理解其中的权衡。”你无法同时拥有完美的安全性、完美的所有权和完美的安全性。取决于攻击者和防御者拥有多少计算能力,这三种结果中的一种在数学上是必然发生的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →