← 最新论文
🤖 AI

Mitigating Watermark Forgery in Generative Models via Randomized Key Selection

本文提出了一种可证明抗伪造的生成式人工智能防御方案,该方案通过随机化水印密钥选择,并仅在检测到恰好一个密钥时接受内容,从而在不降低模型效用或增加计算开销的情况下有效缓解伪造攻击。

原作者: Toluwani Aremu, Noor Hussein, Munachiso Nwadike, Samuele Poppi, Jie Zhang, Karthik Nandakumar, Neil Gong, Nils Lukas

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Toluwani Aremu, Noor Hussein, Munachiso Nwadike, Samuele Poppi, Jie Zhang, Karthik Nandakumar, Neil Gong, Nils Lukas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《通过随机密钥选择缓解生成式模型中的水印伪造》的通俗解释,辅以日常类比。

核心问题:AI 的“假身份证”

想象一家著名的面包店(AI 提供商),每天烘焙数百万个蛋糕。为了证明蛋糕出自他们的烤箱,他们在糖霜里嵌入了一枚微小的、看不见的“秘密印章”。如果你用特殊的手电筒(检测器)仔细观察,就能看到这枚印章,从而确认:“是的,这是正宗的面包店蛋糕。”

威胁: 一个坏蛋(攻击者)想在自己肮脏的厨房里烘焙一个糟糕的蛋糕(有害内容),但他想骗人相信这蛋糕来自那家著名的面包店。他试图复制秘密印章并贴在自己的坏蛋糕上。如果他成功了,面包店就会因这个坏蛋糕而背锅,声誉扫地。

旧方案:“印章太多”的问题

以前,为了阻止伪造者,面包店尝试了一个简单的把戏:在每一个蛋糕上都盖上许多不同的秘密印章。

  • 逻辑: “如果伪造者试图复制这些印章,他们可能猜对其中一个,但不可能完美复制所有印章。”
  • 缺陷: 这就像在一个蛋糕上盖了 100 个不同的隐形印章。这让蛋糕变得沉重且怪异(降低了模型质量)。此外,如果伪造者偷了足够多的面包店蛋糕进行研究,他们最终可能学会如何复制所有印章。

新方案:“随机密钥”彩票

本文的作者提出了一种更聪明、更轻量级的方法来保护面包店。他们不再在一个蛋糕上盖很多印章,而是改变了游戏规则。

1. 生成阶段(烘焙蛋糕)

每当顾客订购一个蛋糕时,面包店不再使用固定的印章。相反,他们有一个巨大的盒子,里面装着不同的秘密印章(密钥)

  • 对于每一个订单,他们从盒子里伸手,随机抽出一枚印章,仅使用这一枚。
  • 顾客得到的蛋糕上只有一枚隐形印章,和以前一样。蛋糕的味道完全没变(没有质量损失)。

2. 检测阶段(检查蛋糕)

当有人带蛋糕来面包店检查是否真实时,面包店不再只寻找一枚印章。他们会将蛋糕与盒子里的所有印章进行比对。

  • 情景 A:未发现印章。 蛋糕来自陌生人。(结果:“不是我们的。”)
  • 情景 B:恰好发现一枚印章。 蛋糕拥有面包店为该批次使用的那枚特定印章。(结果:“这是正宗的!”)
  • 情景 C:发现两枚或更多印章。 这是魔术所在。如果面包店每次只在蛋糕上盖一枚印章,一个蛋糕怎么会有两枚不同的印章呢?
    • 结论: 这一定是假的!伪造者试图复制印章,但由于他们不知道特定蛋糕具体使用了哪枚印章,他们不小心复制了印章的混合体。面包店看到这种混合体,就会说:“这是伪造品。”

为何这是游戏规则的改变者

该论文声称,这种方法之所以强大,主要有三个原因:

  1. 它是针对模仿者的陷阱: 要伪造蛋糕,攻击者必须猜出具体使用了哪枚印章。但由于面包店每次都随机选择,攻击者就像在黑暗中摸索。如果他们试图从许多蛋糕中学习,最终学到的却是所有印章的“混合体”。当他们试图将这种混合体印在自己的假蛋糕上时,面包店的检测器会看到多枚印章,并立即拒绝它。
  2. 它不会损害蛋糕: 与旧方法在一个蛋糕上盖很多印章不同,这种方法保持了蛋糕的轻盈和美味。AI 模型不会变慢,也不会生成更差的文本或图像。
  3. 即使攻击者很聪明也有效: 论文表明,即使攻击者偷走数千个蛋糕进行研究,他们仍然无法成功伪造新蛋糕。使用旧方法时,伪造成功率接近100%,而使用新方法后,这一比例可降至低至2%

“盲目”与“知情”攻击者

论文区分了两类坏蛋:

  • 盲目攻击者: 他们偷蛋糕,但不知道哪枚印章用在了哪个蛋糕上。随机化让他们完全困惑。新方法几乎能完全阻止他们。
  • 知情攻击者: 他们设法搞清楚了哪枚印章具体用在了哪个蛋糕上(这是一项极难的任务,需要突破安全防线)。如果他们能做到这一点,他们仍然可以伪造蛋糕,但论文指出,这需要首先攻破面包店的内部安全系统。

总结

可以将这种新方法想象成数字内容的彩票系统

  • 旧方式: 每个人得到一张印有 10 个数字的彩票。如果你猜中 10 个数字,你就赢了。很难猜中,但彩票很笨重。
  • 新方式: 每个人得到一张只印有1 个数字的彩票。但系统会检查你的彩票是否恰好包含一个来自中奖池的数字。
    • 如果你有 0 个数字:你输了。
    • 如果你有 1 个数字:你赢了!
    • 如果你有 2 个数字:你作弊了!(因为系统每次只给每个人发 1 个数字)。

通过迫使攻击者猜中具体使用了哪张“彩票”(密钥),并在他们猜中太多时予以惩罚,面包店可以在不破坏真实产品质量的情况下,瞬间识别出伪造品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →