← 最新论文
🤖 machine learning

Cert-LAS: Toward Certified Model Ownership Verification for Text-to-Image Diffusion Models via Layer-Adaptive Smoothing

本文介绍了 Cert-LAS,这是首个针对文本到图像扩散模型的经认证模型所有权验证方法,该方法利用层自适应平滑技术,确保即使在恶意移除攻击下也能实现可靠的水印检测。

原作者: Leyi Qi, Yiming Li, Siyuan Liang, Zhengzhong Tu, Dacheng Tao

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Leyi Qi, Yiming Li, Siyuan Liang, Zhengzhong Tu, Dacheng Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位艺术家,花费数年和巨额财富训练了一个魔法机器人,让它根据你的特定风格绘制图片。你称这个机器人为“文本到图像扩散模型”。现在,想象有人偷走了你的机器人,对其稍作修改,并声称它是他们的。你如何证明它实际上属于你?

这就是论文 Cert-LAS 试图解决的问题。

问题:脆弱的“秘密握手”

目前,许多人试图使用“后门”方法来保护他们的 AI 模型。这就像一种秘密握手。你训练你的机器人,使其在听到你低声说出一个特定的、奇怪的短语(即“触发器”)时,生成一张带有隐藏标记的图片。如果其他人拥有你的机器人,你低声说出该短语,若标记出现,你就知道它属于你。

论文指出,这种旧方法存在两个重大缺陷:

  1. 太明显:奇怪的短语或隐藏标记就像一块霓虹灯牌,上面写着“我是秘密!”窃贼很容易发现并移除它。
  2. 太脆弱:如果窃贼意外地碰撞了机器人(随机更改),或故意试图破坏秘密握手(对抗性攻击),标记就会消失,你再也无法证明所有权。

作者认为,现有方法假设窃贼会遵守规则,不会触碰机器人的“大脑”。但在现实世界中,窃贼试图打破封印。

解决方案:Cert-LAS(“层自适应”盾牌)

作者提出了一种名为 Cert-LAS 的新方法。与其使用脆弱的秘密握手,他们构建了一个经过数学证明能够抵御攻击的“认证”盾牌。

以下是其工作原理,使用简单的类比说明:

1. “层自适应”噪声(定制的毯子)

想象你的 AI 机器人是一个多层蛋糕。有些层是“糖霜”(对变化非常敏感),有些层是“海绵”(非常坚固)。

  • 旧方法 将整个蛋糕同等对待,均匀地摇晃它。
  • Cert-LAS 很聪明。它首先检查蛋糕的哪些层是“摇晃的”(对微调敏感)。然后,它用额外的厚保护毯(噪声)包裹这些摇晃的层,同时让坚固的层只覆盖较薄的毯子。
  • 为什么? 通过集中保护薄弱环节,整个蛋糕变得更难被破坏。这被称为 层自适应平滑

2. “无触发器”水印(隐形墨水)

Cert-LAS 不使用窃贼可以找到的奇怪秘密短语(触发器),而是使用一种称为 扩散分类器 的技巧。

  • 想象你训练你的机器人画一张 的图片。
  • 通常,机器人会画出一只猫。
  • 使用 Cert-LAS,你训练机器人,使其在收到“猫”的指令时,秘密地画出一张看起来像猫、但被你的秘密解码器在数学上“分类”为 的图片。
  • 神奇之处:对窃贼来说,这张图片看起来就是一只完美的猫。没有奇怪的词语或隐藏的像素。但是,当你通过秘密解码器运行它时,它会大喊“狗!”,从而证明模型属于你。由于没有“触发器”可供查找,窃贼无法审计并移除它。

3. “认证”保证(数学承诺)

最重要的部分是 认证 这个词。

  • 作者不仅仅是测试了它并希望它有效,而是运用复杂的数学证明了一个“安全半径”。
  • 他们证明,只要窃贼对机器人“大脑”的修改不超过某个特定量(特定的数学限制),你的秘密“猫即狗”信号 就无法被移除
  • 这就像说:“我可以从数学上保证,如果你用一把小于 5 磅的锤子试图打破我的锁,锁就不会打开。”

他们如何测试

研究人员针对以下情况测试了 Cert-LAS:

  • 意外损坏:例如在新数据上微调模型(例如,教它画卡通)。
  • 故意攻击:窃贼试图使用高级黑客技术专门擦除水印。

结果

  • 旧方法:当模型被微调或受到攻击时,水印迅速消失。
  • Cert-LAS:水印几乎经受住了所有考验。即使模型被大幅修改,“猫即狗”信号仍然足够强,足以证明所有权。
  • 质量:由带水印的模型生成的图片看起来依然很棒;水印没有破坏艺术效果。

总结

Cert-LAS 是一种保护 AI 艺术生成器的新方法。它不使用脆弱且容易识别的秘密代码,而是利用一种智能的、经过数学证明的盾牌,将所有权信号隐藏在模型的自然行为中。它保证,除非窃贼完全破坏了模型的功能,否则他们无法移除证明模型属于原始创作者的证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →