✨ 要点🔬 技术摘要
想象你是一位艺术家,花费数年和巨额财富训练了一个魔法机器人,让它根据你的特定风格绘制图片。你称这个机器人为“文本到图像扩散模型”。现在,想象有人偷走了你的机器人,对其稍作修改,并声称它是他们的。你如何证明它实际上属于你?
这就是论文 Cert-LAS 试图解决的问题。
问题:脆弱的“秘密握手”
目前,许多人试图使用“后门”方法来保护他们的 AI 模型。这就像一种秘密握手。你训练你的机器人,使其在听到你低声说出一个特定的、奇怪的短语(即“触发器”)时,生成一张带有隐藏标记的图片。如果其他人拥有你的机器人,你低声说出该短语,若标记出现,你就知道它属于你。
论文指出,这种旧方法存在两个重大缺陷:
太明显 :奇怪的短语或隐藏标记就像一块霓虹灯牌,上面写着“我是秘密!”窃贼很容易发现并移除它。
太脆弱 :如果窃贼意外地碰撞了机器人(随机更改),或故意试图破坏秘密握手(对抗性攻击),标记就会消失,你再也无法证明所有权。
作者认为,现有方法假设窃贼会遵守规则,不会触碰机器人的“大脑”。但在现实世界中,窃贼会 试图打破封印。
解决方案:Cert-LAS(“层自适应”盾牌)
作者提出了一种名为 Cert-LAS 的新方法。与其使用脆弱的秘密握手,他们构建了一个经过数学证明能够抵御攻击的“认证”盾牌。
以下是其工作原理,使用简单的类比说明:
1. “层自适应”噪声(定制的毯子)
想象你的 AI 机器人是一个多层蛋糕。有些层是“糖霜”(对变化非常敏感),有些层是“海绵”(非常坚固)。
旧方法 将整个蛋糕同等对待,均匀地摇晃它。
Cert-LAS 很聪明。它首先检查蛋糕的哪些层是“摇晃的”(对微调敏感)。然后,它用额外的厚保护毯(噪声)包裹这些摇晃的层,同时让坚固的层只覆盖较薄的毯子。
为什么? 通过集中保护薄弱环节,整个蛋糕变得更难被破坏。这被称为 层自适应平滑 。
2. “无触发器”水印(隐形墨水)
Cert-LAS 不使用窃贼可以找到的奇怪秘密短语(触发器),而是使用一种称为 扩散分类器 的技巧。
想象你训练你的机器人画一张 猫 的图片。
通常,机器人会画出一只猫。
使用 Cert-LAS,你训练机器人,使其在收到“猫”的指令时,秘密地画出一张看起来像猫、但被你的秘密解码器在数学上“分类”为 狗 的图片。
神奇之处 :对窃贼来说,这张图片看起来就是一只完美的猫。没有奇怪的词语或隐藏的像素。但是,当你通过秘密解码器运行它时,它会大喊“狗!”,从而证明模型属于你。由于没有“触发器”可供查找,窃贼无法审计并移除它。
3. “认证”保证(数学承诺)
最重要的部分是 认证 这个词。
作者不仅仅是测试了它并希望它有效,而是运用复杂的数学证明了一个“安全半径”。
他们证明,只要窃贼对机器人“大脑”的修改不超过某个特定量(特定的数学限制),你的秘密“猫即狗”信号 就无法被移除 。
这就像说:“我可以从数学上保证,如果你用一把小于 5 磅的锤子试图打破我的锁,锁就不会打开。”
他们如何测试
研究人员针对以下情况测试了 Cert-LAS:
意外损坏 :例如在新数据上微调模型(例如,教它画卡通)。
故意攻击 :窃贼试图使用高级黑客技术专门擦除水印。
结果 :
旧方法 :当模型被微调或受到攻击时,水印迅速消失。
Cert-LAS :水印几乎经受住了所有考验。即使模型被大幅修改,“猫即狗”信号仍然足够强,足以证明所有权。
质量 :由带水印的模型生成的图片看起来依然很棒;水印没有破坏艺术效果。
总结
Cert-LAS 是一种保护 AI 艺术生成器的新方法。它不使用脆弱且容易识别的秘密代码,而是利用一种智能的、经过数学证明的盾牌,将所有权信号隐藏在模型的自然行为中。它保证,除非窃贼完全破坏了模型的功能,否则他们无法移除证明模型属于原始创作者的证据。
技术摘要:Cert-LAS
问题陈述
大规模文本到图像(T2I)扩散模型是重要的知识产权资产,但它们容易受到未经授权的复制、重新分发和滥用。模型所有权验证(MOV)对于保护这些资产至关重要。现有的 T2I 扩散模型 MOV 方法主要依赖于基于后门的水印技术,即嵌入私有触发器(例如稀有 token)以激活特定的水印行为。
作者指出了当前方法存在的两个根本性局限:
审计下的脆弱性 :现有方法通常隐含地假设存在一个“可信”的验证过程,即验证者可以查询模型并获得稳定的水印响应。然而,在对抗性设置中,触发器可能被检测并移除。实验表明,合成触发器通常在提示空间(通过上下文不协调性)或图像空间(通过相似度指标)中可被检测,从而损害了隐蔽性。
缺乏认证鲁棒性 :现有方法缺乏针对参数扰动的理论保证。实验表明,无意的随机扰动和精心设计的对抗性扰动都会显著降低验证可靠性。虽然通过随机平滑技术已在小规模分类器中实现了认证鲁棒性,但由于 T2I 扩散模型具有高维连续分数估计的特性,且在此规模下进行认证训练的计算成本过高,该技术尚未成功适配到 T2I 扩散模型中。
方法论:Cert-LAS
本文提出了Cert-LAS (认证层自适应平滑),这是首个针对 T2I 扩散模型的认证 MOV 方法。该方法分为两个阶段运行:
1. 水印嵌入(无触发器)
Cert-LAS 不使用显式触发器,而是通过训练扩散生成器,使其在私有扩散分类器下产生误分类来嵌入水印。
扩散分类器作为水印载体 :该方法利用扩散模型可作为生成式分类器的发现。使用一个冻结的私有扩散分类器来定义目标后验分布。生成器被训练为生成被该私有分类器误分类的图像(例如,生成被分类器识别为“狗”的“猫”图像),同时通过感知一致性正则化器(MS-SSIM)保持与原始生成的感知保真度。
层自适应平滑 :为了实现认证鲁棒性,该方法在训练过程中向模型参数注入噪声。关键在于,它采用层自适应噪声 而非均匀噪声。
层微调敏感性(LFS) :作者基于微调期间参数更新的平均 L2 范数定义了一个 LFS 指标。他们观察到,某些 UNet 层(例如归一化和注意力块)在不同数据集上对微调始终更为敏感。
噪声分配 :噪声水平根据各层的 LFS 成比例分配。更多的噪声集中在“脆弱”层上以扩大可认证区域,而总噪声预算保持与均匀基线相当。
指数增长调度 :为了使鲁棒优化在计算上可行,采用了指数增长调度。这逐步增加了训练期间用于梯度平均的噪声样本数量,利用了早期训练梯度在不同噪声样本间相似的事实。
2. 所有权验证
通过检查可疑模型是否表现出比未加水印参考模型显著更强的水印响应来进行验证。
统计量 :在层自适应平滑下计算两个统计量:
水印鲁棒性(WR) :可疑模型的图像被私有扩散分类器分类为目标类的经验概率。
参考概率(RP) :未加水印的参考生成器的相同概率。
假设检验 :采用配对样本 t 检验。如果可疑模型的 WR 显著大于参考模型的 RP,则验证该可疑模型源自受保护模型。
认证保证 :作者推导出了 WR 的闭式阈值,并证明了 WR 与 RP 之间差距的下界。他们建立了一个认证半径 (R ∗ R^* R ∗ ),保证如果参数扰动保持在该半径内,所有权验证将成功。
主要贡献
重新审视局限 :本文揭示了现有的基于后门的水印方法存在提示/图像空间的可检测性,以及缺乏针对参数扰动的鲁棒性。
Cert-LAS 框架 :它引入了首个针对 T2I 扩散模型的认证水印方法,利用扩散分类器作为隐式、无触发器的载体,并引入了针对 UNet 架构定制的层自适应随机平滑。
理论分析 :该工作提供了建立鲁棒性保证的理论分析,包括闭式验证阈值以及在有界参数扰动下的认证半径。
实证验证 :广泛的实验验证了该方法的有效性,证明了其高保真度、隐蔽性以及对无意的(微调)和有意的(对抗性)移除攻击的抵抗力。
实验结果
作者在 Stable Diffusion v1.4 上评估了 Cert-LAS,对比基线包括 WatermarkDM 和 SleeperMark。
有效性与隐蔽性 :Cert-LAS 实现了 1.000 的验证成功率(VSR),以及在 10 − 6 10^{-6} 1 0 − 6 假阳性率下的真阳性率(T@10⁻⁶F)为 1.000。其隐蔽性得分(提示和图像空间中的可疑性)显著低于基于后门的方法(例如,<0.125 对比 WatermarkDM 的 >93%)。
对微调的鲁棒性 :在各种微调场景下(LoRA、DreamBooth、Custom Diffusion 以及在多样化数据集上的全量微调),Cert-LAS 保持 T@10⁻⁶F 高于 0.987,而基线方法在有限步数后通常降至 0.000。
对抗攻击的鲁棒性 :在 ℓ 2 \ell_2 ℓ 2 有界参数扰动下,即使预算达到 0.8,带有平滑的 Cert-LAS 仍保持 T@10⁻⁶F 高于 0.965,而所有基线方法完全失效。
泛化能力 :该方法展示了在不同架构(SDXL、Sana-1.6B)和分类任务(不同类别对、提示模板和多类设置)上的泛化能力。
效率 :与无调度的鲁棒训练基线相比,指数增长调度将训练时间减少了 76.6%。
意义与主张
本文声称,Cert-LAS 通过提供针对自适应攻击的可证明的鲁棒性保证 ,填补了保护 T2I 扩散模型的关键空白,而这一特性此前在扩散水印中是缺失的。通过从基于触发器的嵌入转向基于分类器的无触发器嵌入,并利用层自适应平滑,该方法在隐蔽性、生成保真度和认证可靠性之间取得了平衡。
作者将这项工作定位为迈向扩散模型可信共享 的一步。他们强调,该方法纯粹是防御性的,旨在供授权所有者和可信机构进行合法验证。通过确保水印无法在不降低模型效用(如压缩实验所示)的情况下被移除,该方法支持生成式 AI 生态系统中的可执行许可和问责机制。该工作并未声称解决所有知识产权问题,而是提供了一种特定的、有理论依据的工具,用于在存在有界恶意修改的情况下验证所有权。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。