← 最新论文
💻 computer science

FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

本文提出了 FedOT,一种用于联邦潜在扩散模型(Latent Diffusion Models)的新颖框架,该框架通过采用分块水印方案和潜在向量转换(LVT)机制来防止通过替换解码器来移除水印,从而确保所有权验证并将模型泄露追溯至特定的恶意客户端。

原作者: Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群艺术家(即客户端)想要共同创作一件杰作,但绝不想向任何人展示他们私人的素描本。他们使用一种特殊的协作方法,称为联邦学习(Federated Learning),来训练一个强大的 AI 艺术家(一个潜在扩散模型,Latent Diffusion Model),以生成令人惊叹的图像。

然而,这里有一个问题:一旦这群艺术家完成了训练,最终的“大师级配方”(全局模型)就会共享给所有人。小组中可能会出现一个狡猾的艺术家,他可能会偷走这个配方,卖给陌生人,或者在未经许可的情况下利用它来赚钱。这个小组需要一种方法来证明:“这是我们的配方!”并且,如果它被偷了,还要能追问:“是谁偷的?”

这篇论文介绍了 FedOT,这是一个专门为解决这些 AI 艺术家在小组协作中遇到的两个问题而设计的全新安全系统。

FedOT 解决的两个大问题

1. “谁偷了它?”之谜
以往的方法只能说明:“是的,这张图像来自我们的小组,”但它们无法分辨究竟是哪位特定的成员泄露了模型。这就像发现了一辆被盗汽车,知道它属于某个特定的家庭,但不知道是哪个家庭成员把它开走的。FedOT 通过添加一个隐藏的“身份标签”解决了这个问题,该标签可以直接指向特定的窃贼。

2. “更换引擎”的诡计
想象一下,AI 模型就像一辆汽车,有两个主要部分:引擎(生成图像的部分)和变速器(将引擎动力转化为运动的部分)。

  • 旧方法: 以前的安全方法是在变速器上放置水印。但窃贼只需把这个带有水印的变速器拆下来,换成一个来自废料场、干净且通用的变速器即可。汽车依然能完美运行,而水印也随之消失。
  • FedOT 的方式: FedOT 改变了交通规则。它修改了变速器,使其只能与小组训练的特定引擎配合工作。如果窃贼试图将变速器更换为一个通用的变速器,汽车的引擎就会熄火,轮子也会掉落,导致车变成一堆无用的废铁。窃贼无法在不破坏模型的情况下窃取它。

FedOT 是如何工作的(类比说明)

FedOT 使用了两个主要的技巧来保护小组:

1. “拆分门票”(分块水印)

把水印想象成一张长长的、秘密的门票,分为两个部分:

  • 前半部分(所有权): 这部分对小组中的每个人都是相同的。它回答的问题是:“这个模型是否来自我们小组?”
  • 后半部分(追踪): 这部分对每个人都是唯一的。它回答的问题是:“究竟是哪位特定的成员泄露了它?”

当出现可疑图像时,系统首先检查前半部分。如果匹配小组,它接着会检查后半部分,以识别出具体的责任人。这使得整个过程既快速又高效。

2. “秘密语言”(潜在向量变换)

这是核心创新点。

  • 设置: 在小组开始训练之前,领导者(服务器)会教变速器(VAE)一种秘密的、略微扭曲的语言。这就像是教变速器说一种带有轻微口音的语言,或者教它以一种奇特且特定的方式来翻译单词。
  • 训练: 引擎(U-Net)学会了完美地使用这种新的、扭曲的语言。它们彼此之间变得非常默契。
  • 陷阱: 如果窃贼试图将变速器更换为一个标准的、“干净的”变速器,引擎就无法理解它了。引擎试图说它的秘密语言,但新的变速器会将这些语言翻译成乱码。结果会怎样?生成的图像会变得模糊、扭曲或完全错误。

研究人员测试了三种创建这种“扭曲语言”的方法:

  • 平移(Translation): 将语言稍微移动(就像带着浓重的口音说话)。
  • 镜像(Mirror): 将语言上下颠倒。
  • 负片(Negative): 反转语言的颜色(就像照片的底片)。

研究人员发现,**“负片”**方法效果最好。它在保持图像看起来良好的同时,使得如果不破坏质量就无法更换部件变得几乎不可能。

实验结果显示

作者针对各种攻击对 FedOT 进行了测试:

  • 更换攻击(The Swap Attack): 当窃贼试图用干净的部分替换带水印的部分时,图像质量崩溃,模型变得毫无用处。
  • 净化攻击(The Purification Attack): 当窃贼试图通过在干净数据上重新训练模型来“洗掉”水印时,质量仍然显著下降。
  • 追踪能力(The Trace): 即便面对这些攻击,如果模型得以幸存,FedOT 仍能以极高的准确率识别出所属小组及具体的泄露者。

核心结论

FedOT 是第一个既能证明所有权又能抓获特定窃贼的协作式 AI 项目系统。它通过将 AI 的各个部件紧密锁定在一起,使得如果有人试图通过更换部件来窃取模型,整个系统就会崩溃。它将模型窃取变成了一个“双输”的局面:窃贼要么被抓获,要么只能得到一个损坏的、毫无用处的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →