← 最新论文
🤖 machine learning

Watermark Forensics for Generative Models: An Information-Theoretic Perspective

本文为生成式模型水印建立了一个基础的信息论框架,证明了统计意义上无失真的多用户归属与载荷提取所需的样本长度,与秘密熵除以源熵率之比成正比,同时揭示了检测、归属与定位之间内在的权衡关系。

原作者: Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座神奇的喷泉,它会吐出故事、图片或歌曲。接着,想象喷泉的主人想知道:“这是人类写的,还是机器写的?”更进一步,他们想知道:“是哪位特定的用户让机器写下这段内容的?”以及“我们能否找到人类藏在其中的隐藏秘密信息?”

这篇论文将这些问题视为一个取证阶梯(forensic ladder)。你可以一步步向上攀爬,但这里有一个转折:每往上一级台阶,成本都会增加更多的“Token”(即文本或图像的微小构建块)。你想爬得越高,故事就需要越长。

魔法账本:“信息轮廓”(Information Profile)

作者发现,所有这些取证问题实际上都是在阅读一张名为**信息轮廓(Information Profile)**的单一、隐形的地图。

把秘密(比如用户的名字或隐藏信息)想象成一个沉重的背包。而“信息轮廓”就是一张显示这个背包在故事中具体放置位置的地图。

  • 质量(The Mass): 背包里有多少东西?(这决定了**归属识别(Attribution)提取(Extraction)**的成本)。
  • 形状(The Shape): 背包坐在哪里?它是散布在整个故事中,还是只隐藏在少数几个点上?(这决定了**定位(Localization)**的成本)。

论文指出,你无法欺骗数学。机器在创作瞬间实际放入故事中的信息量,是你拥有的唯一货币。你不能消费超过你存入的金额。

问题的阶梯

第 0 级:检测(它是 AI 吗?)

  • 问题: “这个故事是机器制造的吗?”
  • 成本: 这是最便宜的一级。它只需要极小的“失真”(使故事与自然语言略有不同)。
  • 陷阱: 仅仅能检测出它是 AI,并不意味着你知道是谁制造的。论文证明存在一个“盲区”窗口:一个故事可以大声疾呼“我是 AI!”,但仍然太短,以至于无法低声耳语“我是由用户 #42 制造的”。

第 1 级:归属识别(谁制造了它?)

  • 问题: “它是哪 NN 个用户中的哪一个生成的?”
  • 成本: 这增加得非常快。要从 NN 个用户中识别出一个用户,故事的长度大约需要为 logN\log N 个 Token。
  • 惊喜: 论文发现了一个人们通常计数方式中的“陷阱”。如果你只是寻找与文本完美匹配的密钥,你可能需要比实际所需多出 1.6 倍的 Token(具体来说,是源熵率 hh 与 Rényi-2 率 r2r_2 的比例)。作者展示了一种更聪明的计数方法,可以节省掉这额外的 60% 的成本。

第 2 级:提取(秘密是什么?)

  • 问题: “隐藏的信息是什么?”
  • 成本: 与归属识别类似。如果你想隐藏 \ell 比特的信息,你需要足够长的故事来承载这个重量。

第 3 级:定位(标记在哪里?)

  • 问题: “故事的哪个特定部分持有秘密?”
  • 成本: 这是最难的部分。论文证明了一个严格的规则:你无法拥有一个在裁剪后依然存在的微小隐藏标记。
  • 类比: 想象试图把一个秘密藏在沙滩上的一粒沙子里。如果有人切走了一块沙滩(裁剪),他们可能会带走你的那粒沙子,而留下其余部分。为了在任何切割下都能生存,你的秘密必须遍布整个沙滩。如果你想精准定位标记的位置,标记就必须无处不在。你无法同时拥有“微小的足迹”和“精细的分辨率”。

两种类型的水印

论文将水印分为两个阵营,它们就像两种不同的背负背包的方式:

  1. “偏置型”水印(薄层分布 - The Biasing Watermark):

    • 运作方式: 它向故事中的每一个 Token 注入一个微小的秘密。它在到处都很微妙。
    • 成本: 因为秘密非常稀薄,你需要一个非常长的故事才能清晰地听到它,从而识别出用户。其成本取决于你允许多少文本失真。
    • 现实案例: 目前大多数文本水印(如“绿名单”法)都属于此类。它们无处不在,但需要长文本才能进行归属识别。
  2. “嵌入型”水印(响亮的印记 - The Embedding Watermark):

    • 运作方式: 它在少数特定位置大声喊出秘密(例如在前几个词中)。
    • 成本: 这很便宜!你可以通过很短的文本来识别用户,因为秘密既响亮又清晰。
    • 陷阱: 它很脆弱。如果有人编辑文本或裁剪图像,秘密就会消失。
    • 现实案例: 论文发现,几乎没有现实世界的水印能有效地使用这种“小足迹”技巧。大多数“嵌入型”水印(如用于图像的水印)实际上会将秘密扩散到整个图像中以抵御编辑,这使得它们在本质上变成了“偏置型”。

论文排除了什么

  • “万能药”: 论文明确表示,你无法同时拥有一个微小(小足迹)、无感(零失真)且能抵御编辑(裁剪鲁棒性)的万能水印。数学上是不可能的。如果你想在编辑后生存,你的标记必须很大。
  • “免费午餐”: 你无法免费获得归属识别(识别用户)。它消耗的 Token 总是比简单的检测更多。存在一个保证存在的差距,即一段文本可以被检测为 AI,但却无法归属于特定的人。

他们的结论有多可靠?

作者对数学部分非常有信心。他们使用严格的信息论证明了这些阶梯成本(就像证明物理定律一样)。

  • 已证明: 检测、归属识别以及“足迹与定位之间的不确定性原理”的成本在数学上是得到证明的。
  • 已模拟: 他们在真实的 AI 模型(GPT-2, Pythia, Qwen2.5)上测试了这些理论,发现数据完全吻合。例如,他们证实了语言模型中存在的“1.6 倍超额收费”陷阱。
  • 开放性问题: 他们承认,虽然他们证明了针对“完美对齐”文本的数学逻辑,但尚未完全解决当文本被“编辑”(例如有人删除了一个句子)时的情况。这部分仍是一个他们正在研究的谜团。

核心结论

水印不是可以随处粘贴的魔法贴纸。它们是一种权衡。

  • 想知道是否是 AI?容易,短文本即可。
  • 想知道是谁制造的?你需要更长的文本。
  • 想知道标记在哪里?你需要让标记遍布全身,否则一旦文本被剪裁,它就会消失。

这篇论文为这些秘密列出了精确的“价目表”,表明在 AI 的世界里,你无法在不支付“Token 税”的情况下拥有一切。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →