← 最新论文
💻 computer science

MirrorMark: A Distortion-Free Multi-Bit Watermark for Large Language Models

MirrorMark 是一种用于大型语言模型的新型多比特水印技术,它在嵌入鲁棒且可检测的消息时不会扭曲令牌概率分布,从而在保持文本质量的同时,在准确性和检测率方面显著优于现有方法。

原作者: Ya Jiang, Massieh Kordi Boroujeny, Surender Suresh Kumar, Kai Zeng

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ya Jiang, Massieh Kordi Boroujeny, Surender Suresh Kumar, Kai Zeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位面包师,刚刚发明了一种完美无缺的新面包配方。你希望确保,如果有人用他们自己的名字售卖你的面包,你能证明那是你的。但这里有个难题:你不能直接在面包上盖一个巨大的“我的”印章,因为那会破坏外观和口感;你也不能只在面团里低语一个秘密代码,因为如果有人切下一片或掉下一粒碎屑,低语就会消失。

这就是MirrorMark为大型语言模型(LLMs)——即那些为我们撰写文本的人工智能系统——所解决的问题。

以下是 MirrorMark 的工作原理,分解为简单的概念:

1. 当前“水印”方法的问题

可以将当前的水印方法想象成两种有缺陷的印章:

  • “失真”印章:一些方法试图稍微修改配方以隐藏秘密。例如,它们可能强制 AI 选择与其通常不同的词语。这就像在面包里添加一种奇怪的香料来做标记。虽然有效,但面包的味道变了(文本质量下降)。
  • “脆弱”印章:其他方法试图在不改变味道的情况下隐藏秘密。但它们就像在拥挤房间里低语。如果有人编辑了文本(添加句子、删除单词或改写),低语就会消失,你再也无法证明面包是你的了。

2. MirrorMark 解决方案:“完美反射”

MirrorMark 是一种隐藏秘密消息的新方法,它既无失真(不改变面包的味道)又鲁棒(能经受住编辑)。

它使用了一个巧妙的技巧,称为模 1 镜像(Mod-1 Mirroring)

  • 类比:想象 AI 根据一个落在 0 到 1 之间的骰子点数来选择单词。
  • 技巧:MirrorMark 不改变骰子的点数,而是根据它想要发送的秘密消息,将该数字“折叠”过一条特定的线(镜子)。
  • 神奇之处:如果你完美地折叠一张纸,纸的形状不会改变,只是从另一侧看时样子不同。同样,MirrorMark 重新排列 AI 使用的随机数,但这些数字的整体模式保持完全一致。
  • 结果:AI 生成的文本听起来 100% 自然且高质量,就像没有水印时一样。但在具体的词语选择中隐藏着一个多位代码(如数字指纹),稍后可被恢复。

3. “上下文锚定平衡调度器”(CABS)

即使拥有完美的镜子,也存在风险:如果有人切掉了一大块文本怎么办?如果秘密消息均匀分布,切掉一块可能会删除整个消息。

MirrorMark 引入了一位智能管理者,称为CABS(上下文锚定平衡调度器)

  • 类比:想象你在将 100 张微小的纸条藏在一本长书中。如果你把它们都藏在第一章,而有人撕掉了那一章,你就会失去一切。如果你随机隐藏,纸条可能会聚集在一起,导致其他页面空白。
  • CABS 如何工作:CABS 就像一位细心的图书管理员。它查看正在撰写的文本,并确保秘密纸条在整个书中均匀分布
  • 安全网:它还创建了“框架”或章节。如果有人撕掉了一页,CABS 确保损害仅限于该框架。书的其余部分保持同步,因此隐藏的消息仍可从剩余的纸条中拼凑出来。这使得水印极难通过复制粘贴或删除攻击来破坏。

4. 实验结果

研究人员使用 LLaMA-2 等 AI 模型,将 MirrorMark 与其他顶级方法进行了测试。

  • 质量:MirrorMark 生成的文本与正常 AI 文本无法区分。它听起来既不机械也不怪异。
  • 检测:检测 MirrorMark 比检测其他方法容易得多。即使只有少量文本(300 个单词),它也能以高精度识别出水印内容。
  • 鲁棒性:当攻击者试图通过删除单词、添加新词或复制粘贴文本部分来“破坏”水印时,MirrorMark 的生存能力远胜于竞争对手。
  • 容量:它可以隐藏大量信息(多位),而不仅仅是简单的“是/否”信号。这意味着它可以携带诸如“谁制作的?”或“何时制作的?”等详细信息。

总结

MirrorMark 就像一枚幽灵签名。它不会在文本上留下可见的标记,不会改变词语的味道,也不会因为撕掉书页而破碎。它利用数学上的“镜子”,将复杂的代码隐藏在 AI 思维的自然随机性中,确保 AI 的输出在保持高质量的同时,仍可追溯回其来源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →