PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints
本文提出了名为 PMark 的语义级水印方法,通过引入代理函数(PF)理论框架和动态中位数估计,在确保生成文本分布无畸变的同时,显著提升了大型语言模型生成内容对改写攻击的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章介绍了一种名为 PMARK 的新方法,旨在给大语言模型(LLM)生成的文本打上“隐形水印”。
为了让你更容易理解,我们可以把大语言模型想象成一位才华横溢但有点健忘的作家,而“水印”就是作者为了证明“这文章是我写的”而偷偷留下的签名。
1. 以前的方法有什么麻烦?
在 PMARK 出现之前,给 AI 写的水印主要有两种“流派”,但都有大毛病:
- 流派一:单词级水印(Token-level)
- 比喻:就像作家在写每一个字时,都偷偷把“的”字换成“之”字,或者把“好”字换成“棒”字,以此作为暗号。
- 缺点:太脆弱了。如果有人(攻击者)把文章重新改写一遍(比如把“之”换回“的”,或者换个说法),这些藏在单词里的暗号就全没了。这就好比有人把画上的签名擦掉重画,你就认不出来了。
- 流派二:句子级水印(Semantic-level,如 SemStamp)
- 比喻:这次作家不再管单个字,而是管整句话。他规定:“我写的句子,意思必须像‘在蓝色的天空下’,不能像‘在灰色的屋顶上’"。
- 缺点:虽然抗改写能力强了,但味道变了。为了强行让句子符合“蓝色天空”这个规定,作家不得不放弃很多原本自然、优美的句子,导致写出来的文章读起来很生硬、不自然(这就叫“失真”)。而且,如果作家试了很多遍都写不出符合规定的句子,他就卡住了(采样失败)。
2. PMARK 是怎么做的?(核心创意)
PMARK 提出了一种既不失真、又抗改写的新方法。我们可以把它想象成一种**“多维度的罗盘”**。
核心概念:代理函数(Proxy Function)
想象作家面前有一个巨大的**“句子宇宙”。PMARK 给这个宇宙装上了一个“罗盘”**(这就是代理函数)。
- 这个罗盘不关心句子的具体意思,而是把句子变成一个数字(比如 0.5 或 -0.3)。
- 这个罗盘是随机生成的,只有作者(拥有密钥的人)知道罗盘的指向。
方法一:在线版(Online PMARK)—— “动态筛选”
- 多写几遍:当作家要写下一句话时,PMARK 先让 AI 快速生成64 个不同的候选句子(就像让作家先打 64 个草稿)。
- 罗盘测量:用那个“罗盘”去测这 64 个草稿,给每个草稿打分。
- 中位数分割:PMARK 不看最高分,而是看中间分(中位数)。
- 比如,64 个分数的中位数是 0。
- 如果密钥说“选上半区”,作家就从分数大于 0 的那 32 个句子里随机挑一个。
- 如果密钥说“选下半区”,就从分数小于 0 的那 32 个句子里挑一个。
- 多罗盘叠加(多通道):这是 PMARK 的绝招!它不只用一个罗盘,而是用了4 个互相垂直的罗盘(就像 X、Y、Z、W 四个方向)。
- 只有同时满足这 4 个罗盘特定方向的句子,才会被选中。
- 比喻:就像你要进一个密室,必须同时解开 4 把不同方向的锁。虽然筛选变严了,但因为是从 64 个里挑,而且每个方向都是随机的,选出来的句子依然是自然、高质量的,不会像以前那样为了凑数而牺牲质量。
方法二:离线版(Offline PMARK)—— “预设规则”
为了省资源(不用每次都生成 64 个草稿),PMARK 还有一个“离线版”。
- 它发现,在数学上,这些随机罗盘的中位数通常非常接近0。
- 所以,它直接假设中位数就是 0。
- 规则:只要句子的分数大于 0,就保留;小于 0,就丢弃。
- 这样就不需要动态计算中位数了,速度更快,而且实验证明,这种“偷懒”几乎不影响句子的自然度。
3. 为什么 PMARK 这么厉害?
- 像水一样自然(无失真):
以前的方法像“强行把水倒进方盒子里”,水会溅出来(失真)。PMARK 像“在河流中自然分流”,水流(句子分布)完全保持原样,只是我们偷偷标记了哪部分水流属于我们。 - 像防弹衣一样坚固(抗攻击):
因为用了4 个罗盘(多通道),即使攻击者把句子改写了一下,导致它在第一个罗盘下“跑偏”了,它很可能在另外三个罗盘下依然保持“正确”。- 比喻:以前的水印像一张薄纸,撕一下就破。PMARK 的水印像一张4 层编织的网,剪断一根线,网还是完整的。
- 效率高:
以前的句子级水印方法可能需要生成几千个句子才能挑出一个合格的(太慢了)。PMARK 只需要生成几十个,就能挑出一个既合格又自然的。
4. 实验结果说了什么?
作者做了很多测试,把 PMARK 和现有的所有方法(包括最厉害的竞争对手)PK:
- 质量:PMARK 生成的文章,读起来和没加水印的 AI 文章一模一样,甚至更好(困惑度 PPL 更低)。
- 抗揍能力:当用 GPT 等工具把文章改写、翻译再翻回来、或者删掉一些词时,PMARK 依然能90% 以上的概率被检测出来,而其他方法要么检测不出,要么误报。
- 效率:它消耗的计算资源比以前的方法少得多,更适合实际应用。
总结
PMARK 就像给 AI 生成的文章装上了一套“隐形且坚固的防伪标签”。
它不再通过“强行修改内容”来打标签,而是通过“巧妙地从自然生成的选项中挑选”来打标签。它利用多个维度的随机罗盘,让水印像空气一样无处不在却又难以察觉,即使文章被大改特改,这个“空气指纹”依然能证明:这篇文章,确实是 AI 写的。
这对于保护版权、识别 AI 生成内容(比如防止 AI 写假新闻、抄袭论文)具有非常重要的意义。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。