PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks
本文介绍了 PASA,这是一种基于原理的水印算法,它在潜在嵌入空间内的语义层面嵌入和检测水印,从而在保持高文本质量的同时,实现对诸如改写等语义不变攻击的鲁棒性,并在检测准确性、鲁棒性和失真度之间达成最优权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一位极具天赋的机器人作家(即大型语言模型,LLM),它能撰写故事、邮件和文章,读起来几乎与人类所写毫无二致。问题在于,你如何判断一段文本是出自这位机器人还是真实人类之手?如果有人试图通过改写机器人的文本来使其看起来不同,从而欺骗系统,又该如何应对?
本文介绍了一种名为PASA的新方法来解决这一问题。你可以将其视为一种高科技的隐形水印系统,极难被洗去。
以下是其工作原理,借助一些简单的类比来说明:
1. 问题所在:“改写”窃贼
目前大多数水印系统就像是在单个单词上直接盖下秘密代码。
- 旧方法:想象机器人写道:“猫坐在垫子上。”水印隐藏在“猫”、“坐”和“垫子”这些具体词汇中。
- 攻击:一个恶意行为者(或一个巧妙的编辑工具)出现,将句子改写为:“这只猫科动物在毯子上休息。”
- 失败:由于具体词汇发生了变化,旧的水印检测器会感到困惑。它们再也找不到“猫”或“坐”了,因此认为文本是人类写的。水印因词汇的变化而被洗去。
2. 解决方案:PASA(“主题”追踪器)
PASA 改变了游戏规则。它不再将秘密隐藏在单词中,而是将其隐藏在含义中(即句子的“主题”或“氛围”)。
- 语义地图:想象机器人的大脑中有一张巨大的地图,所有单词都根据其含义而非外观进行分组。
- A 组:“猫”、“猫科动物”、“小猫”、“猫咪”。
- B 组:“坐”、“休息”、“闲坐”、“栖息”。
- C 组:“垫子”、“毯子”、“地毯”、“地板”。
- 秘密密钥:机器人与检测器共享一个秘密密钥(如同密码)。该密钥告诉它们下一个单词应从哪个“组”中选择。
- 流程:
- 机器人查看秘密密钥,决定:“好吧,对于下一个单词,我必须从A 组中选择。”
- 它选择了“猫科动物”(属于 A 组)。
- 检测器使用相同的秘密密钥,知道:“啊,下一个单词应该来自 A 组。”
- 检测器看到“猫科动物”,查阅地图,说道:“是的!这符合我们的秘密计划!”
3. 为何它如此稳健(“变形者”防御)
现在,让我们回到那个将“猫坐在垫子上”改写为“猫科动物在毯子上休息”的窃贼。
- 旧系统:“猫”消失了。“坐”消失了。“垫子”消失了。水印被破坏了。
- PASA 系统:
- “猫科动物”仍在A 组。
- “休息”仍在B 组。
- “毯子”仍在C 组。
- 尽管单词发生了变化,但组别(语义簇)保持完全一致。秘密计划被完美执行。检测器仍然看到这种模式,并知道:“这是由机器人撰写的。”
4. “无失真”的承诺
通常,当你试图强迫机器人遵循秘密规则时,它开始写出奇怪、不自然的句子(就像机器人试图像海盗一样说话)。这被称为“失真”。
PASA 之所以特殊,是因为它是无失真的。
- 类比:想象一位厨师被告知只能使用特定篮子里的食材。一个糟糕的系统可能会强迫厨师为了符合篮子而使用奇怪的食材,从而破坏味道。
- PASA 的诀窍:它使用了一种巧妙的两步采样方法。它根据秘密密钥选择正确的篮子(语义组),但随后选择食材(具体单词)的方式与厨师通常的做法完全一致。
- 结果:文本听起来 100% 自然且高质量,就像机器人正常的写作一样,但秘密模式依然存在。
5. 结果
该论文针对各种“攻击”测试了此方法,包括文本被改写、同义词被替换以及句子结构被打乱。
- 结果:PASA 依然保持强劲。即使文本被大幅改写(例如将“这部电影有一个有趣的剧情”改为“这部影片呈现了一个迷人的故事”),PASA 仍然能够检测出来。
- 对比:旧方法在这些改写面前惨败,而 PASA 则保持冷静,证明将水印隐藏在含义中比隐藏在拼写中要安全得多。
简而言之:PASA 是一种通过标记思想而非单词来为 AI 文本添加水印的方法。这意味着,即使有人试图改写文本以隐藏来源,秘密的“思想标签”对检测器而言依然可见,同时不会让文本听起来像机器人或不自然。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。