← 最新论文
🤖 AI

Vaporizer: Breaking Watermarking Schemes for Large Language Model Outputs

本文表明,最先进的语言模型水印方案可被多种保持语义的文本修改攻击有效破解,揭示了当前系统的关键漏洞,并凸显了设计更健壮安全机制的必要性。

原作者: Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam Chattopadhyay

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam Chattopadhyay

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一枚魔法印章,它能在计算机写下的每一句话上留下一个看不见的标记。这个“水印”本应证明故事并非人类所写,而是由机器人创作的。这些印章的创造者声称它们坚不可摧,就像一种无法在不破坏故事本身的情况下被抹去的秘密代码。

这篇论文就像一群安全专家试图破解这些印章。他们提出了一个简单的问题:“我们能否在不把纸搓破的情况下洗掉这看不见的墨水?”

以下是他们的发现,通过日常类比进行解释:

三种“隐形印章”类型

研究人员测试了公司试图为 AI 文本添加水印的三种不同方法:

  1. “绿灯”系统(可证明的鲁棒性):想象一个交通信号灯,它微妙地引导 AI 比选择“红色”词汇更频繁地选择“绿色”词汇。这是一种统计技巧。论文声称这是最难破解的,但即使是这一种也并非坚不可摧。
  2. “秘密握手”系统(SynthID):这就像一场游戏,AI 根据秘密评分规则选择词汇。如果词汇符合秘密模式,它就带有水印。研究人员发现这种系统具有中等程度的脆弱性。
  3. “数字签名”系统(公开可检测):这试图将加密代码直接隐藏到文本中,就像隐藏的条形码。研究人员发现这已被完全破解。他们尝试的每一次攻击都瞬间抹去了这个签名。

“清洗”方法(攻击手段)

团队不仅使用了海绵,还使用了三种不同的“洗衣”技术来尝试去除标记:

  • 同义词替换(词汇变更):就像将“快乐”换成“喜悦”,或将“大”换成“巨大”。他们发现这是最弱的方法。它几乎未触及水印,而且往往使文本听起来别扭或充满语法错误。
  • 翻译循环:想象将一句话从英语翻译成法语,再翻译回英语。这就像让一条消息玩“传话”游戏。这去除了一些水印,但通常使文本听起来生硬,或略微改变了含义。
  • "AI 重写器”(神经改写):这是核选项。他们使用超级智能的 AI(如 Pegasus)来重写文本。这就像聘请一位专业编辑,在保持完全相同含义的同时,彻底重述你的故事。
    • 结果:这是最有效的武器。在许多情况下,它成功擦除了“绿灯”和“秘密握手”印章,并且 100% 地抹去了“数字签名”。

关键所在:“质量与安全”的权衡

这是故事中最重要的一部分:你无法鱼与熊掌兼得。

论文发现了一条明确的规则:要打破水印,你通常必须损害文本。

  • 如果你试图过于激进地去除印章,文本就会充满语法错误、难以阅读,或失去其原始含义。
  • 然而,"AI 重写器”(Pegasus)是这位大盗。它成功去除了水印,同时保持了文本看起来基本正常。它在“破解代码”而不“毁掉纸张”之间取得了最佳平衡。

主要结论

研究人员得出结论,目前的“隐形印章”是脆弱的。

  • “数字签名”印章已经毫无用处;轻微的触碰就会使其破裂。
  • “绿灯”和“秘密握手”印章更强,但智能的 AI 重写器仍然可以将它们剥离。

核心要点:
论文认为,我们不能依赖这些当前的水印来证明文本是否由 AI 生成。这些“锁”太容易被撬开了。为了解决这个问题,作者建议我们停止将标记隐藏在词汇本身(如墨水的颜色)中,而是开始将其隐藏在故事的深层含义中,这在不破坏故事本身的情况下要难得多。

在那之前,如果有人试图通过重写来掩盖某物是由 AI 创作的事实,当前的技术无法可靠地阻止他们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →