← 最新论文
💬 NLP

Majority Bit-Aware Watermarking For Large Language Models

本文介绍了“多数位感知水印”,这是一种新颖的编码范式,包含两种实现形式(MajorMark 和 MajorMark+^{+}),它通过在即使使用大型绿色列表时也能保留强水印信号,从而解决了大语言模型水印中文本质量与解码准确性之间的权衡问题。

原作者: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象大型语言模型(LLMs)如同技艺超群的厨师,能烹制出你要求的几乎任何菜肴(文本)。问题在于,有时不良行为者会利用这些厨师烹制“投毒”餐食——假新闻、诈骗或有害内容。为了揪出他们,我们需要一种方法给食物打上标签,以便确切知道是哪位厨师制作的。这个标签被称为水印

然而,这里有个陷阱。过去,给文本添加水印就像在一张精致的纸上盖上一个沉重、笨拙的印章。印章越显眼(以便日后容易查找),就越会破坏纸张的质感(即写作质量)。如果印章太小以免破坏纸张,它就太模糊而无法被识别。

本文介绍了一种名为MajorMarkMajorMark+的新文本水印方法。它利用涉及多数规则分片的巧妙技巧,解决了“质量与可检测性”之间的矛盾。

以下是其工作原理,分解为简单概念:

1. 旧方法:“小绿列表”问题

将 AI 的词汇表(它能使用的所有单词)想象成一个装满弹珠的巨大袋子。

  • 旧方法:为了隐藏秘密消息,AI 被迫仅从一小撮“绿色”弹珠(可能仅占袋子的 25%)中选择下一个词。它忽略了其余部分。
  • 权衡:如果绿色列表太小,AI 就被迫为了符合规则而选择奇怪、不自然的单词,导致故事听起来像机器人写的。如果绿色列表很大(以保持故事自然),秘密消息就会变得极其微弱,以至于日后无法被发现。

2. 新想法:“多数位”策略

作者意识到,他们不需要将 AI 限制在一个极小的列表中。相反,他们使用了一种投票系统。

想象秘密消息是一长串 0 和 1(例如 110111)。

  • 技巧:系统查看消息并询问:“哪个数字出现得更频繁?”在 110111 中,数字 1 是“多数位”。
  • 绿色列表:AI 不再被限制在极小的列表中,而是被允许从任何对应消息中"1"的单词中进行选择。由于"1"是多数,这个绿色列表非常巨大(至少占所有单词的 50%!)。
  • 结果:因为 AI 有大量听起来自然的单词可供选择,文本听起来完美无缺。但由于 AI 仍然略微被推向"1"类单词,秘密消息依然存在,只是隐藏在所选单词的统计模式中。

3. MajorMark:“集群侦探”

MajorMark 使用这种多数策略。

  • 编码:AI 撰写文本,略微将其推向与秘密消息的多数位相匹配的单词。
  • 解码:为了重新读取消息,侦探(解码器)查看文本并统计来自不同“组”(分片)的单词出现了多少次。
  • 类比:想象单词被分类到两个桶中。如果秘密消息是"1",那么"1"桶中的弹珠数量会比"0"桶略多。解码器使用简单的聚类工具(就像按颜色给弹珠分类)来查看哪个桶更重。如果一个桶明显更重,它就知道秘密消息是"1"。

4. MajorMark+:“逐块”升级

如果秘密消息超级长怎么办?“多数位”可能不那么明显,导致信号变弱。

  • 解决方案MajorMark+ 将长消息切分成更小的(就像把长绳子切成短段)。
  • 工作原理:它对每个小块独立应用“多数位”规则。
  • 优势:这确保了每个块的“绿色列表”都很大,从而保证即使对于非常长的消息,文本也能保持高质量。它还使用更精确的“计数”方法来查找消息,使其更难被遗漏。

为什么这很重要(根据论文)

作者在顶级 AI 模型上测试了这种方法,发现:

  1. 更好的质量:由于 AI 不必被迫从极小、受限的列表中选择,水印文本听起来比以前的方法更自然(“困惑度”更低)。
  2. 更好的检测:尽管文本听起来自然,但秘密消息实际上比旧方法更容易被发现并准确解码。
  3. 鲁棒性:即使有人试图编辑文本(例如剪切粘贴部分或改写句子),水印通常也能幸存,因为多数位的统计“重量”仍然可被检测。

总结:本文提出了一种标记 AI 文本的新方法,阻止了 AI 不得不在“听起来像人类”和“可追踪”之间做出选择。通过使用“多数投票”系统来选择哪些单词获得微小提升,他们允许 AI 自然地写作,同时仍然嵌入强大且可恢复的秘密消息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →