← 最新论文
💬 NLP

TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection

TextSeal 是一种最先进的无失真大语言模型水印方案,它通过双密钥生成和多区域定位,确保稳健的溯源检测与蒸馏保护,同时保持输出质量并支持服务优化,且无需推理开销。

原作者: Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre
发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre Fernandez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位面包师,每天制作成千上万条美味的面包。你想知道杂货店里的一条面包是否由你烘焙,还是有人复制了你的配方并自行烘焙。但这里有个难题:你不能直接在面包上盖个“由面包师汤姆制作”的印章,因为那会破坏面包的口感和质地。你需要一种秘密成分,人类舌头无法察觉,但能为你的专用扫描仪留下独特且可检测的指纹。

这正是TextSeal为大型语言模型(AI)所解决的问题。它是一种新型的高科技“隐形水印”,能在不改变文本听起来或看起来如何的情况下,证明某段文本的作者是谁。

以下是 TextSeal 的工作原理,分解为简单的概念:

1. 秘密成分(双密钥生成)

旧式水印就像一枚印章,总是在相同的位置留下相同的标记。如果你两次向 AI 提出相同的问题,它会两次给出完全相同的答案。这对用户来说很无聊,甚至可能导致 AI 陷入重复循环(就像一首歌无限循环播放)。

TextSeal 的解决方案: 它使用两个秘密密钥而不是一个。每次 AI 选择一个词时,它会抛一枚硬币来决定使用哪个密钥。

  • 类比: 想象你有两种不同的秘密香料。有时你撒香料 A,有时撒香料 B。对食客而言,面包的味道完全一样(无失真),但对你的扫描仪而言,香料的排列模式会形成独特且多变的指纹,证明它出自你手。这既保持了 AI 回答的新鲜感和多样性,又使其可追溯。

2. 智能扫描仪(熵加权检测)

检测水印之所以困难,是因为 AI 有时会写出非常可预测的内容(低“熵”),有时则会写出非常富有创意、不可预测的内容(高“熵”)。

  • 问题: 如果 AI 有 99% 的把握下一个词是“的”,在那里添加水印就像试图在飓风中隐藏耳语。很难被听见。但如果 AI 在多个词之间犹豫不决,水印信号就会强得多。
  • TextSeal 的解决方案: 它使用一种“智能扫描仪”,知道要格外关注 AI 不确定的文本部分(高熵部分)。它忽略那些无聊、可预测的部分,专注于水印信号最强的创意部分。这使得即使在长文档中,检测也变得更加准确。

3. 大海捞针(局部检测)

想象有人取走你写的一段话,将其混入一篇由人类撰写的 50 页论文中,并声称整篇论文都是他们的。旧式水印会查看整篇论文,被所有人类写作内容搞糊涂,然后说:“我找不到水印。”

TextSeal 的解决方案: 它不只是查看整篇文档;它会扫描特定区域

  • 类比: 与其试图在沙滩上找到一粒沙子,TextSeal 寻找的是具有独特颜色的小块特定沙地。即使 AI 生成的文本仅占庞大文档的 5%,TextSeal 也能隔离这 5%,忽略其余部分,并说:“啊哈!这段特定的段落绝对是 AI 生成的。”即使 AI 生成的文本被切碎并散布在整个文档中,这种方法依然有效。

4. “放射性”效应(蒸馏保护)

这可能是最强大的功能。如果竞争对手试图通过用你带有水印的输出训练他们自己的模型来窃取你的 AI“大脑”,水印不仅会留在文本中,还会被学习到。

  • 类比: 想象你的秘密香料如此 potent,以至于如果竞争对手试图用你旧的面包作为参考来烘焙新面包,他们的新面包仍然会带有你香料的微弱痕迹,即使他们从未见过你的秘密配方。
  • 主张: 论文表明,如果一个学生模型是用 TextSeal 水印数据训练的,该学生模型就会变得“具有放射性”。你可以测试该学生模型,它仍会显示出水印信号,证明它是用你的数据训练的。这阻止了竞争对手秘密复制你模型的知识点。

为什么这很重要?

  • 它是隐形的: 论文让人类阅读了数千个示例进行测试。他们无法区分带有水印和未带水印的文本。它没有让 AI 听起来像机器人,也没有导致错误。
  • 它很快: 它几乎不增加 AI 的思考时间,因此可用于实时应用程序。
  • 它很强大: 即使在文本被严重稀释或与人类写作混合的情况下,它在检测水印方面也胜过之前的方法(如 Google 的 SynthID)。

简而言之,TextSeal 是一种用隐形、不可破坏的墨水签署 AI 作品的方法,这种墨水能经受住复制、混合,甚至被其他模型“学习”,同时完全不损害文本质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →