Covert Multi-bit LLM Watermarking: An Information Theory and Coding Approach
本文提出了一种新颖的块自回归框架,用于多比特大型语言模型水印,该框架利用包括吉法德 - 平斯克尔编码和信道合成编码在内的信息论原理,通过显式的极化码算法实现高容量、低失真的隐蔽嵌入。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的机器人,它能写故事、邮件或代码。这个机器人模仿人类写作的能力如此出色,以至于很难分辨一段文字是由人还是由机器人撰写的。这篇论文的作者想要解决一个具体问题:我们如何秘密地标记机器人的写作,以证明它出自机器人之手,同时又不让文字听起来怪异或降低其质量?
他们将此称为“水印”。这就像钞票上的隐形水印,肉眼无法看见,但专用扫描仪可以检测到。
以下是他们方法的简要分解,使用了日常类比:
1. 问题:机器人过于严格
通常,当机器人写作时,它基于刚刚写出的词,逐个选择下一个词。这就像一列在单轨上行驶的火车:一旦离开车站,它就无法提前看到下一站的样子。
作者们意识到,如果机器人能够向前看——哪怕只是一点点——它就能更好地隐藏秘密信息。他们提出了一种机器人工作的新方法:块自回归(Block-Autoregressive)。
- 类比:与其一次选一个词,不如想象机器人一次挑选一个包含 8 个词的“块”。在锁定这 8 个词之前,它会查看所有这 8 个词的可能组合。这赋予了它一种“非因果”的视角(即对文本可能样貌的即时未来一瞥)。
2. 解决方案:“秘密菜单”
核心思想是利用这种“一瞥”在文本中隐藏一条秘密消息(如数字身份标签)。
- 设置:想象机器人有一个通常选词的“基础菜单”。
- 技巧:作者引入了一张“秘密菜单”(即水印)。当机器人准备挑选一组词块时,它会查阅这张秘密菜单。
- 如果秘密消息是"0",它会从特定组中选择一个概率稍高的词组合。
- 如果秘密消息是"1",它会从另一个组中进行选择。
- 魔力:机器人执行得如此微妙,以至于文本的整体“风味”(其统计模式)与未加水印的文本几乎完全相同。对人类读者而言,故事听起来完美无缺。而对拥有秘密密钥的专用解码器来说,选择模式则揭示了隐藏的信息。
3. 数学:“完美平衡”
该论文利用复杂的数学(信息论)来证明在不破坏文本的前提下,他们能隐藏多少秘密数据。
- Gelfand-Pinsker 类比:想象你正试图通过一个嘈杂的无线电频道发送消息,但你在开口说话之前,确切地知道噪音会是什么样子。你可以调整自己的声音以完美抵消噪音。作者将机器人自然的选词视为“噪音”,将秘密消息视为信号。由于机器人能提前知晓其自身的“噪音”(选词的概率),因此它能更高效地隐藏消息。
- 结果:他们计算了隐藏数据的理论最大速率。他们发现,通过使用这种“向前看”的方法,他们可以在生成的每个词中隐藏约 0.375 比特 的数据。这就像在每个单词内部隐藏一张微小的秘密便条,而读者却察觉不到。
4. 算法:“智能交通控制器”
为了在现实中实现这一点,他们并非凭空猜测,而是利用两个主要工具构建了一个智能系统:
- CMDP(约束马尔可夫决策过程):将其想象为机器人的交通控制器。控制器必须决定选择哪些词来隐藏消息。但它有一条规则:“不要让文本听起来怪异。”控制器会不断检查:“如果我为了隐藏'1'而选择这个词,接下来的 7 个词听起来仍然自然吗?”它在隐藏数据的需求与保持文本高质量的需求之间取得平衡。
- 极化码(Polar Codes):这是一种特定类型的纠错码(就像一张安全网)。即使文本稍后被轻微篡改(或者解码器有些不确定),该代码也能确保隐藏的消息仍能被正确恢复。
5. 结果:行之有效!
作者们使用真实的语言模型(LLaMA)测试了他们的系统。
- 隐蔽性:加水印的文本几乎与正常文本无法区分。“困惑度”(衡量文本听起来有多令人困惑或不自然的指标)几乎没有变化。
- 可靠性:他们成功隐藏了消息,错误率极低(少于 10% 的隐藏位丢失)。
- 局限:该系统在短文本块(如每次 8 个词)上效果最佳。如果他们尝试看得太远(更长的块),数学计算会变得过于繁重,计算机难以快速处理。
总结
该论文提出了一种方法,通过让模型在决定写什么之前“瞥见”一小组未来的词,从而秘密地给大型语言模型的输出打上标记。利用这种“一瞥”来微调其选词,它可以嵌入隐藏的身份信息。数学证明这是可行的,且不会破坏写作质量,他们的计算机算法也在实践中成功演示了这一点。
该论文并未声称:
- 它并未声称这能瞬间适用于任何长度的文本(它在处理非常长的块时存在困难)。
- 它并未声称这是对抗所有 AI 滥用的完美防御,而仅是一种用于追踪和打时间戳的方法。
- 它未讨论医疗或临床用途;它纯粹是关于文本生成和信息论的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。