🤖 AI
ArcMark: Distortion-Free Multi-Byte LLM Watermark via Optimal Transport
本文介绍了 ArcMark,一种针对大型语言模型的无失真多字节水印新框架,该框架利用最优传输和信息论信道编码原理,在不改变模型输出分布或质量的前提下,将大量信息可靠地嵌入文本中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢、富有创造力的作家(即大型语言模型,或 LLM),它能撰写故事、代码或电子邮件。你想知道某段特定文本是否由该 AI 生成,如果是,你希望确切知道是谁请求生成的、由哪个版本的 AI 撰写,甚至原始的提示词是什么。
这正是ArcMark发挥作用的地方。它是一种用于 AI 文本的新型“隐形墨水”。
以下是该论文主张的简明拆解,采用日常类比:
1. 问题:只能闪烁一次的“手电筒”
以往对 AI 文本进行水印标记的方法,就像使用一盏只能闪烁一次的探照灯(即“零比特”或“一比特”信号)。
- 它能做什么:它只能告诉你“是的,这是 AI 写的”或“不,不是”。
- 局限性:它无法告诉你“谁”写的,或“写了什么”。这就像在黑暗中看到灯光闪烁,却不知是谁按下了开关。
- 旧方法:为了传递更多信息,旧方法试图微调文本,比如在这里或那里改一个词。这有时会让文字听起来略显机械或不自然(失真)。
2. 解决方案:“隐形明信片”(ArcMark)
研究人员创建了ArcMark,它就像隐藏在文本中的一张隐形明信片。
- 神奇之处:它能在短短几百个单词的文本中隐藏多个字节的信息(比如完整的 ID 号码或简短消息)。
- “无失真”承诺:最重要的主张是,这种隐形墨水不会改变写作质量。如果你阅读这段文本,它听起来与 AI 在没有隐藏信息时生成的文本完全一样自然。论文声称该文本是“无失真的”,意味着 AI 的自然流畅性未被中断。
3. 工作原理:“圆圈游戏”
论文运用了一些复杂的数学,但以下是其技巧的简化版:
- 圆圈:想象 AI 的候选词列表(其词表)被排列成一个巨大的圆圈。
- 目标:系统在该圆圈上选定一个特定点,用以代表秘密信息的一部分。
- 洗牌:AI 与解码器(检查消息的人)共享一个秘密的“洗牌”密钥。该密钥旋转圆圈,使得只有他们知道秘密位置在哪里。
- 选择:AI 被要求选择一个词。它不选择“绝对最佳”的词,而是选择在圆圈上靠近秘密位置的词。
- 类比:想象你在玩一个游戏,必须从篮子里选一个水果。规则是:“从桌上的红点附近选一个水果,但要确保篮子看起来仍像一个正常的水果篮。”AI 会选择一个同时满足这两条规则的水果。
- 数学:论文使用了一个名为“最优传输”的概念来解决这个问题。可以将其想象为一位超高效的送货员,将“最佳”水果移动到“红点”位置,同时不让篮子看起来空荡或凌乱。
4. 为何更优:“团队协作”vs“独角戏”
- 旧方法:试图在每个单词中隐藏一个微小的信息比特。如果你搞错了一个词,就丢失了那个比特。这就像试图通过一次只耳语一个字母来发送消息;如果风一吹,字母就丢了。
- ArcMark:将整个段落视为一个单一谜题。它使用“线性码”(一种 fancy 的说法,意指团队协作)。即使攻击者修改了几个词(例如改写句子),解码器仍能推断出完整信息,因为它观察的是整个序列的模式,而不仅仅是单个单词。
5. 结果:论文发现
作者在流行 AI 模型(如 Llama3、Mistral 和 Qwen)上测试了 ArcMark,发现:
- 准确性:它能以极高的准确率成功隐藏并恢复 1、2、3 甚至 4 字节的数据(这对文本而言数量很大)。
- 隐蔽性:文本听起来与正常 AI 文本一样好。测量“困惑度”(衡量文本令人困惑或不自然程度的分数)的测试显示,带水印与不带水印的文本之间没有差异。
- 鲁棒性:即使有人尝试“改写”文本(例如翻译成法语再译回英语,或重写句子),ArcMark 的存活率也远优于以往方法。
- 容量:论文从数学上证明,ArcMark 非常接近在不破坏文本的前提下,能在 AI 文本中隐藏信息的理论最大极限。
总结
ArcMark是一种新型、高效的方法,用于为 AI 文本加盖隐藏的、多字节的 ID 卡。它不会让文本听起来怪异,并且足够智能,能够抵御重写或编辑文本的尝试。它将“在 AI 中隐藏信息”的问题,从一场猜谜游戏转变为一门精确的数学科学。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。