Synchronization-Free Algebraic Fingerprints for Large Language Models: From Autoregressive to Diffusion Models
本文提出了一种针对大语言模型的、新型的无需同步的水印方案,该方案利用里德-所罗门多项式和二元同余将秘密身份嵌入到标记对中,从而实现了能够抵抗编辑、改写和标记重排序,且无需块同步的鲁棒归因。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一堆由一位非常有才华但带点恶作剧精神的机器人建造的沙堡上留下一个秘密签名。这个机器人是一个人工智能(AI),它能写故事、回答问题并编写代码。问题在于,这个机器人太擅长模仿人类风格了,以至于无法分辨一段文字是由人写的还是机器生成的。更糟糕的是,如果有人试图“修改”这个故事——比如删掉一个句子、加一个笑话,或者重新排列段落的顺序——这个签名通常会被抹除,就像退潮时沙滩上的脚印一样。
科学家们一直试图通过在文本中印入不可见的编码来解决这个问题,但他们大多数方法都像是一条脆弱的长长的回形针链。如果你抽掉一个回形针(删掉一个词)或增加一个新的(插入一个词),整个链条就会断裂,秘密信息也会随之丢失。这篇新论文引入了一种完全不同的思考方式。与其说是一个脆弱的链条,不如把它想象成一片由成千上万只独立萤火虫组成的云。每只萤火虫都携带着一小块秘密代码。即使一场风暴(编辑者)吹走了半数萤火虫,或者它们的飞行顺序发生了变化,你仍然可以推导出秘密信息,因为你并不需要它们排成一列;你只需要其中一部分存在即可。研究人员展示了通过使用涉及多项式(可以把多项式看作是数字的秘密配方)的数学技巧,并将文本编辑视为一种概率游戏,你可以在文本被大量编辑后依然恢复 AI 的秘密身份。
问题所在:“链条”与“云”
长期以来,研究人员一直尝试通过将秘密信息组织成严格的序列(就像串珠一样)来为 AI 文本添加水印。他们会说:“第一个词获得一个秘密标记,第二个词获得下一个标记,依此类推。”这种方法在文本被编辑时表现良好,但一旦发生变动就会失效。如果删除了第一个词,第二个词就会突然变成“第一个”,整个秘密代码就会变得混乱。这就像是在读一本书时有人撕掉了第 5 页;突然间,第 6 页变成了第 5 页,故事也变得无法理解了。这被称为“同步”问题。检测器(检查水印的人)会感到困惑,因为线索的顺序发生了变化。
本文作者认为,对于可能被编辑的文本,这种“链条”方法从根本上就是有缺陷的。他们提出了一个激进的转变:完全不再依赖顺序。他们建议不再使用链条,而是使用一个由独立线索组成的“云”。
解决方案:独立的萤火虫与秘密配方
这篇论文的核心思想是一种“无需同步”的水印。它是这样运作的,我们可以用“秘密配方”和“一对邻居”来做类比。
想象 AI 正在写一个故事,一次一个词地进行。研究人员提出,对于每一对相邻的词(我们称之为“词 A”和“词 B”),系统会检查一个秘密“配方”(数学多项式),以决定“词 B”应该具有什么样的“风味”。
- 秘密配方: AI 的所有者有一个秘密身份(比如一个 32 位或 128 位的数字)。他们将这个数字转化为一个数学公式。
- 邻居: 对于每一对词,系统会查看第一个词,从而在公式上选择一个特定的“测试点”。
- 决策: 公式会给出一个结果。如果结果是“偶数”,则第二个词必须是“类型 1”的词(例如名词);如果结果是“奇数”,则第二个词必须是“类型 2”的词(例如动词)。
- 神奇之处: 关键部分在于,对“词 B”的这个决策仅取决于“词 A”和秘密配方。它不在乎“词 A”之前发生了什么,也不在乎“词 B”之后发生了什么。
因为每一对词都是一个自包含的“萤火虫”,所以无论你是删除了“词 A”、在它们之间插入了一个新词,还是重新排列了整个段落,都不会影响结果。剩余的词对仍然保留着各自独立的线索。只要你有足够的词对,你就可以在数学上重建原始的秘密配方,即使文本已经被切碎或重新排列过。
他们如何证明其有效性
作者不仅仅是凭直觉猜测这行得通;他们建立了一个数学模型来证明这一点。他们将文本编辑的过程(删除词、改变词)视为一个“二项对称信道(Binary Symmetric Channel)”。简单来说,这意味着他们将每一次编辑错误视为一次简单的硬币投掷:要么线索是正确的,要么它被翻转成了错误的答案。
他们运行了数学计算,以观察需要多少个线索(词对)才能恢复秘密。
- 结果: 他们发现,你需要的“额外”文本非常少。即使文本被大量编辑(高达 30% 的线索是错误的或缺失的),你也只需要额外的几句话就能以 99% 的置信度恢复一个 32 位的秘密代码。
- 类比: 如果你试图通过投掷硬币来猜测一个 32 位的密码,而你有 30% 的投掷结果是错的,你通常会陷入困境。但由于他们的数学使用了一种特殊的编码(里德-所罗门码/Reed-Solomon),这就像拥有一个神奇的解码环,只要你拥有的总投掷次数足够多,它就能修复那些错误的投掷。
他们还测试了如何处理非常长的秘密(如 128 位)。他们发现,如果将大秘密分解成较小的块(片段),并将每个块视为自己独立的萤火虫云,你就可以在不需要海量文本的情况下恢复整个秘密。
关于不同类型的 AI
论文还探讨了一种更新型的 AI,称为“扩散模型(Diffusion Models)”。与标准的从左到右逐词生成的 AI 不同,扩散模型是从一个混乱、破碎的句子开始,然后慢慢将其清理干净,就像雕塑家通过凿去石头来寻找雕像一样。
作者意识到他们的“独立萤火虫”方法在这里也同样适用。他们提出了三种不同的方式,让 AI 在清理文本的过程中完成“承诺(commit)”:
- 基础承诺(Basic Commit): AI 一旦发现某个词符合左侧邻居的规则,就立即锁定该词。这很快,但如果它犯了错,就无法修正。
- 精炼承诺(Refined Commit): AI 会同时检查两个邻居。如果一个邻居说“是”,而另一个邻居说“否”,它可能会改变对邻居的判断以修正错误。这更聪明,但需要更多时间。
- 滑动承诺(Sliding Commit): AI 将“已锁定”词与“未锁定”词之间的边界视为一扇滑动门。它前后移动这扇门,直到一切都完美契合。这是最稳健的方法,但也最耗时。
他们的模拟表明,对于标准 AI,“基础”方法已经足够快。对于扩散模型,“精炼”方法则提供了良好的平衡,可以在处理过程中不断修正错误。
总结
这篇论文提出了一种极其难以破解的 AI 文本标签技术。与以往在编辑文本时会崩溃的方法不同,这种方法通过让每个线索自成一体,从而在面对删除、插入和重排时依然能够生存。作者通过数学和模拟证明,即使文本经过了大量编辑,你仍能以极高的置信度恢复 AI 的秘密身份。他们还为如何在标准文本生成器和更新、更复杂的扩散模型中实现这一技术提供了路线图。
虽然他们并未声称解决了所有可能的问题(他们指出,未来的工作可以研究更复杂的编辑模式),但他们提供了一个强大的、经过数学证明的框架,使水印技术比以往任何时候都更加可靠。这是一种从构建脆弱的“链条”向创造具有韧性的“云”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。