SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness
本文提出了 SAMark,一种自锚定文本水印框架,该框架通过建立与步骤无关的语义锚点并采用多通道双曲评分,实现了鲁棒的段落级改写抵抗能力,在保持高生成质量的同时显著超越了先前的基线方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位面包师,想要证明某条特定的面包是在你的厨房制作的,而不是竞争对手的。你决定在面团里藏一个微小的、看不见的印章。
老问题:“按部就班”的印章
大多数之前的 AI 文本水印方法,就像只有当你按照特定的食谱顺序操作时,才会在面包上盖章。
- 如果你按正确的顺序烘焙面包(第一句,然后第二句,然后第三句),印章就会出现。
- 但如果有人把你的面包切开,打乱切片顺序,或者重新排列(即“段落级改写”),印章就会消失。检测器会看着被打乱的面包,发现顺序不对,然后说:“这不是我的面包!”尽管它确实是。
发生这种情况是因为“印章”依赖上下文(前面的内容)来决定在哪里做标记。如果上下文变了,印章就消失了。
新方案:SAMARK(“自锚定”印章)
这篇论文的作者 SAMARK 意识到,关于一个句子唯一不变的东西就是它的含义(语义),无论它位于段落中的什么位置,或者周围有哪些词语。
他们创建了一个新系统,其中“印章”仅与句子本身绑定,而不与段落的顺序绑定。
- 类比: 想象每个句子都基于其内容本身,印有一个独特的、看不见的条形码。
- 结果: 即使人类或其他 AI 重写了段落、交换了句子或改变了顺序,每个单独句子上的条形码依然完好无损。检测器仍然可以扫描打乱后的段落,读取各个句子上的条形码,并说:“是的,这些句子全都是在我的厨房里烘焙出来的。”
他们是如何实现的(“秘密配方”)
为了在不破坏文本质量(使其听起来像机器人或重复)的情况下实现这一点,他们使用了三个巧妙的技巧:
“双曲”放大器:
把它想象成一个音量旋钮。当 AI 选择一个句子时,它会检查该句子的“条形码”是否与秘密模式匹配。有些句子完美匹配;有些只有一点匹配。- 旧方法对所有匹配一视同仁。
- SAMARK 使用一种特殊的数学曲线(双曲函数)来调大完美匹配的音量,并调小弱匹配的音量。这使得信号更加响亮,即使在文本受到攻击后也难以被忽略。
“多样性”过滤器:
水印的一个常见问题是 AI 陷入循环,为了保持“印章”可见而重复相同的短语。- SAMARK 就像一位严格的编辑。在选取一个句子之前,它会问:“我们之前用过这个确切的短语吗?”(N-gram 过滤器)以及“这个句子听起来是否太像上一个句子了?”(语义过滤器)。
- 如果答案是肯定的,它就丢弃该句子并再次尝试。这确保了最终文本听起来自然且多样,而不是重复。
“盲”检测器:
在检查文本时,检测器不需要知道原始顺序。它查看所有句子,根据大多数句子猜测“秘密模式”,然后检查文本是否与该猜测一致。这就像陪审团根据多数票做出裁决,而不需要知道事件的确切顺序。
结果
该论文声称 SAMARK 是一个游戏规则改变者:
- 鲁棒性: 当他们试图通过打乱句子和重写段落(最严峻的攻击)来“破坏”水印时,SAMARK 在约 90% 的情况下幸存下来。最好的旧方法仅幸存约 60%(下降了 30% 或更多)。
- 质量: 文本听起来依然自然。作者使用 AI 裁判将水印文本与正常文本进行比较,水印版本同样好,甚至略好,因为多样性过滤器避免了乏味的重复。
- 效率: 与其他先进方法相比,生成文本所需的时间并没有增加太多。
总结
以前的水印就像一把锁,只有当门按特定顺序关闭时才有效。如果你重新排列家具,锁就坏了。SAMARK 就像在每一件家具上贴上独特的、无法破坏的密封条。你可以随意重新布置房间,而这些密封条仍然能证明每一件家具都来自同一家工厂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。