SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking
本文提出了一种名为 SSG(Sort-then-Split by Groups)的新方法,通过重新设计词表划分算法,使词表被划分为两个逻辑值(logit)均衡的子集,从而提升了 LLM 水印在低熵场景(如代码生成和数学推理)下的检测强度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章介绍了一种名为 SSG 的新技术,旨在为人工智能(LLM)生成的文字、代码或数学题打上更难被抹除的“数字水印”。
为了让你轻松理解,我们可以把这个技术比喻成一个**“给超市货架贴标签”**的故事。
1. 背景:什么是“数字水印”?
想象一下,如果你是一个超级厉害的厨师,你做出的菜有一种独特的调味比例。为了证明这道菜确实是你做的,你会在菜里撒一点点只有你能识别的“隐形香料”。
在 AI 领域,这就是“水印”。当 AI 写了一段代码或一个答案时,它会在选词时偷偷偏向某些特定的词,就像撒了隐形香料。如果有人怀疑这段话是 AI 写的,检测器通过统计这些“隐形香料”出现的频率,就能抓到现行。
2. 遇到的问题:当 AI 进入“极简模式”
目前最流行的水印技术(叫 KGW)在写普通文章时效果很好,但在写代码或数学题时就失灵了。
为什么呢?我们可以用“超市货架”来打比方:
- 普通写作(高熵场景): 就像一个巨大的超市,货架上有成千上万种零食。你想在里面加点“隐形香料”,空间很大,你可以随便挑一些零食贴上“绿色标签”(代表有水印),一些贴上“红色标签”。因为零食种类多,你总能找到各种各样的组合。
- 写代码/数学(低熵场景): 这就像一个极小的便利店,货架上只有两三种东西(比如只有可乐和矿泉水)。这时候,如果你想玩“贴标签游戏”,你会发现非常尴尬:如果你把所有的“好货”(高概率词)都贴上了绿色标签,那水印就太明显了,会破坏原本的逻辑;如果你把它们都贴成红色,那水印就根本没法生效。
总结: 在写代码这种“非黑即白”的任务中,AI 选词的范围非常窄,传统的随机贴标签方法很容易把所有的“重点词”都分到同一组,导致水印信号变得极其微弱,根本检测不出来。
3. 解决方案:SSG —— “按价值分组贴标签”
这篇论文提出的 SSG (Sort-then-Split by Groups) 算法,就是为了解决这个“便利店难题”。
它的逻辑不再是“随机乱贴”,而是**“先排队,再分组”**:
- 排队(Sort): 先把所有可能的词按照“受欢迎程度”(概率/Logit值)从高到低排好队。
- 分组(Split by Groups): 把最受欢迎的前几名两两分组。比如第一名和第二名一组,第三名和第四名一组。
- 公平分配(Logit-Balanced): 在每一组里,强行让一个词拿“绿色标签”,另一个词拿“红色标签”。
这个比喻:
回到那个只有可乐和矿泉水的便利店。SSG 不再乱贴,而是说:“既然只有这两样东西,那我们就规定:最畅销的可乐必须一个拿绿标,一个拿红标;第二畅销的也一样。”
这样一来,无论 AI 接下来要选什么,“绿色标签”和“红色标签”的含金量(概率权重)始终是平衡的。这就保证了无论是在写长篇大论,还是在写严谨的代码,水印信号都能稳定地存在,不会因为词汇太少而“隐身”。
4. 最终效果
通过这个方法,研究人员发现:
- 抓得更准了: 在写代码和解数学题时,检测水印的准确率大幅提升。
- 不影响智商: AI 写出来的东西依然很聪明,逻辑没有因为加了水印而变乱。
- 效率很高: 虽然要排序,但研究者发现只需要对最热门的那几个词进行操作,速度依然很快。
一句话总结:
SSG 技术通过一种“聪明且公平”的分类方式,解决了 AI 在处理严谨任务时水印容易“隐身”的问题,让 AI 生成的内容变得更容易溯源和管理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。