← 最新论文
💻 computer science

Can Watermarking Techniques Help Prevent LLM Model Stealing?

本文提出了一种基于水印的防御方法,通过扰动模型逻辑值(logits)来防止黑盒模型窃取攻击(包括对隐藏层维度的提取),并通过实证实验证明该方法在不显著降低模型效用的情况下,能有效挫败此类攻击。

原作者: Elette Boyle, MohammadTaghi Hajiaghayi, Keivan Rezaei, Suho Shin, Amos Stern

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Elette Boyle, MohammadTaghi Hajiaghayi, Keivan Rezaei, Suho Shin, Amos Stern

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你制作出了一款极其精妙、造价高达数百万美元的秘密蛋糕配方。你并不出售整块蛋糕,只是通过一个窗口让人们订购切片。他们能尝到味道,但看不见原料清单,也看不见搅拌碗的大小。

最近,一群狡猾的厨师发现了一个窥探你厨房的小伎俩。通过订购成千上万份特定的切片,并分析留下的微小碎屑(称为“logits”),他们可以使用一种叫做 PCA 的数学放大镜来推算出你搅拌碗的确切大小(即“隐藏维度”)。一旦知道了这个,他们就可能逆向工程出你的整个秘密配方,从而建立起一家竞争对手的蛋糕店。

这篇论文提出了一种保护你厨房的新方法:数字水印。作者建议不要仅仅隐藏搅拌碗,而是在每一片蛋糕离开窗口之前,往上面撒上一层特殊的、不可见的“噪声”。这种噪声旨在迷惑那些狡猾的厨师,让他们无法数出搅拌碗的大小,同时还能保证蛋糕的味道依然美味。

“噪声”问题:为什么简单的招数会失败

作者测试了几种添加这种噪声的方法,发现一些显而易见的思路完全是弄巧成拙。

  • “静态”错误: 如果你在每一片蛋糕上都加入完全相同数量的噪声,厨师们只需将其减去即可。这就像如果你在每块饼干上都撒了同样多的盐,聪明的厨师只需尝出盐味并将其忽略掉。
  • “排序”错误: 他们尝试过根据原料的顺序来对噪声进行排序。令人惊讶的是,这同样不起作用。噪声本身带有隐藏的模式,厨师们仍然可以捕捉到它,就像玻璃上留下的指纹一样。
  • “乘法”错误: 他们尝试用一个随机数去乘以原料。这破坏了蛋糕的味道(降低了模型质量),但仍然没能阻止厨师们数出搅拌碗的大小。

论文明确反对使用简单的、独立的噪声(即每次都变化的随机喷洒物),因为厨师们可以订购 40 次相同的切片,然后通过平均结果来抵消掉噪声。

获胜策略:“秘密种子”与“Softplus”护盾

作者发现了一个真正奏效的解决方案,其灵感来自于数字图像水印。他们的方法有两个核心成分:

  1. 秘密种子: 厨房使用的不是随机噪声,而是一个基于烤箱内蛋糕面团精确状态的秘密代码(加密函数)。这意味着每一片蛋糕都会得到一个取决于其内部成分的独特噪声模式。即使厨师两次订购相同的提示词,噪声也是一致的(因此他们无法通过平均值来消除它);但如果他们稍微改变提示词,噪声就会完全改变。
  2. Softplus 护盾: 为了确保噪声不会毁掉蛋糕的风味,他们使用了一种名为“softplus”的特殊数学技巧。你可以把它想象成一个温柔的过滤器,它会对原料进行轻微的扭曲,足以隐藏搅拌碗的大小,但又能保持顶层美味原料的精确顺序。

当他们将这种“秘密种子”与“Softplus”结合,并加入高斯噪声(就像撒上一层细密的糖粉)时,效果令人印象深刻。在对名为 Mistral-7B(其隐藏维度为 4,096)的模型进行测试时,那些狡猾的厨师彻底失败了。数学显示数据中没有任何明显的“跳跃”来揭示搅拌碗的大小。即使厨师尝试使用“鲁棒 PCA”(Robust PCA)或尝试逆转 softplus 过滤器,攻击也未能识别出维度。

蛋糕的味道还好吗?

最大的担忧是:“如果你弄乱了原料,蛋糕会变难吃吗?”

作者对此进行了仔细测量。他们使用了一个名为 MMLU(知识与推理测试)的基准测试,并发现:

  • 简单的、杂乱的噪声会显著降低模型的得分(在某些情况下降至约 44.75%49.52%)。
  • 然而,基于 Softplus 的方法能让得分保持在极高的水平,维持在 56.55%57.78% 之间。这与原始的、未经修改的模型几乎持平!

他们还使用名为 困惑度(Perplexity) 的指标检查了“风味特征”的变化程度。表现最好的配置显示的困惑度仅为 3.37,非常接近原始模型的 3.40

总结

这篇论文并不声称解决了宇宙中所有的盗窃问题,但它强烈表明,这种特定方法是一种鲁棒的防御手段。通过使用基于提示词的秘密种子和温柔的“softplus”过滤器,他们成功地扰乱了窃贼用来偷取模型大小的数学线索,同时又保持了模型的智能与实用性。

简而言之:你现在可以在 AI 的回答中撒上一层“混乱粉尘”,以阻止窃贼测量你的厨房,且不会破坏蛋糕的味道。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →