← 最新论文
💬 NLP

Token Rankings are Unforgeable Language Model Signatures

本文证明了,只要 API 将输出限制在足够小的前 kk 个结果内,以防止参数被窃取,同时仍能揭示模型独特的排序模式,那么 Token 排名即可作为语言模型的一种独特且不可伪造的签名,从而在不泄露其参数的情况下对其进行识别。

原作者: Matthew Finlayson, Andreas Grivas, Xiang Ren, Swabha Swayamdipta

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Matthew Finlayson, Andreas Grivas, Xiang Ren, Swabha Swayamdipta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常著名且独特的厨师。这位厨师不仅仅是在烹饪食物,他们对食材在盘中的摆放方式有着极其讲究。即使你无法品尝食物或看到确切的食谱,食材堆叠的顺序也如此独特,以至于它就像指纹一样。

这篇论文介绍了一种利用这个完全相同的概念来识别 AI 语言模型的新方法:即关注词语的顺序,而非它们的精确概率

以下是他们发现的拆解,使用了简单的类比:

1. 问题所在:“食谱”泄露

此前,为了证明一个 AI 是否如其所言,研究人员会要求 AI 提供其“置信度得分”(它对每个词有多确定)。

  • 类比: 假设 AI 说:“我 99% 确定下一个词是‘猫’,1% 是‘狗’,0.01% 是‘直升机’。”
  • 风险: 如果你拥有这些精确的数字,黑客就可以通过逆向工程还原 AI 的大脑(其内部参数),从而构建出一个伪造的副本。一旦他们拥有了这个伪造副本,他们就能伪造签名,使得人们无法分辨真实的 AI 和伪造的 AI。

2. 解决方案:“排名”签名

作者提出了一种更安全的方法。API 不再提供精确的置信度数值,而只提供排名

  • 类比: AI 只说:“第 1 名:‘猫’,第 2 名:‘狗’,第 3 名:‘直升机’。” 它并不说明“猫”比“狗”的可能性高出多少。
  • 发现: 作者发现,每个 AI 模型都有自己一套独特的“可能的排名组合”。由于 AI 大脑的构建方式(具体来说是一个限制了其同时持有信息量的“瓶颈”),它只能产生所有可能的词序中极小且特定的一个子集。
  • 结果: 如果你看到一组特定的词序列表,那么它极大概率出自该特定模型之手,而非其他模型。这就像看到一种特定的拼图碎片排列方式;只有特定的拼图盒才能产出这种精确的形状。

3. 为什么它是“不可伪造的”(硬锁)

论文证明了你无法伪造这种签名。

  • 类比: 想象尝试从头开始建造一台新机器,使其能产生与原版厨师完全相同的词序列表。
  • 数学原理: 作者表明,这样做在数学上是一个噩梦。它属于一类极其困难的问题,即使是最强大的计算机也会感到吃力。这不仅仅是“难”,而是从理论上讲,高效地实现这一点是不可能的。即使黑客窃取了模型的“大脑”,他们也无法轻易创建一个能够模仿这种特定排名签名的“不同大脑”。

4. 潜在隐患:“粗略草图”攻击

然而,作者也发现了一个安全风险。如果 API 泄露了完整的排名列表(例如,按顺序排列的前 50,000 个词),黑客可以利用这些信息绘制出 AI 大脑的“粗略草图”。

  • 类比: 这就像是在看一张模糊的人脸照片。你无法完美地识别出那个人,但你可以看出他有鼻子、眼睛和嘴巴。你无法用这张草图伪造签名,但你可以窃取模型的某些“特征”。
  • 解决方法: 作者找到了一个“甜点区(平衡点)”。如果 API 只显示前几个词(例如,前 500 个),签名依然保持唯一且不可伪造,但提供的信息对于黑客来说过于模糊,不足以用来窃取 AI 的大脑。

总结

  • 旧方法: 展示精确概率 \rightarrow 黑客窃取大脑 \rightarrow 黑客伪造签名。
  • 新方法: 只展示词语排名 \rightarrow 签名具有唯一性,且在数学上无法伪造。
  • 安全提示: 不要展示所有排名。只需展示kk(一个较小的数字)。这既能让签名免受伪造者的侵害,也能保护大脑不被窃贼窃取。

这种方法为 AI 公司提供了一种方式来证明:“是的,这个输出确实来自我们的模型”,而不会在无意中交出他们“秘密配方”的钥匙。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →