💬 NLP
Token Rankings are Unforgeable Language Model Signatures
本文证明了,只要 API 将输出限制在足够小的前 个结果内,以防止参数被窃取,同时仍能揭示模型独特的排序模式,那么 Token 排名即可作为语言模型的一种独特且不可伪造的签名,从而在不泄露其参数的情况下对其进行识别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常著名且独特的厨师。这位厨师不仅仅是在烹饪食物,他们对食材在盘中的摆放方式有着极其讲究。即使你无法品尝食物或看到确切的食谱,食材堆叠的顺序也如此独特,以至于它就像指纹一样。
这篇论文介绍了一种利用这个完全相同的概念来识别 AI 语言模型的新方法:即关注词语的顺序,而非它们的精确概率。
以下是他们发现的拆解,使用了简单的类比:
1. 问题所在:“食谱”泄露
此前,为了证明一个 AI 是否如其所言,研究人员会要求 AI 提供其“置信度得分”(它对每个词有多确定)。
- 类比: 假设 AI 说:“我 99% 确定下一个词是‘猫’,1% 是‘狗’,0.01% 是‘直升机’。”
- 风险: 如果你拥有这些精确的数字,黑客就可以通过逆向工程还原 AI 的大脑(其内部参数),从而构建出一个伪造的副本。一旦他们拥有了这个伪造副本,他们就能伪造签名,使得人们无法分辨真实的 AI 和伪造的 AI。
2. 解决方案:“排名”签名
作者提出了一种更安全的方法。API 不再提供精确的置信度数值,而只提供排名。
- 类比: AI 只说:“第 1 名:‘猫’,第 2 名:‘狗’,第 3 名:‘直升机’。” 它并不说明“猫”比“狗”的可能性高出多少。
- 发现: 作者发现,每个 AI 模型都有自己一套独特的“可能的排名组合”。由于 AI 大脑的构建方式(具体来说是一个限制了其同时持有信息量的“瓶颈”),它只能产生所有可能的词序中极小且特定的一个子集。
- 结果: 如果你看到一组特定的词序列表,那么它极大概率出自该特定模型之手,而非其他模型。这就像看到一种特定的拼图碎片排列方式;只有特定的拼图盒才能产出这种精确的形状。
3. 为什么它是“不可伪造的”(硬锁)
论文证明了你无法伪造这种签名。
- 类比: 想象尝试从头开始建造一台新机器,使其能产生与原版厨师完全相同的词序列表。
- 数学原理: 作者表明,这样做在数学上是一个噩梦。它属于一类极其困难的问题,即使是最强大的计算机也会感到吃力。这不仅仅是“难”,而是从理论上讲,高效地实现这一点是不可能的。即使黑客窃取了模型的“大脑”,他们也无法轻易创建一个能够模仿这种特定排名签名的“不同大脑”。
4. 潜在隐患:“粗略草图”攻击
然而,作者也发现了一个安全风险。如果 API 泄露了完整的排名列表(例如,按顺序排列的前 50,000 个词),黑客可以利用这些信息绘制出 AI 大脑的“粗略草图”。
- 类比: 这就像是在看一张模糊的人脸照片。你无法完美地识别出那个人,但你可以看出他有鼻子、眼睛和嘴巴。你无法用这张草图伪造签名,但你可以窃取模型的某些“特征”。
- 解决方法: 作者找到了一个“甜点区(平衡点)”。如果 API 只显示前几个词(例如,前 500 个),签名依然保持唯一且不可伪造,但提供的信息对于黑客来说过于模糊,不足以用来窃取 AI 的大脑。
总结
- 旧方法: 展示精确概率 黑客窃取大脑 黑客伪造签名。
- 新方法: 只展示词语排名 签名具有唯一性,且在数学上无法伪造。
- 安全提示: 不要展示所有排名。只需展示前 个(一个较小的数字)。这既能让签名免受伪造者的侵害,也能保护大脑不被窃贼窃取。
这种方法为 AI 公司提供了一种方式来证明:“是的,这个输出确实来自我们的模型”,而不会在无意中交出他们“秘密配方”的钥匙。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。