← 最新论文
🤖 machine learning

RAFP: Identifying LLM Lineages via Rare-Region Fingerprints

本文介绍了 RAFP,这是一个通过利用在微调和量化等各种下游适配中仍能保持稳定的稀有区域指纹,从而稳健地识别大语言模型(LLM)所有权的非侵入式框架,其在黑盒设置下的表现优于现有方法。

原作者: Yun-Yun Tsai, Jia Hao Liang, Chuan Guo, Junfeng Yang, Laurens van der Maaten

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yun-Yun Tsai, Jia Hao Liang, Chuan Guo, Junfeng Yang, Laurens van der Maaten

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你烤出了一份秘密的、世界闻名的饼干配方。你担心有人会偷走你的面团,稍微改动一下糖霜,然后将其作为自己的产品来销售。你该如何证明那是“你的”饼干,而又不向他们展示那本配方书呢?

这就是大型语言模型(LLM)面临的问题。这些超级聪明的 AI 大脑可以写故事、写代码和讲笑话。公司投入数百万美元来训练它们,但一旦发布,很难判断一个略有不同的新版本是否其实是偷来的副本。

于是有了 RAFP(稀有区域指纹,Rare-Region Fingerprints),这是由哥伦比亚大学和 Meta 的研究人员提出的一种新方法。把 RAFP 想象成一种在 AI 大脑中留下的隐形且不可擦除的“饼干屑”,只有原作者才知道如何找到它。

核心秘诀:为什么“古怪”的问题有效

大多数人试图通过训练 AI 完美回答特定问题来保护 AI。但研究人员发现这种逻辑存在缺陷:如果你训练 AI 回答一个问题,然后有人对这个 AI 进行了微调(这被称为“微调”/finetuning),AI 可能会忘记那个特定的答案,因为新的训练过程覆盖了旧的训练。

RAFP 团队发现了一个反直觉的事实:AI 模型其实并不擅长回答古怪、罕见的问题。

想象一下,一个 AI 几乎读遍了图书馆里的每一本书。它完全知道如何回答“法国的首都是哪里?”(这是一个常见的、高密度的常见问题)。但如果你问它一个虚构的词或一个荒诞、无意义的句子(一个“稀有区域”),AI 就会不知所措。它对这些奇怪的事情没有强烈的观点,因为它很少见到这些东西。

这里的魔力在于:正因为 AI 不太在意这些古怪的问题,所以改变 AI 的训练数据并不会改变它对这些问题的回答。

当有人试图通过使用新数据来“窃取”模型时,他们关注的是常见的内容(比如修正语法或学习新事实)。他们会忽略那些古怪、罕见的问题,因为这些问题不会出现在他们的新训练数据中。因此,AI 对古怪问题的回答会保持不变,就像湍急河流中一块顽固的岩石。

指纹是如何制造的

研究人员不需要破解 AI 的代码或修改其权重(这就像是在饼干烘焙时试图重写配方)。相反,他们使用了一种巧妙的搜索方法:

  1. 寻找“怪异性”: 他们使用计算机程序来搜寻那些在自然情况下极不可能出现的句子。这就像是在寻找一段听起来像是机器人在尝试说一种它并不了解的语言。
  2. 锁定答案: 他们询问 AI 在面对这个奇怪句子时会做出什么反应。
  3. 承诺(记录): 在模型发布之前,所有者会将这个奇怪的句子和对应的答案记录下来,并存入数字保险箱(加密哈希值)。

随后,如果他们怀疑某个模型是被窃取的,他们会向可疑的模型询问那个奇怪的问题。如果该模型给出了完全相同的奇怪回答,那就是匹配成功!如果该模型给出了不同的回答(或者是一个正常的回答),那么它很可能是一个完全不同的模型。

它真的有效吗?

研究人员在四个不同的 AI 模型家族上测试了这种方法(包括 Llama 2、Llama 3 和 Mistral)。他们不仅测试了原始模型,还尝试通过以下方式破坏指纹:

  • 重训练: 教会模型新的知识(监督式微调)。
  • 改变“个性”: 调整模型的说话方式(系统提示词变更)。
  • 压缩: 使模型变得更小、更快(量化)。
  • 改变“温度”: 让模型变得更随机或更严肃。

结果如下:

  • 有效性: 在对原始模型的测试中,RAFP 100% 正确识别了模型。
  • 鲁棒性: 即使在模型被大幅度修改后,RARF 仍能 93% 至 100% 地识别模型。
  • 对比: 其他方法,例如通过改变 AI 内部设置来进行“水印”标记,失败率要高得多。有些方法在模型经过修改后,成功率甚至降到了仅 23%。而 RAFP 依然保持强劲。

论文还表明,即使可疑模型试图过滤掉古怪问题,该方法依然有效。通过让“稀有”问题变得稍微不那么古怪(但仍然足够稀有),指纹能够通过一种“困惑度过滤器”(perplexity filter),而其他类型的隐藏代码会被该过滤器拦截。

它“不是”什么

论文谨慎地指出,这并意味着什么。

  • 它不是抵御所有可能攻击的万能护盾。如果有人从头开始完全重写 AI,或者使用极其昂贵的方法专门针对这些稀有问题进行攻击,指纹可能会消失。
  • 它不需要所有者拥有对被盗模型内部代码的访问权限。它可以在“黑盒”环境下工作,这意味着你只能像普通用户一样通过聊天窗口与模型交流。
  • 它不会改变模型的性能。AI 依然能写出好的故事并回答正常问题;指纹只是由于模型处理奇怪事物时产生的一个隐藏副作用。

总结

RAFP 表明,证明一个 AI 是属于你的最佳方式,并不是强迫它记住你的秘密,而是去寻找它大脑中那些无人问津、被遗忘的角落。因为在正常的更新过程中,这些角落会被忽略,所以留在那里的“签名”会保持不变,充当模型持久且隐形的身份证。

研究人员基于他们在多个模型和修改实验中的结果,对这些发现充满信心,但也指出随着 AI 的进化,新的、更强的攻击手段可能会出现。不过目前来看,这种“稀有区域”的小技巧似乎是一种非常稳固的抓捕模型窃贼的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →