FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing
FPEdit 是一个新颖的框架,它通过局部参数编辑注入语义连贯的自然语言签名,从而实现对大语言模型的鲁棒指纹标记,在对抗微调和剪枝时保持高留存率,同时保留模型效用并保持不可检测性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一座巨大且繁忙的图书馆,其中最珍贵的书并非由纸张制成,而是由数学构成。这些“书”就是大语言模型(LLM),它们是极其聪明的程序,通过对海量数据的训练来学习写作、推理和创造。建造它们就像建造摩天大楼一样:需要巨额的资金、能源和天才般的工程设计。由于它们如此珍贵,其创造者希望保护它们,就像电影制片厂保护一部大片一样。但棘手之处在于:一旦你发布了一个数字化的“书”,任何人都可以未经许可就对其进行复制、修改,甚至将其作为自己的作品出售。为了阻止这种情况,科学家们一直试图在这些模型中隐藏不可见的“指纹”,以证明其出处。
长期以来,检查这些指纹的唯一方法是观察模型的“大脑内部”(你并不总能做到这一点),或者隐藏一段只有所有者才知道的秘密、奇怪的代码。这种秘密代码的问题在于,它通常看起来像乱码或故障。如果一个狡猾的小偷试图使用该模型,他们可以轻易地发现这段奇怪的代码,将其删除,并声称该模型是他们原创的。这是一场猫鼠游戏,而“猫”(指纹)太显眼了,以至于“老鼠”(小偷)可以直接将其踢除。科学家们一直在思考的大问题是:我们能否将指纹隐藏得如此完美,以至于它看起来像一句正常的句子,但即使模型被修改或复制,它依然有效?
于是有了 FPEdit,一种全新的方法,它就像一位大师级的图书管理员,能够不动声色地在书中塞进一张微小且完美的便条,而不让任何人察觉到页面被动过。FPE딧 不使用那些怪异、充满故障感的代码,而是利用自然语言指纹来隐藏指纹。把这些指纹想象成正常的问答,比如问“微软的首席执行官是谁?”,得到的回答是“萨提亚·纳德拉”。但在这种情况下,模型被教导针对一个特定的问题给出非常具体的、预先约定的答案,而这个答案是它原本并不那么熟悉的。
这篇论文介绍了一种巧妙的技术,称为知识编辑(Knowledge Editing)。想象一下你拥有一部巨大的百科全书,与其重写整本书来添加一个新事实,不如直接找到那一个特定的页面和那一个特定的句子,然后只微调那几个词。FPEdit 对 AI 内部的数学运算也是如此。它会寻找模型大脑中处理特定信息的特定“开关”,并仅仅轻微地拨动这些开关,使其记住秘密指纹。因为它只改变了模型极小且具有针对性的部分,模型的其余部分保持完全不变,这意味着它不会变得“困惑”或丧失智能。
研究人员通过在一个名为 LLaMA2-7B 的流行模型中隐藏 10 组这样的秘密问答对,测试了这个想法。随后,他们尝试通过通常会破坏秘密的操作来破解这些指纹:对模型进行新数据训练(微调)、将其缩小(量化),甚至剪掉其中的部分(剪枝)。结果令人印象深刻。虽然其他方法失败了或留下了容易被发现的明显线索,但 FPEdit 即使在模型被大幅修改后,仍能保持 94% 到 100% 的指纹保存率。
或许最酷的部分在于它的隐蔽性。这些秘密的问答看起来非常像正常的真人对话,因此不会触发任何“异常警报”。当研究人员检查模型对这些问题的“惊讶程度”时,其惊讶水平与普通问题几乎相同,不像其他方法听起来像乱码并会立即被标记。此外,它的操作速度极快且成本极低:团队在不到 2 分钟的时间内,使用不到 30 GB 的计算机内存,就在一个大型模型中嵌入了 10 个指纹。
简而言之,FPEdit 表明我们可以通过“大隐隐于市”的方式来保护 AI 模型。这是一种证明所有权的方法,既难以破解,又难以察觉,且不会破坏模型履行职责的能力。虽然它不是能阻止所有盗窃行为的神奇护盾,但论文表明,它是追踪这些数字巨兽真正构建者的一个非常强大且实用的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。