On the Vulnerability of Parameter-Level Defenses to Model Merging
本文揭示了针对模型合并的参数级防御机制中存在的一个关键漏洞,即受保护的任务向量过小,无法掩盖预训练模型,从而使得一种新的锚点引导攻击(AGA)能够绕过现有防护措施,同时提出了锚点排斥微调(ARF)作为一种有效的应对手段。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观: “模型合并”问题
想象你雇佣了一位大师级主厨(预训练模型),他精通各种烹饪技巧。你聘请这位主厨专门钻研一种料理,比如制作完美的披萨。你给了他一些额外的食材和指令,于是他变成了一位专家级主厨(微调模型)。
现在,想象有一个“模型合并”工具,能让你把一位披萨专家、一位寿司专家和一位汉堡专家的知识混合在一起,合成一位能完美烹饪这三种菜系的“超级主厨”。这对于提高效率非常有益,但也带来了一个安全风险:搭便车者(Free-riders)。
一个搭便车者可以下载你受保护的“披萨专家”模型,将其与他自己的“寿司模型”进行合并,从而瞬间获得一个懂得如何制作你那著名披萨的“超级主厨”——而无需向你支付任何费用,也无需付出任何努力。
防御手段:隐藏食谱(参数级防御)
为了阻止搭便车者,研究人员创造了“主动防御措施”。你可以把这想象成给“披萨专家”穿上了一件魔法伪装服。
- 防御方式: 在发布模型之前,所有者会打乱食谱。他们可能会打乱食材的顺序(置换/Permutation),或者改变计量杯的大小(线性变换/Linear transformation)。
- 目标: 如果搭便车者试图将这个打乱的食谱与寿司食谱进行合并,数学逻辑就会崩溃。生成的“超级主厨”会做出糟糕的东西(烧焦的披萨和生的鱼)。这种防御之所以有效,是因为如果没有秘密密钥,搭便车者无法还原被打乱的食谱。
攻击手段:“锚点引导攻击”(AGA)
该论文的作者发现这些伪装存在一个致命缺陷。他们将这种攻击称为 AGA(锚点引导攻击)。
类比:巨型锚 vs. 微小羽毛
想象“预训练模型”(大师级主厨的基础知识)是一个巨大的、沉重的锚。而“任务向量”(微调期间添加的特定披萨指令)则是系在那个锚上的一根微小的羽毛。
防御手段试图通过打乱绳索来隐藏这根羽毛。然而,作者发现了一个至关重要的事实:这个锚太巨大了,以至于完全淹没了羽毛。
- 观察结果: 在这些模型的数学运算中,“锚”(基础知识)的规模比“羽毛”(新指令)大出数千倍。
- 攻击方式: 攻击者不需要知道解开绳索的秘密密钥。他们只需要观察那个巨大的锚。由于锚如此庞大,攻击者只需通过观察锚的位置,就能在数学上精确计算出绳索是如何系上去的。
- 结果: 攻击者利用公开的“锚”(原始大师级主厨)作为引导,逆向工程出伪装。他们剥离了打乱的过程,恢复了原始的“羽毛”(披萨食谱),并实现了完美的合并。
简而言之: 防御手段试图在一个巨大的系统中隐藏一个微小的变化,但由于系统过于庞大,这个微小的变化变得微不足道,攻击者可以轻易找到系统的“中心”来撤销所有的更改。
结果:防御失效
论文测试了这种攻击针对目前最优秀的防御手段(如 Params, MergeLock, 和 MergeBarrier)的表现。
- 攻击前: 搭便车者的合并模型表现极差(例如,准确率仅为 5%)。
- 经过 AGA 攻击后: 搭便车者的模型几乎恢复到了完美状态(例如,准确率达到 97%),有效地绕过了安全限制。
这就像是试图通过打乱书架上的书籍来隐藏一张秘密纸条。攻击者只需观察图书馆的主体结构,意识到纸条相对于书籍来说非常渺小,然后就能推算出纸条被藏在哪里,并将其找回。
反制手段:“锚点排斥微调”(ARF)
既然攻击之所以奏效是因为“羽毛”相对于“锚”太小了,作者提出了一种新的防御方法,称为 ARF。
类比:让羽毛变重
ARF 不仅仅是打乱绳索,它改变了训练过程。它迫使“羽毛”(新指令)变得沉重且独特。
- 工作原理: 在训练专家模型的过程中,防御机制会加入一种“排斥力”,将新指令推离原始的锚。它让“羽毛”变得如此巨大且沉重,以至于无法被忽视,也无法通过观察锚来轻松计算。
- 结果: 现在,当攻击者尝试使用“锚点引导攻击”时,数学逻辑会失效。因为“羽毛”不再是一个微小、隐形的斑点,而是一个巨大的物体,它会干扰攻击者的计算。
- 最终效果: 搭便车者无法再成功地合并模型。安全性得到了保障,同时模型本身依然能完美运行(专家级主厨依然能做出美味的披萨)。
总结
- 问题: 人们想要合并 AI 模型,但所有者希望保护其特定的训练成果。
- 旧的解决方法: 打乱模型的权重(伪装食谱)。
- 缺陷: 这种打乱是脆弱的,因为基础模型过于庞大,导致特定的指令显得微乎其微,极易被逆向工程。
- 攻击 (AGA): 利用庞大的基础模型在数学上撤销打乱过程,从而窃取指令。
- 新的解决方法 (ARF): 在训练模型时,让指令变得“响亮”且沉重,使其无法被忽视或通过基础模型进行逆向工程。
论文得出结论:仅仅通过打乱权重(线性变换)只是一种安全的幻觉。要真正保护模型,必须改变训练方式,使特定的知识能够抵御这类数学攻击。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。