Making Models Unmergeable via Scaling-Sensitive Loss Landscape
本文提出了 ,一种与架构无关的框架,通过在微调过程中嵌入一个对缩放敏感的损失景观来保护模型权重,从而确保未经授权的模型合并会降低性能,同时保留其独立使用的效用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,AI 模型的世界就像一座巨大的开放图书馆,人们分享着“食谱卡”(更新)来教导一位基础厨师(基础模型)新的技巧。有时,你想将两张食谱卡结合起来,制作出一个既能做这个又能做那个的高级厨师。这被称为模型合并(model merging)。
然而,这里有一个问题:如果有人发布了一张本该单独使用的食谱卡,但其他人却试图将其与自己的食谱卡混合,从而创造出一个破坏安全规则或忽视许可协议的“怪物”怎么办?这篇论文称之为“治理差距(governance gap)”。
本文作者 Minwoo Jang 及其同事提出了一种保护这些食谱卡的新方法,让它们在被尝试与其他卡片混合时会崩溃。他们将这种方法称为 TRAP2。
以下是它的工作原理,使用简单的类比:
问题所在:“脆弱的蛋糕”
把一个标准的 AI 更新(比如一个 LoRA 适配器)想象成一个烤得完美的蛋糕。
- 独立使用: 如果你单独吃这个蛋糕,它味道极佳(高准确度)。
- 合并使用: 如果你尝试将这个蛋糕与另一个蛋糕混合,结果通常会变成一种不错的新甜点。
本文的目标是制作一种蛋糕:它在单独食用时味道惊艳,但一旦有人尝试将其与其他蛋糕混合,它就会变成一滩烂泥。
旧方法(事后防御)
以前的尝试是通过在蛋糕烤好后对其进行特殊的“涂层”处理或重新排列食材来阻止这种行为。
- 缺陷: 这种方法仅适用于特定类型的蛋糕(如 Transformer 模型)。如果你尝试对不同类型的蛋糕(如 ResNet 或 ConvNeXt)进行处理,涂层就无法粘附,或者会破坏蛋糕的味道。此外,如果你只分享“配料”(适配器)而不分享整个蛋糕,这种方法就会失效,因为它需要看到整个蛋糕才能起作用。
新方法:TRAP2(训练时保护)
TRAP2 不再是在蛋糕烤好后进行涂层,而是改变了蛋糕最初的烘焙方式。
想象你在烤一个蛋糕,但你有一个秘密规则:“这个蛋糕在室温下必须是完美的,但如果温度稍微升高或降低一点点,它就必须塌陷。”
在 AI 世界中,“温度”就像是一个缩放因子(scaling factor)。
- 当模型单独使用时,“温度”被设定为 1.0(完美)。
- 当人们尝试合并模型时,他们通常需要调整“温度”(对权重进行缩放)以使数学计算成立。
TRAP2 专门训练模型使其在这些调整下变得极其脆弱。
- 训练过程: AI 学习在缩放比例恰好为 1.0 时表现完美。
- 陷阱: 在训练期间,AI 还会观察如果缩放比例变为 0.5 或 2.0 时会发生什么。如果它在这些场景下表现良好,它会受到严厉惩罚。它学到的是:任何比例的变化都是危险的。
- 结果: 当模型发布时,它本身表现出色。但一旦用户尝试合并模型(这会强制改变缩放比例),模型的性能就会崩塌。
为什么这很特别?
- 它是通用的: 与那些仅适用于特定“蛋糕类型”(Transformer)的旧方法不同,TRAP2 适用于任何架构。它不在乎你的模型长什么样,它只关心数字是如何缩放的。
- 它适用于“配料”: 即使你只发布一个微小的适配器(如 LoRA)而不发布整个模型,它依然有效。
- “附带损伤”: 论文指出,如果你将受 TRAP2 保护的模型与普通模型混合,那个普通模型也会被毁掉。这就像是将一个脆弱的玻璃花瓶与一个木碗混合在一起:玻璃碎了,木碗也被磕碰了。这确保了未经授权的合并对所有人来说都是一个糟糕的主意。
实验结果
作者在许多不同的图像识别任务(如识别汽车、飞机或手写数字)上测试了该方法。
- 独立使用: 受保护的模型与未受保护的模型表现一样出色。
- 合并使用: 当尝试将这些受保护的模型与其他模型合并时,准确度大幅下降,甚至往往跌破了从未经过训练的模型水平。
总结
TRAP2 就像是制作了一张带有陷阱的食谱卡。如果你完全遵循说明书(单独使用),它表现完美;但如果有人试图将其与其他食谱混合(合并使用),整个东西就会分崩离析。这保护了创作者的作品不被未经授权地组合使用,且无需了解模型内部结构的具体细节。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。