Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition
本文表明,标准的模型合并技术经常会导致一种不对称的崩溃,即安全识别能力发生丧失,而广泛的拒绝行为却得以保留,这主要是因为尽管任务向量近乎正交,但拒绝微调诱导了显著更大的任务向量模量,从而在合并过程中占据了主导地位。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个可以学习新把戏的超级聪明机器人。有时,你想教它一件特定的事情,比如如何识别虚假新闻标题。其他时候,你想教它另一个不同的把戏,比如如何对危险请求说“不”。但如果你想让机器人同时学会这两件事呢?在人工智能的世界里,有一个聪明的捷径叫做“模型合并”(model merging)。科学家们不是从头开始重新训练机器人,而是将两个不同版本的机器人——一个针对技巧 A 进行了训练,另一个针对技巧 B 进行了训练——通过数学方法将它们的“大脑”融合在一起。这就像是将两种不同口味的冰淇淋混合在一起,得到一个新的、完美的旋涡口味。大的问题在于,当我们混合这两种“口味”的安全训练时,我们得到的是一个既擅长 A 又擅长 B 的机器人,还是其中一种口味会完全淹没另一种?这正是这项研究试图解决的谜题:我们能否在保持机器人“理解”危险能力的同时,也保持其“拒绝”危险的能力。
这群发表于 COLM 2026 会议的研究人员决定使用一个特定的机器人模型——Gemma-3-1B-IT 来进行测试。他们创建了两个特殊版本的机器人。第一个版本,我们称之为“侦探”(Detective),它在海量的医疗问题数据集上进行了训练,成为了识别提示词(prompt)“危害程度”的专家。它学会了给出分级答案,比如说:“这有一点风险,”或者“这非常危险。”第二个版本,“守护者”(Guardian),它在一个巨大的、旨在破解机器人规则的对抗性提示词集合上进行了训练。守护者学到了一个简单而生硬的教训:如果看起来很危险,那就直接说“不”,并拒绝回答,无需多言。
团队随后将这两个专家模型通过四种不同的数学融合方法合并回一个机器人中。他们原本期望得到一个既能检测危害等级又能拒绝不良内容的机器人。然而,他们却发现了一个奇怪且失衡的结果。在每一种情况下,“守护者”的行为都完全占据了主导。合并后的机器人非常擅长拒绝不良提示词,其拒绝率保持在高位(在 81% 到 85% 之间)。然而,“侦探”的技能几乎完全消失了;机器人忘记了如何对危害进行分级;它们对提示词严重程度进行分类的能力大幅下降,跌至接近于零(根据方法的不同,降至低至 0.6% 或 12.9%)。这就像是机器人学会了对所有事物都紧闭大门,从而忘记了通过猫眼去窥视外面究竟发生了什么。
为什么会发生这种情况?科学家们仔细检查了这两个机器人的“DNA”以寻找罪魁祸首。他们发现,这并不是因为两个机器人在互相争斗或朝着相反的方向努力。事实上,它们的大脑几乎处于相互垂直的角度,这意味着它们在做完全不同的事情,且互不冲突。真正的核心问题在于音量。“守护者”机器人的训练数据集大约是“侦探”数据集的 29 倍。因此,“守护者”大脑中所做的改变要“响亮”得多,也强壮得多。当科学家们混合这两个大脑时,他们使用的数学工具就像是一个音量旋钮,调大了较响信号的音量,并调小了较弱信号的音量。“守护者”那宏大、生硬的“不!”淹没了“侦探”那细微、微妙的“也许”。
即使研究人员尝试通过缩小“守护者”的训练数据规模使其与“侦探”持平来解决问题,对于所有的合并方法来说,问题并未完全消失。这表明,虽然数据规模是一个重要因素,但合并算法处理这些“大声”与“小声”更新的方式才是关键。这项研究表明,标准的合并工具目前存在偏差,它们倾向于保留那些宏大、生硬的行为(如拒绝一切),却在无意中删除了那些精细、详尽的技能(如理解为何某事是错误的)。
那么,这对未来意味着什么?论文指出,如果我们想要构建既能拒绝不良事物、又能理解安全细微差别的安全 AI,我们不能仅仅使用目前的标准工具来混合和匹配模型。我们可能会在变成“守护者”的过程中丢失掉内在的“侦探”。研究人员总结道,未来的方法需要更聪明地平衡这些不同的“音量”,确保机器人不仅学会了对一切都说“不”,还学会了理解“轻微警告”与“重大危险”之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。