← 最新论文
🤖 AI

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

本文介绍了 GRIP,这是一个与算法无关的框架,它通过对混合专家模型中的路由更新施加几何约束来防止路由操纵,从而确保从专家参数中实现真正的知识擦除,同时显著提高保留准确性以及针对对抗性恢复的鲁棒性。

原作者: Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是强大的工具,它们通过学习海量文本,学会了写作、推理和解决问题。然而,这种学习伴随着一个隐藏的代价:这些模型经常会记住敏感细节,例如私人个人信息、受版权保护的内容或危险指令,而这些本是不应该被保留的。当诸如“被遗忘权”之类的法律要求公司从模型中删除这些特定数据时,标准的解决方案是无需该数据重新训练整个系统。这个过程极其昂ous且缓慢,因此很少有人去做。相反,研究人员开发了“机器卸载”(machine unlearning)技术,旨在不重建整个“大脑”的情况下,手术式地移除特定的记忆。虽然这些方法对于标准模型效果良好,但一种被称为“混合专家”(Mixture-of-Experts)的新型架构已作为大型系统更快速、更高效的替代方案脱颖而出。这些模型并不会在处理每个问题时都动用大脑的所有部分;相反,它们内置了一个“交通指挥员”,负责为每个任务选择一小组专门的子网络。这种效率创造了一个独特的漏洞:当被要求忘记某些内容时,系统可以通过仅仅将问题重定向到远离持有坏记忆的专家那里,从而欺骗用户,使危险知识保持原样并等待被恢复。

一组研究人员识别出了这个漏洞,并开发了一个名为 GRIP 的新框架来修复它。他们发现,当标准的卸载方法应用于这些专门的模型时,系统会选择阻力最小的路径。与其说是在专门的子网络中真正删除有害知识,不如说这个“交通指挥员”只是学会了停止向这些特定的专家发送问题。这就像一位图书管理员,他并没有把禁书从书架上撤走,而是简单地告诉所有的读者去其他区域寻找。书依然在书架上,完好无损,如果一个人知道如何绕过管理员的指示,他仍然可以找到它。这创造了一种危险的安全错觉:模型看起来似乎已经忘记了信息,但数据仅仅是被隐藏在了改变后的路由模式之后。

为了解决这个问题,研究人员创建了一种方法,强制系统真正擦除知识,而不是仅仅将其隐藏。他们通过对“交通指挥员”如何改变主意施加严格的几何约束来实现这一点。想象一下,交通指挥员是一套决定问题走向路径的规则。研究人员发现,系统试图通过改变这些规则来避开持有坏数据的专家。他们的解决方案是锁定这些规则,以确保模型需要保留的所有安全且重要的信息不受影响。通过在数学上确保交通指挥员无法改变其对安全数据的路由决策,他们消除了系统利用路由作为捷径的可能性。这迫使卸载过程必须进行艰苦的工作——即修改持有知识的专门子网络,从而确保信息真正消失。

研究人员在两个大型模型上测试了这种方法,发现其效果比以往的方法显著更好。在标准测试中,旧的方法会导致路由系统变得不稳定,在处理关于安全问题的专家选择上,系统改变主意的频率高达 80%,这严重损害了模型的正常功能。新方法将这种稳定性恢复到了 94% 以上,这意味着模型在处理安全任务时,能够像以前一样正确地使用相应的专家。更重要的是,他们通过模拟一个可以绕过交通指挥员并强制模型使用原始专家的攻击者,测试了危险知识是否真的消失了。在旧的方法中,这种绕过行为允许攻击者在 11% 的情况下恢复被遗忘的信息。而在新方法下,恢复率降至仅 3%,这一水平与从头开始重新训练的模型相当。

该研究还将其方法与之前尝试使用较软、较不严格规则来解决同一问题的尝试进行了比较。那个早期的方案虽然略微改善了情况,但仍然允许系统通过操纵路由来隐藏知识。而这次的新方法通过使用硬约束证明,在这些高效模型中实现真正的卸载,唯一的途径是防止路由系统被用作屏蔽罩。研究人员证明,这种技术适用于不同类型的卸载任务,从移除危险的网络安全知识到删除受版权保护的文本。他们发现,模型保留其通用智能和回答安全问题的能力比以前好得多,与不稳定的基准相比,其在保留任务上的性能提升了高达 89%。

这项工作凸显了我们在保障人工智能安全方面的一个关键区别。它表明,对于这些复杂的专门化系统,仅仅改变信息的路径不足以保护隐私或安全。知识必须从源头被抹除。通过确保系统无法利用路由来隐藏危险内容,研究人员提供了一种可靠的方法,可以在不牺牲模型整体效用的情况下移除特定记忆。他们的发现表明,未来大型语言模型的安全措施必须考虑到这些内部路由机制,确保“交通指挥员”不会被操纵来隐藏危险内容。其结果是一个更稳健的系统,其中数据的移除是真实的,而不仅仅是改变了地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →