← 最新论文
🤖 machine learning

Understanding Machine Unlearning Through the Lens of Mode Connectivity

本文引入了机器遗忘中的模式连通性(MCU)概念来分析机器遗忘的优化几何结构,揭示了遗忘后的模型通常存在于与重训练机制不同的连通低损失盆地中,同时为隐私指标、非线性遗忘进展以及通过集成实现的鲁棒性提升提供了见解。

原作者: Jiali Cheng, Hadi Amiri

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiali Cheng, Hadi Amiri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的数字大脑,一个机器学习模型,它阅读了整个互联网。它知道从如何烤蛋糕到某种著名饼干的秘密配方的一切知识。但随后,有人要求它忘记那个饼干配方,因为那是受版权保护的,或者仅仅是因为它已经过时了。你不能直接删除几行代码;大脑已经将这些知识编织进了它的结构之中。如果你试图将其强行拔除,你可能会在无意中破坏它烤蛋糕的能力或回答简单问题的能力。这就是**机器遗忘(Machine Unlearning)**的棘手世界:一种让 AI 忘记特定事物,同时又不破坏其通用智能的艺术。

为了理解这其中的运作机制,科学家们观察了“损失景观(loss landscape)”。把这个景观想象成一个巨大的、起伏不平的地形,其中地面的高度代表了 AI 执行任务时的糟糕程度。AI 想要找到最深的谷底(最低点),在那里它犯的错误最少。通常情况下,如果你从头开始训练两个不同的 AI,它们可能会落在不同的谷底。但一个被称为**模态连通性(Mode Connectivity)**的酷炫发现表明,这些不同的谷底通常是由平滑、低洼的路径连接在一起的。你可以从一个 AI 的解法走向另一个,而无需攀爬陡峭的山坡。这篇论文提出了一个新问题:如果我们拿一个 AI 并强迫它忘记某些东西,它最终落入的谷底是否仍然与它其他“被遗忘”的版本相连?而且,它们之间的路径是保持平滑,还是会变成崎岖、破碎的悬崖?

研究人员 Jiali Cheng 和 Hadi Amiri 决定通过引入一个新概念——**遗忘中的模态连通性(Mode Connectivity in Unlearning, MCU)**来探索这个问题。他们将遗忘的过程视为一场跨越地图的旅程。他们不仅仅是检查 AI 是否忘记了正确的事物,还观察了两个不同版本的“遗忘后”AI 之间的“地形”。他们发现,对于许多方法而言,路径确实是平滑的。你可以从一个“遗忘后”的模型滑动到另一个,而不会出现 AI 突然记起秘密饼干,或者失去烤蛋糕能力的情况。遗忘的景观通常是一个宽阔、平坦的谷底,而不是许多孤立的坑洞。

然而,这段旅程并不总是相同的。论文揭示了你如何教 AI 遗忘是非常重要的。如果你使用不同的训练技巧——比如改变课程学习(curriculum learning)的顺序,或者使用更复杂的数学方法(二阶优化)——你可能会进入完全不同的谷底,而这些谷底之间是不连通的。这就像是采取两条不同的路线前往同一个目的地;一条可能是平坦的高速公路,而另一条则是颠簸的土路,并通向一个完全不同的社区。

其中一个最令人惊讶的发现是,即使两个“遗忘后”的模型在纸面上看起来完全一样(它们处于同一个平滑的谷底),它们的表现却可能大相径庭。研究人员发现,虽然这些模型在标准测试中的表现相似,但它们的“隐私”水平可能会剧烈波动。一个模型可能能够抵御黑客试图诱导其记起秘密的攻击,而它的孪生兄弟在同一个谷底中却可能存在危险的数据泄露。这表明,仅仅因为一个 AI 在表现上看起来已经忘记了,并不意味着它真正安全。

该论文还揭示了遗忘过程中一个奇特的模式。遗忘并不是一次性发生的。起初,AI 会停止重复秘密的精确措辞(就像鹦鹉停止重复某个短语一样),但它仍然保留着底层的概念。只有在稍后阶段,当你进一步推进时,它才会真正失去深层知识。这就像是 AI 首先不再说“这个饼干配方是……”,但仍然知道如何去烤它,直到最终,它彻底忘记了配方。

最后,作者提出这种“平滑性”本身就是一个有用的工具。如果两个遗忘模型之间的路径是颠簸且充满障碍的,这意味着遗忘的任务非常困难;如果路径是平滑的,那么这项工作就更容易。他们甚至展示了,通过混合来自这条平滑路径上不同点的模型,你可以创造出一个超强的鲁棒 AI,使其更难被诱导重新记起那个秘密。

简而言之,这篇论文不仅告诉我们 AI 能否忘记,它还为我们提供了一张关于 AI 如何遗忘的地图。它展示了遗忘的景观是复杂的,有时平滑,有时崎岖,并且我们如何导航这一过程,会改变关于这些被遗忘后的 AI 是否真正安全可靠的一切。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →