← 最新论文
📊 statistics

Extending Kernel Trick to Influence Functions

本文提出了一种影响函数的双重表示,其规模取决于数据集大小而非模型大小,为估计数据移除对大型可线性化模型的影响提供了一种高效替代方案,但代价是需要一个规模随模型输出维度与数据集大小乘积而增长的矩阵。

原作者: Zhenhuan Sun, Shahrokh Valaee

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenhuan Sun, Shahrokh Valaee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《将核技巧扩展至影响函数》的解释。

核心难题:“黑盒”与“撤销”按钮

想象你训练了一个非常智能的 AI(机器学习模型)来识别猫和狗。你喂给它海量的照片库让它学习。现在,假设一位用户说:“嘿,我想从你的记忆中删除那张我的狗的照片。我想让你彻底忘记它,就像你从未见过它一样。”

在 AI 领域,这被称为机器遗忘(Machine Unlearning)。其目标是移除特定数据点的影响,使模型表现得完全如同从未包含该数据而从头重新训练过一样。

实现这一目标的标准方法使用一种名为**影响函数(Influence Functions)**的数学工具。你可以把这个工具想象成一副“放大镜”,试图精确计算出那张特定照片在多大程度上改变了模型的“大脑”。

其中的难点:
对于小型模型,这副放大镜运作良好。但对于现代巨型 AI 模型(如那些编写代码或生成艺术的模型),其“大脑”过于庞大(拥有数十亿个参数),试图计算这种影响就像试图数清海滩上的每一粒沙子,以看出一粒沙子如何影响潮汐。这耗时太长且需要过多的计算能力。现有方法之所以陷入困境,是因为它们试图解决一个随模型规模增长而变大的数学问题。

解决方案:新视角(“对偶”视图)

这篇论文的作者 Zhenhuan Sun 和 Shahrokh Valaee 提出了一个巧妙的捷径。他们说:“与其从模型大脑(非常庞大)的角度来看待问题,不如从数据集(通常较小)的角度来看待。”

他们称之为对偶表示(Dual Representation)

类比:厨师与食谱书

想象 AI 模型是一位厨师(模型),而训练数据是一本食谱书(数据集)。

  • 旧方法(参数空间): 为了看看移除一道食谱如何改变厨师的烹饪风格,旧方法试图分析厨师整个的大脑、肌肉和记忆。如果这位厨师是一位拥有庞大头脑的世界级名人,这将极其缓慢且昂贵。
  • 新方法(对偶/Alpha 空间): 作者们说:“等一下。厨师只根据他们读过的食谱来改变烹饪方式。如果我们有 1,000 道食谱,而厨师非常庞大,那么分析这1,000 道食谱实际上比分析厨师的大脑要快得多。”

通过将数学重心从模型的内部权重(厨师的大脑)转移到数据点之间的关系(食谱)上,他们可以更快地计算出“撤销”效果。

工作原理:“线性”捷径

这种新方法依赖于一个特定条件:模型必须是**“可线性化”(Linearizable)**的。

这是什么意思?
想象一条复杂蜿蜒的山路。如果你非常近距离地放大那条路的微小一段,它看起来完全笔直。

  • 可线性化模型: 这些模型在训练期间,“道路”不会剧烈扭曲和转弯。模型保持接近其起点,因此为了计算方便,我们可以假装这条路是直的(线性的)。
  • 技巧: 作者们使用了一种名为**神经切线核(Neural Tangent Kernel, NTK)**的数学工具。你可以把 NTK 想象成一张地图,描述了每个数据点如何与每个其他数据点交流。他们不再追踪模型复杂的内部变化,而只是追踪数据点在这张地图上如何相互影响。

结果:速度 vs. 精度

论文在两种场景下测试了这种新方法与旧方法的对比:

  1. 速度: 当模型非常巨大(如巨型神经网络)但数据集相对较小时,新方法要快得多。这就像穿过公园抄近道,而不是绕着整个城市街区走。

    • 类比: 如果你有一个拥有 10,000 本书(数据)的图书馆,而图书管理员的大脑有行星那么大(模型),让图书管理员为了一本书重新计算记忆需要永恒的时间。但如果你只是查看书单并看看它们如何相互关联,你就能很快弄清楚。
  2. 精度: 新方法产生的结果与旧方法(以及从头重新训练模型)几乎完全相同。使用这个新捷径,“厨师”遗忘食谱的效果同样有效。

  3. “无限”情况: 论文还表明,这种方法适用于理论上无限宽(拥有无限参数)的模型。在这种情况下,旧方法根本无法使用,但新方法完美运作,因为它只关心数据,而不关心模型大小。

局限性(细则)

作者诚实地指出了这个技巧不适用的地方:

  • 它仅适用于“可线性化”模型: 如果模型过于混乱,或者在训练期间其“大脑”发生剧烈变化(例如模型偏离起点太远),这种直路近似就会失效。
  • 它需要一张大地图: 要使用这个捷径,你必须创建一张巨大的地图(NTK 矩阵),将每个数据点与每个其他数据点连接起来。如果你的数据集非常庞大(数百万张照片),创建和存储这张地图会变得昂贵,就像原始问题一样。

总结

简而言之,这篇论文介绍了一种从 AI 模型中“遗忘”数据的新方法。与其试图解开 AI 庞大而复杂的大脑(这很慢),不如查看数据点之间的关系(这更快)。这是一种数学上的“视角转换”,使得机器遗忘对于大型模型变得可行,前提是模型的行为在一定程度上是可预测且线性的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →