← 最新论文
🤖 AI

Obliviate: Efficient Unlearning in Recommender Systems

本文提出了 Obliviate,一种用于推荐系统的两阶段高效遗忘框架,该框架利用低秩遗忘适配器(Low-Rank Unlearning Adapter)和局部感知校准(Locality-Aware Calibration),在以极低计算成本实现高完整度移除用户数据及其影响的同时,保持推荐质量。

原作者: Tushar Prakash, Brijraj Singh, Niranjan Pedanekar, Narayan Chaturvedi

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Tushar Prakash, Brijraj Singh, Niranjan Pedanekar, Narayan Chaturvedi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座巨大且繁忙的图书馆里,每一本书都是关于人们喜好的信息。图书管理员(算法)多年来研读了每一本书,以精准掌握你接下来可能喜欢什么。他们如此出色,以至于能以惊人的准确度预测你下一首喜欢的歌曲或电影。但问题在于:有时,你会希望管理员忘记你曾经借阅过的某本书。也许你是误点,或者只是改变了主意。在现实世界中,像“被遗忘权”这样的法律规定,如果你要求他们忘记,他们必须照办。

问题在于,这些管理员已经读了太多的书,以至于每一本书都与其他书籍交织在一起。要忘记其中一本书,旧的方法是把整个图书馆扔掉,从头开始,重新阅读所有剩余的书籍。这就像为了移除一本落满灰尘的卷册而烧毁整个图书馆;这既耗时又昂贵。科学家们一直试图寻找一种“魔术橡皮擦”,能够抹除单个记忆而不破坏大脑的其他部分,但之前的尝试要么速度太慢、太混乱,要么让管理员忘记得“太多”,从而破坏了他们推荐好东西的能力。

这就是名为 Obliviate 的新方法。它以著名巫师系列中的一个消除特定记忆的咒语命名,该研究提出了一种巧妙的两步走策略,使推荐系统能够快速、干净地忘记特定的用户数据,而无需从头开始重新训练整个模型。

问题所在:“重读”陷阱

在推荐系统(如 YouTube 或亚马逊)的世界里,模型通过观察用户与物品之间的数百万次交互来进行学习。当一个用户说,“请删除我的账号及所有数据”时,系统必须移除该用户历史记录的影响。最可靠的方法是删除数据并从零开始重新训练模型。然而,对于庞大的系统而言,重新训练需要数天甚至数周的时间,并且成本高昂。

现有的方法试图提高速度。有些方法将图书馆分成许多小房间(分片),仅重新阅读包含已删除数据的房间,但这往往会破坏图书馆不同部分之间的联系。另一些方法则尝试利用数学来估算单个用户对模型造成的影响,并尝试将其逆转。但这些“逆向数学”技巧通常很慢,因为它们需要复杂的计算,或者过于激进,以至于破坏了模型向其他人推荐事物的能力。

解决方案:两阶段魔术技巧

论文作者提出了 Obliviate,这是一种像外科手术式橡皮擦而非大锤一样的方案。它通过两个截然不同的阶段来移除被删除数据的“记忆”,同时保持模型的通用知识。

第一阶段:“低秩遗忘适配器”(LUA)
可以将推荐模型想象成一台拥有数百万个齿轮的巨大、复杂的机器。当一个用户被删除时,并不是说每一个齿轮都需要移动;只有与该用户历史记录相关的几个特定齿辉需要轻微移动。

Obliviate 的第一阶段使用了一个聪明的捷径。它并没有尝试重新计算每一个齿轮的位置(这很慢),而是使用了一个“曲率代理”(curvature proxy)。想象一下这是一张地图,它告诉系统哪些方向的齿轮应该移动,以抵消被删除用户的影响,而无需进行繁重的重新训练工作。

至关重要的是,这一阶段不会触及整个机器。它构建了一个轻量级的“适配器”(一个低秩模块),安装在现有模型之上。这个适配器就像是一组新的、轻量级的齿轮补丁,只移动受删除用户影响的特定部分。它有效地将模型推回到添加该特定用户数据之前的状态,但它是通过仅调整参数的一个极小的、低维度的切片来实现的。这使得过程极其迅速。

第二阶段:“局部感知校准”(LAC)
这里有一个棘手之处:有时当你试图抹除一段记忆时,你可能会不小心让图书管理员变得笨拙。第一阶段可能会移除坏的记忆,但也可能略微削弱模型向其他人推荐事物的能力。

为了修复这一点,第二阶段充当了一次温柔的调优过程。它获取带有新“适配器”的模型,并进行一次非常短暂、集中的训练过程。但它并不再次使用整个图书馆。相反,它使用一个微小的“见证集”(witness set),这个集合包括:

  1. 被删除的数据(以确保它确实被遗忘了)。
  2. 一些“硬负样本”(用户肯定不喜欢的物品,以保持排序逻辑的敏锐度)。
  3. 一个小的缓冲库,包含保留下来的安全数据(以提醒模型如何向其他人推荐事物)。

在这一阶段,模型被教导将删除的项推向列表底部(使其变得不可见),同时使用一种称为“蒸馏”(distillation)的技术来复制原始模型的良好习惯。这确保了模型在忘记特定用户的同时,依然记得如何成为其他人的优秀推荐者。

研究发现

研究人员在多个真实数据集上测试了 Obliviate,包括 MovieLens(电影)、Amazon(购物)和 Yelp(本地业务)。他们模拟了一个场景:要求系统忘记 20% 用户 的数据,这与以往通常只删除 1% 或 5% 的测试相比,是一个非常高的比例。

结果令人印象深刻:

  • 速度: Obliviate 比尝试从头开始重新训练模型的方法快了多达 3 倍。在某些情况下,它比旧的“分片”方法快了数百倍。例如,在一个数据集中,重新训练需要超过 1,900 秒,而 Obliviate 完成任务仅用了约 57 秒。
  • 质量: 模型不仅忘记了数据,而且依然保持着出色的工作能力。事实上,在某些数据集上,遗忘后的模型表现甚至优于原始模型,这表明移除被删除数据的“噪声”实际上有助于优化推荐。
  • 完整性: 他们测量了“降级率”(Demotion Rate),用于检查被删除的项是否现在排在随机项之后。Obliviate 成功地将删除项显著地压低了排名,比其他方法做得更好,证明了记忆确实被抹除了。

核心结论

这篇论文表明,我们不需要为了移除一本书而烧毁整个图书馆。通过使用一种聪明的两步走方法——首先对齿轮进行快速、有针对性的调整,然后利用一小组示例对系统进行温柔的调优——我们可以高效地让推荐系统忘记特定的用户数据。这使得系统保持快速、廉价且符合隐私法规,同时确保它依然知道如何推荐下一部精彩的电影或产品。作者指出,虽然他们的方法依赖于关于模型行为的某些数学假设,但他们的实验表明该方法在实践中运行得非常好,为大数据时代的隐私保护提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →