← 最新论文
💬 NLP

From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models

本文提出了 MAGE 框架,通过仅利用轻量级用户锚点构建记忆图并合成监督信号,实现了无需访问原始训练语料且可审计的大语言模型无监督遗忘。

原作者: Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 MAGE 的新方法,旨在解决大语言模型(LLM)中一个非常棘手的问题:如何让用户“被遗忘”,而不需要用户自己提供一堆敏感数据,同时还能保证模型不被“误伤”或“被欺骗”。

我们可以把大语言模型想象成一个博学的图书管理员,它读过互联网上几乎所有的书,因此记住了很多信息,包括一些不该记住的隐私或版权内容。

1. 传统方法的困境:把“遗忘清单”交给管理员

现状:
以前,如果你想让管理员“忘掉”关于你的一切(比如你的生日、住址),你必须亲自写一份详细的“遗忘清单”(Forget Set),把涉及你的所有句子都列出来,交给管理员。

风险(就像图 1 展示的那样):

  • 隐私泄露风险: 你为了“被遗忘”,不得不把敏感信息再次上传给管理员。万一管理员系统被黑客攻击,或者管理员自己手滑,你的隐私就二次泄露了。
  • 被欺骗的风险: 坏人可以提交一份假的“遗忘清单”。比如,他们想让你(管理员)忘掉别人的隐私,或者在清单里藏一个“后门”,让管理员以后一听到某个词就发疯。
  • 难以审核: 管理员很难判断你给的清单里是不是真的只有你的事,还是混进了别人的秘密。

2. MAGE 的解决方案:只要一个“名字”,剩下的我来找

MAGE 提出了一种**“用户最小化、无需语料库”**的新范式。

核心比喻:侦探与记忆地图

想象一下,你(用户)只需要给管理员(模型)一个**“锚点”**(比如你的名字"Taylor Swift"),然后说:“请忘掉关于我的一切!”

这时候,MAGE 就像一个超级侦探,它不需要你提供清单,而是直接钻进管理员的脑子里(模型参数)去“挖”记忆:

  1. 内部记忆挖掘(Internal Memory Mining):

    • 侦探拿着你的名字,问模型:“提到 Taylor Swift,你会想到什么?”
    • 模型回答:“美国歌手、1989 年出生、爱写歌……"
    • 侦探继续追问:“提到‘美国歌手’,你还会想到什么?”
    • 就这样,侦探像剥洋葱一样,一层层地向外扩展,把模型里所有和你名字强关联的记忆都找出来。
  2. 构建“记忆地图”(Memory Graph):

    • 侦探把这些找到的碎片信息画成一张加权地图
    • 如果模型非常确定某件事(比如“Taylor Swift 是歌手”),这条线就画得很粗(权重高)。
    • 如果模型只是偶尔提到(比如“她喜欢猫”),这条线就画得细一点。
    • 这张地图就是模型真正记住关于你的东西的完整画像。
  3. 生成“针对性监督”(Scoped Supervision):

    • 侦探根据这张地图,自动生成一份完美的“遗忘练习题”
    • 遗忘题(Forget Set): “谁在 2014 年发布了《Blank Space》?”(答案应该是“我不知道”)。
    • 保留题(Neighbor Set): 为了防止误伤,侦探还会生成一些相似但无关的题目。比如“谁在 2014 年发布了《New York》?”(答案是 Ed Sheeran)。这告诉模型:“忘掉 Taylor Swift,但别把 Ed Sheeran 也忘了。”

3. 为什么 MAGE 很厉害?

  • 不用你提供敏感数据: 你只需要说个名字,不用上传任何隐私文件。这就像你告诉警察“我想注销我的账号”,警察自己去查系统,而不是让你把身份证复印件发给他们。
  • 防作弊、可审计: 因为遗忘的内容是模型自己“回忆”出来的,而不是用户提交的,所以坏人很难通过提交假清单来搞破坏。
  • 效果一样好: 实验证明,用 MAGE 自己生成的“遗忘练习题”去训练模型,效果和使用外部专家提供的完美清单几乎一样好。模型真的忘了你,但其他能力(比如写诗、做题)没受影响。

4. 总结

MAGE 就像是一个“记忆橡皮擦”:

  • 以前: 你要自己把要擦掉的字写下来,交给橡皮擦,风险很大。
  • 现在(MAGE): 你只需要指一下那个字(提供名字),MAGE 就会自动扫描整个页面,精准地找到所有相关的笔迹,画出一个“记忆地图”,然后生成一套专门的指令,让橡皮擦只擦掉关于你的部分,而保留整张纸的其他内容。

这种方法既保护了用户的隐私(不用上传敏感数据),又防止了系统被恶意利用,让“被遗忘权”在人工智能时代变得真正可行且安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →