← 最新论文
🤖 machine learning

Inference-Time Machine Unlearning via Gated Activation Redirection

GUARD-IT 是一种新颖的无需训练的数据遗忘方法,它在推理阶段采用输入依赖的门控激活重定向,以有效移除记忆数据,同时在量化和持续学习场景中保持模型的效用与鲁棒性,其表现优于传统的基于梯度的方法。

原作者: Vinícius Conte Turani, Otávio Parraga, João Vitor Boer Abitante, Kristen K. Arguello, Joana Pasquali, Ramiro N. Barros, Flavio du Pin Calmon, Christian Mattjie, Rodrigo C. Barros, Lucas S. Kupssinskü

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Vinícius Conte Turani, Otávio Parraga, João Vitor Boer Abitante, Kristen K. Arguello, Joana Pasquali, Ramiro N. Barros, Flavio du Pin Calmon, Christian Mattjie, Rodrigo C. Barros, Lucas S. Kupssinskü

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、博览群书的图书管理员(即 AI 模型),他 memorized 了数百万本书。有时,你需要这位管理员“遗忘”特定的故事——或许是因为它们包含隐私信息、受版权保护的材料,或者仅仅是你想删除的事实。

传统做法就像是把管理员的整个大脑取出来,进行开胸手术,试图外科手术般地切除那些承载特定记忆的具体神经元。这种方法风险高、成本昂贵,而且常常导致管理员陷入困惑,无法记住其他任何内容,或者开始胡言乱语。

本文介绍了一种名为GUARD-IT的新方法。它不是切除大脑的一部分,而是像一位智能交通指挥员,站在管理员的桌前进行调度。

以下是其工作原理,使用简单的类比说明:

1. “全局”引导的问题

此前尝试的“激活工程”(在不重新训练 AI 的情况下改变其思考方式)就像是在管理员的桌上放了一块“禁止提及”的牌子,且该牌子对所有人都适用。如果你告诉管理员“不要谈论 X 作者”,他们确实会停止谈论 X 作者,但也可能意外地停止谈论任何听起来与 X 作者稍有相似之处的人。此外,由于这块“禁止提及”的牌子过于生硬,他们甚至可能开始用一种怪异、机械的方式说话。

2. GUARD-IT 的解决方案:“智能闸门”

GUARD-IT 的不同之处在于,它不为所有人使用同一块巨大的牌子,而是使用一个智能闸门(即“相似性网关”)。

  • 步骤 1:记忆分组(离线阶段)
    在管理员开始工作之前,团队将所有需要移除的书籍按主题分类整理成不同的堆(例如:“堆 A:法国诗人”,“堆 B:19 世纪传记”)。他们为每一堆创建特定的“反记忆”指令。你可以将这些视为针对每个主题的特定“禁止谈论”卡片。

  • 步骤 2:交通检查(在线阶段)
    当用户提出问题时,智能闸门会首先检查该问题。

    • 如果问题涉及随机主题(例如“天气怎么样?”),闸门会判定“无匹配”,管理员则正常作答。此时,“禁止谈论”卡片永远不会被触碰。
    • 如果问题涉及特定主题(例如“告诉我关于 X 作者的事”),闸门会识别该主题,抓取该堆对应的特定“禁止谈论”卡片,并将其应用。

3. “魔法旋转”(保持范数的旋转)

一旦闸门选中了正确的“禁止谈论”卡片,GUARD-IT 并不会粗暴地将管理员的大脑推向新方向,而是执行一次完美的旋转

想象管理员的思维是一个旋转的陀螺。

  • 旧方法试图将陀螺推倒,这通常会导致它摇晃并倒下(导致 AI 产生胡言乱语或“乱码”)。
  • GUARD-IT 则轻柔地旋转陀螺,使其指向新方向,但保持旋转速度完全不变。这确保了管理员保持平衡和流畅,只是谈论的内容有所不同。

4. 为什么这很重要

本文声称,GUARD-IT 解决了其他方法面临的三大难题:

  • 无需“脑部手术”:它不需要重新训练模型或更改其永久权重。这就像给管理员一套临时指令,而不是重新布线他们的大脑。
  • 能够经受“压缩”:在现实世界中,AI 模型通常会被缩小(量化),以便在手机上运行或在更便宜的服务器上部署。传统方法在模型缩小后往往会失效,就像一件精致的雕塑在紧密打包时碎裂一样。GUARD-IT 即使在模型被压缩时也能完美运行,因为它操作的是信息的流动,而非那些沉重、静态的权重。
  • 能够处理“持续”请求:如果你下周需要移除一本新书,你无需重做整个手术。你只需向堆中增加一张新的“禁止谈论”卡片即可。管理员可以处理无尽的移除请求,而不会感到困惑或忘记无关的事实。

总结

简而言之,GUARD-IT 是一种无需训练、无需梯度的方法,可使 AI“遗忘”特定内容。其实现方式如下:

  1. 将需要遗忘的内容按类别排序。
  2. 检查用户的问题是否匹配某个类别。
  3. 如果匹配,则对 AI 的思维施加一次温和、精确的“旋转”,将其引离禁忌主题。
  4. 如果不匹配,则让 AI 正常作答。

这种方法使 AI 保持智能、流畅且安全,既没有破坏其“大脑”的风险,也无需昂贵的重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →