← 最新论文
🤖 machine learning

When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks

本文介绍了 MUTE,这是一种用于自我改进联邦智能体网络中可靠数据删除的方法,它通过评估下游影响、隔离高风险保留轨迹以及审计行为以防止影响再生,从而有效地缓解了被遗忘数据的持久性“影响回声”,同时保留了任务效用。

原作者: Zihao Ding, Jun Huang, Liang Dong

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihao Ding, Jun Huang, Liang Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下一群正在学习如何协作做家务的小型、有益的机器人。它们不是由云端的一个巨大大脑控制,而是每个机器人根据自己的经验进行学习,并将学到的知识分享给其他机器人。这被称为联邦学习(Federated Learning)。这就像一群朋友在为考试复习:他们各自阅读不同的书籍,写下自己的笔记,然后交换摘要以变得更聪明,而无需向老师展示他们凌乱且私密的笔记本。

现在,想象这些机器人是“自我改进型”的。它们并不仅仅是在考试后停止学习;它们会持续工作,收集关于哪些做法有效或无效的新故事,并将这些故事反馈给群体,从而变得更加出色。这就是自我改进网络(Self-Improving Network)。但这里有一个棘手的部分:如果其中一个朋友说:“嘿,我想被遗忘!请删除我所有的笔记,并确保我从未影响过群体的最终答案。”在普通的教室里,你只需撕掉那些页面即可。但在这种机器人集群中,那个朋友旧的笔记可能已经改变了其他机器人收集新笔记的方式。如果你只是删除了那个朋友的笔记,却保留了受其启发而产生的新笔记,那么那个朋友的“幽灵”可能仍在徘方群体的脑海中徘徊。这篇论文探讨了如何在不破坏整个系统的情况下,真正地抹除那个幽灵。


问题所在:无法消逝的“回声”

研究人员在这些智能机器人网络中发现了一个关于删除数据的隐蔽问题。通常,当有人要求被遗忘时,系统会尝试通过在没有该人数据的情况下重新训练模型来进行“重训”。作者称之为“重训(retraining)”方法。

但在一个自我改进的网络中,这种简单的修复手段失效了。原因如下:机器人的行为就像池塘中的涟漪。当一个特定的机器人(我们称之为“Rover”)以某种方式行动时,它会改变其他机器人接下来看到和学习的内容。如果 Rover 在已经影响了群体之后才被删除,那么其他机器人可能已经基于 Rover 的旧行为收集了新数据。

论文将此称为**“影响回声(Influence Echo)”**。即使你删除了 Rover 的原始数据,Rover 行为的“回声”仍会活在其他机器人收集的新数据中。如果你只是在剩余数据上重新训练模型,模型仍然会无意中从 Rover 的回声中学习。被遗忘的行为会卷土重来,就像一个死不掉的僵尸。作者通过模拟证明,其他机器人从 Rover 那里学习得越多,这种回声就越强,这种“僵尸”行为回归的可能性也就越大。

解决方案:MUTE(消除遗忘轨迹的回声)

为了解决这个问题,团队提出了一种名为 MUTE 的新方法。请记住,MUTE 不仅仅是一个简单的橡皮擦,它更像是一个侦探、一个隔离员,同时也是一名保安。

1. 侦探(追踪回声):
首先,MUTE 需要知道回声躲在哪里。由于机器人不能将所有私密数据发送到中央服务器(那会破坏隐私),服务器保留了一个轻量级的“账本”——一个简单的日志,记录了哪个机器人何时运行了哪个版本的“大脑”。当删除请求到来时,服务器会重放这个日志,以计算每个机器人收集的数据的**“影响得分(Influence Score)”**。这就像是在问:“这条新笔记在多大程度上依赖于 Rover 的旧笔记?”如果一条新笔记深受 Rover 的影响,它就会得到高分。

2. 隔离(屏蔽回声):
一旦识别出高分数据,MUTE 并不会直接删除它们(因为这可能会损害机器人的工作能力)。相反,它采用了两管齐下的攻击方式:

  • 模型清洗: 原本拥有该数据的机器人会更新自己的“适配器(adapter)”(大脑中一个小型且高效的部分),专门用于忘记那种不需要的行为,使用的是一种叫做“负偏好优化(Negative Preference Optimization)”的技术。这就像是告诉机器人:“不要再做那个特定的动作了。”
  • 数据隔离: 其他机器人检查它们自己的数据。如果它们拥有具有高“影响得分”的笔记(意味着这些笔记深受被删除机器人影响),MUTE 会将这些笔记放入隔离区。它们不会被删除,但在未来的训练中会被忽略。有些笔记甚至会被赋予较低的权重,就像告诉老师:“读一下这条笔记,但不要让它像其他笔记那样重要。”

3. 保安(审计与调度):
清理工作在一次之后并未结束。网络在持续学习,因此回声可能会试图溜进来。MUTE 扮演着保安的角色,不断审计系统。它会检查“僵尸”行为是否正在回归(通过一个被称为**“影响再生率(Influence Regeneration Rate)”**的指标来衡量)。如果保安发现该行为正在悄悄回归,它会安排更多的清理行动,但它会小心翼用,以保持在“通信预算”之内——确保机器人不会因为过多的数据流量而应接不暇。

研究发现

团队使用了一个名为 LIBERO 的基准测试来测试 MUTE,该测试涉及机器人根据语言指令操纵物体。他们使用了两种不同的机器人“大脑”(MiniVLA 和 π0\pi_0),并测试了三个层级的删除:删除单条路径(轨迹)、删除整个机器人数据(客户端)以及删除整个任务类型(任务)。

结果非常理想。在他们的模拟实验以及使用 Jetson 计算机(类似于功能强大的微型机器人电脑)进行的物理测试中,MUTE 成功地阻止了“僵尸”行为的回归。

  • 低泄漏率: 系统“记住”被删除数据的能力降到了接近随机水平(得分接近 0.5),这意味着数据已被有效地遗忘了。
  • 无再生现象: 与简单的重训方法(其中被遗忘的行为会回归)不同,MUTE 使**影响再生率(IRR)**保持在极低水平。例如,在一次使用 MiniVLA 大脑的测试中,使用 MUTE 的再生率仅为 0.085,而标准重训方法为 0.178
  • 高效性: MUTE 在通信成本方面也更具优势。虽然标准的重训方法需要上传大量数据(对于 MiniVLA 约为 234.6 个单位的流量),但 MUTE 仅需约 53.39 个单位。它通过只发送小型、有针对性的更新,而不是从头开始重新训练整个系统,实现了这一目标。

论文指出,虽然简单的重训在这些自我改进网络中会失效,但 MUTE 提供了一种可靠的方法来真正删除数据。它证明了你可以在不破坏网络学习新事物能力的前提下,移除被遗忘数据的“回声”,同时比尝试从头开始使用更少的带宽。作者指出,这是一个基于模拟和物理测试平台的结果,表明该方法在实践中是有效的,但它仍然是针对这类特定类型的自我改进机器人网络的专门化解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →