Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning
本文提出了随机元遗忘(Stochastic Meta-Unlearning, SMU),这是一个利用视觉语言模型(VLM)层级反馈来优化语言骨干网络遗忘的双层框架,有效解决了仅靠文本反馈无法防止视觉语言模型中目标恢复的问题,同时实现了更优的遗忘-保留权衡与迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它既能读懂书本,也能观察图片。这个机器人由两个主要部分组成:一个理解语言的“大脑”(就像一个非常先进的文本阅读器)和一个观察世界的“摄像头”。它们组合在一起,被称为视觉语言模型(VLM)。它们能为我们提供巨大的帮助,但有时,我们需要让它们忘记某些特定的东西——也许是一个私密的秘密、一个有害的思想,或者一个学到的错误。这个过程被称为“机器遗忘”(machine unlearning)。
把“遗忘”想象成尝试从你朋友的大脑中抹去一段特定的记忆,但又不想删除他的整个个性,或者让他忘记如何说话或看世界。如果你只是告诉机器人:“忘掉那个故事”,当你和它交谈时,这可能效果很好。但这里有一个棘手的部分:如果你给机器人看一张与那个故事相关的图片,它可能会突然再次想起那个故事!这是因为机器人的“大脑”和“摄像头”连接得如此紧密,以至于图片可能会触发那段试图被抹除的记忆。科学家们正在努力研究如何确保无论你如何提问——无论是通过文字、图片,还是两者结合——都能让机器人忘掉那些不好的东西。
这篇论文解决的正是一个这样的谜题。研究人员注意到一个令人惊讶的故障:如果你试图仅通过文本让机器人忘记某些东西,当稍后向它展示一张图片时,这种尝试往往会失败。仅靠文本的“遗忘”强度不够,无法阻止图片唤回那段记忆。为了解决这个问题,他们发明了一种巧妙的新训练方法,称为随机元遗忘(Stochastic Meta-Unlearning, SMU)。
SMU 不仅仅是根据文本教机器人遗忘,而是像一位观察整个团队的严格教练。它是这样运作的:教练首先要求“语言大脑”仅使用文本来忘记特定的事物(内循环)。但随后,教练并没有仅仅检查文本是否消失了,而是立即向机器人展示一张图片并问道:“你还记得吗?”(外循环)。如果机器人因为这张图片而记起了那个坏事,教练就会回到最初,调整训练的“起点”,使得下次大脑尝试遗忘时,即使在涉及图片的情况下,也能更好地阻断记忆。
论文指出,这种“两步走”的方法比以往的方法要好得多。当他们在真实的机器人大脑(使用 Qwen 和 InternVL 等模型)以及模因(meme)数据集(如“仇恨模因”和“新冠模因”)上进行测试时,结果令人印象深刻。与现有的最佳方法相比,SMU 使机器人回忆起被遗忘目标的概率平均降低了 10.52 分(分数越低代表遗忘效果越好)。与此同时,它保持了机器人通用知识的强大能力,使其对其他事物的记忆能力提升了 20.10 分,通用测试得分提升了 17.01 分。
更酷的是,研究人员发现这种方法具有灵活性。它不仅适用于他们训练过的特定坏记忆,还能处理它从未见过的新坏记忆。它甚至在改变用于教机器人遗忘的具体规则时依然有效。这表明,通过在训练机器人大脑时考虑到“整个团队”(文本和图像),我们创造了一种更可靠、更具适应性的方式,让 AI 能够忘记它不该知道的东西,而不会破坏它所知道的其他一切。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。