← 最新论文
🤖 machine learning

A Model Merging Approach for Continual MLLM Unlearning

本文介绍了 MCU,一种通过将多个单次(one-shot)遗忘适配器动态集成到统一模型中,以通过跨任务依赖管理来减轻干扰并保持效用,从而有效应对持续多模态遗忘挑战的模型合并方法。

原作者: Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你构建了一个超级聪明的机器人朋友,它能看图、读文,还能就几乎任何话题进行聊天。这个机器人是一个“多模态大语言模型”(MLLM)。它才华横溢,但有时会学到一些不该学的东西——比如私密秘密、受版权保护的故事或过时的事实。在人工智能领域,人们越来越需要教会这些机器人如何“遗忘”特定的不良或敏感信息,同时又不让它们忘记原本掌握的所有知识。这就像是试图从一件心爱的毛衣上去除一个特定的污渍,而不让整件衣服缩水或破坏其图案。

长期以来,科学家们尝试通过在每次需要擦除新信息时都按下机器人的大脑“重置”键来进行处理。但问题在于,如果你不断地按下重置键,机器人会变得困惑。它可能会忘记你刚刚要求它遗忘的东西,或者更糟的是,它可能会开始忘记那些它应该保留的东西,比如如何讲笑话或识别一只猫。这被称为“遗忘反弹”(unlearning rebound)和“留存漂移”(retention drift)。随着你试图修复它的次数增加,机器人变得越来越不像个机器人了。这篇论文解决了这样一个棘手的难题:当面对一个漫长且无穷无尽的待删除秘密列表时,如何保持机器人的洁净与敏锐。

于是,MCU(用于持续遗忘的合并技术,Merging for Continual Unlearning)登场了,这是由研究员 Yuhang Wang 及其团队提出的一种巧妙的新方法。与其不断重写机器人的大脑(这会导致上述的混乱和损伤),MCU 将每一次“遗忘请求”视为一份独立的、微小的说明书。想象一下你有一叠便利贴,每张都在告诉机器人要遗忘不同的秘密。旧的方法会尝试将这些便利贴一张接一张地粘贴到机器人的大脑上,最终导致大脑上覆盖着一层混乱且冲突的纸片。

MCU 则采取了一种更组织化、更有序的方法。它收集所有的这些“便利贴”(研究人员称之为“适配器”,adapters),并在将其应用于机器人之前,将它们融合为一张单一且完美的指令表。魔法发生在她混合这些笔记的方式中。研究人员发现,这些“遗忘笔记”并非孤立存在的;它们之间其实会相互交流。有时,两份笔记会互相协作以更好地实现遗忘(协同作用/synergy);但有时,它们也会互相争斗并抵消彼此(干扰/interference),或者在抹除坏记忆的同时,不小心也抹除了好的记忆。

为了解决这个问题,MCU 扮演了像“大师级厨师混合食材”的角色。首先,它观察这些笔记并只保留最重要的部分,丢弃掉那些微弱、模糊的涂鸦(这被称为“主导方向选择”/dominant direction selection)。然后,它会检查是否有单份笔记声音太大,盖过了其他笔记,并温柔地调低其音量(这是“通道容量控制”/channel capacity control)。最后,也是最重要的一步,它会对笔记进行重新排列,使有益的笔记能够协同工作,而相互冲突的笔记则被隔离开来,确保它们不会破坏机器人的其他技能。

团队在两个主要的基准测试——ICU-BenchMLLMU-Bench 上测试了该方法,这两个基准测试就像是 AI 遗忘能力的巨大障碍赛场。他们进行了实验,让机器人连续执行多达 100 次遗忘任务。结果令人印象深刻。当其他方法随着列表增长而逐渐崩溃(要么忘记了好的东西,要么无法成功遗忘坏的东西)时,MCU 依然保持稳定。例如,在对 Qwen2-VL-7B 模型进行 100 次任务后,MCU 成功将“遗忘”分数(意味着成功擦除了坏信息)降至约 28.7,同时保持“留存”分数(即保持其通用智能的能力)高达 75.6。相比之下,其他方法的留存分数显著下降,或者其遗忘效果变得无效。

该论文指出,通过智能地合并这些遗忘指令,而不是按顺序逐一应用,我们可以防止机器人在多次删除操作后产生“脑雾”。这是一种让 AI 记忆保持洁净、思维保持敏锐的方法,证明了你并不需要通过损坏机器来修复它的记忆。作者展示了这种方法无需从头开始重新训练整个模型即可奏效,这使其成为在一个隐私和版权至关重要的世界中,保持 AI 安全且与时俱进的实用工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →