← 最新论文
🤖 machine learning

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

本综述针对视觉、语言、音频和视频模态,提出了一个统一的、面向系统的多模态遗忘方法、数据集及基准分类法,旨在解决从基础模型中选择性移除敏感或受版权保护的信息,同时保留其整体效用的挑战。

原作者: Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你构建了一个超级聪明、超级有创造力的机器人朋友,它能同时画画、写故事、唱歌和制作视频。这个机器人通过阅读整个互联网进行学习,但在学习过程中,它不小心记住了一些不该记住的东西:也许是邻居的一张私人照片,也许是一位著名艺术家的版权画作,又或者是某个奇怪且不安全的笑话。

现在,邻居想要那张照片被遗忘,艺术家想要他们的风格被抹除,而互联网希望那个笑话消失。过去解决这个问题的方法是删除错误数据并从头开始重建机器人——但这就像为了移除一块裂开的砖头而拆掉整座摩天大楼一样——既耗时、又昂贵,而且完全不切实际。

这篇论文是一份大规模的综述(一份关于当前格局的巨大地图),它探索了一种更聪明、更高效的解决方法:多模态遗忘(Multimodal Unlearning)。与其重建整个机器人,这些方法试图进行“选择性遗忘”,即通过外科手术式地移除那些坏记忆,同时让机器人的绘画、写作和歌唱能力保持完好无损。

大地图:我们在哪里动刀?

作者通过一个“以系统为先”的视角来组织所有的不同方法。他们不仅仅关注数学,还关注你在机器人的大脑中何时以及何处进行干预。他们发现了五个主要的“手术”位置:

  1. 数据端(在机器人学习之前): 想象一下,在机器人看到那些糟糕的照片或文本之前,先给它们贴上一个“禁止学习”的标签。有些方法会对数据进行微调,使机器人无法记住它,或者清理训练库,以移除那些被“污染”的图像与文字配对。
  2. 训练时编辑(在机器人学习的过程中): 这就像是在机器人学习时教它一条新规则。你告诉它:“嘿,当你看到这个特定事物时,不要记住它,但要记住其他所有东西。”机器人会调整其大脑权重,以在忘记目标的同时保留其余部分。
  3. 架构约束(改变机器人的硬件): 有时,我们不是改变规则,而是改变机器人的结构。你可能会“冻结”(锁定)大脑的某些部分使其无法改变,或者“剪枝”(切除)持有特定坏记忆的特定连接,然后让机器人在留下的空隙周围重新学习好的内容。
  4. 免训练遗忘(神奇橡皮擦): 这是最酷的部分。这些方法不需要重新训练机器人。它们利用数学方法直接编辑机器人的大脑权重或其内部表示(即它“思考”事物的方式),只需一步即可完成。这就像使用一种特定的化学溶剂来溶解掉坏墨水,而不触及纸上的其他部分。
  5. 解码时(在表演期间): 想象机器人正在画一幅画。就在最后一秒,在图像出现之前,一个过滤器介入并说:“不,不要画那张特定的脸。”机器人的大脑保持不变,但输出被引导远离了禁忌内容。

游戏规则

论文非常明确地说明了这些方法试图实现什么目标,以及它们不是在做什么。

  • 目标: 主要目标是选择性移除。你希望忘记一个特定的“遗忘集”(比如一张私人的脸或一种受版权保护的风格),同时让“保留集”(其他所有事物)完美运行。论文在数学上定义了这一点:遗忘后的机器人表现应该几乎与一个从未在坏数据上进行过训练的机器人完全一致。
  • 排除项: 论文明确反对仅仅删除数据并期望机器人自动遗忘的想法。它表明知识是分布在机器人大脑中的;删除源文件并不等于抹除了记忆。它还指出目前的各种方法并不完美。它们通常是启发式的(基于尝试、错误和聪明的猜测),而不是拥有证明记忆已百分之百永久消失的铁律数学证明。
  • “遗忘”与“隐藏”的陷阱: 论文指出,某些方法可能只是在隐藏坏信息,而不是真正的删除。如果用正确的“对抗性”问题(比如越狱攻击)去试探机器人,被遗忘的记忆可能会再次浮现。论文指出,虽然我们有很多方法,但我们目前还没有保证能够实现 100% 的遗忘,尤其是在面对巧妙的攻击时。

工具箱:数据集与基准测试

为了测试这些方法,研究人员使用了特定的“训练场”。论文列出了许多用于此类研究的数据集:

  • 针对人脸: 他们使用像 CelebA(202,599 张图像)和 VGGFace2(330 万张面部图像)这样的数据集,来测试机器人是否能忘记某个特定的人脸。
  • 针对版权: 他们使用 UnCanvas(60 种艺术风格)来观察机器人是否能忘记某种特定的艺术家风格。
  • 针对安全性: 他们使用 I2P 数据集(4,700 个提示词)来测试机器人是否能忘记如何生成不安全或不当的内容。
  • 针对音频: 他们使用 VoxCeleb1(150,000 条语音)来测试机器人是否能忘记某个特定的说话者声音。

论文强调了我们拥有用于衡量这些方法效果的基准测试(如 MU-BenchMLLMU-Bench)。这些基准测试检查三件事:

  1. 它真的遗忘了吗?(机器人是否无法识别那个坏的东西?)
  2. 它保留了好的部分吗?(机器人在处理其他事物时的绘画和写作能力是否依然出色?)
  3. 它安全吗?(黑客能否通过诱导让机器人重新想起那个坏的东西?)

现实检查:还有哪些问题没解决?

作者坦诚地指出了差距。他们认为,尽管我们有很多酷炫的工具,但我们仍处于“早期阶段”。

  • 没有神奇的保证: 大多数方法都是模拟的,或者仅在特定模型上进行测试。我们还没有一个通用的数学证明可以断言:“无论如何,这种方法总能永久删除记忆。”
  • “复现”问题: 论文指出,在生成式模型(如图像创建器)中,被遗忘的概念可能会在稍后进行微调或有人使用巧妙提示词时重新浮现。这就像忘记了一首歌,但听到类似的旋律时又想起来了。
  • 权衡关系: 通常存在一种权衡。你试图遗忘得越彻底,就越可能损害机器人在执行其他任务时的能力。论文指出,仅仅删除极小部分的数据有时也会导致其他任务性能出现可测量的下降。
  • 跨模态泄漏: 如果你教会机器人忘记图像中的一张脸,它是否也会忘记文本描述中的那张脸?论文指出,这是一个巨大的开放性挑战;一种模式(文本)下的安全性并不总是意味着另一种模式(图像)下的安全性。

总结

这篇论文是一篇综述,这意味着它是一份关于当前现状的全面指南,而不是一项单一的新发明。它将“如何让 AI 遗忘”这一混乱的过程整理成了一个清晰的系统。它表明,我们拥有强大的工具对 AI 模型进行“手术”,但我们仍在摸索如何让这种手术变得 100% 可靠、对黑客免疫,并且在不损坏机器人大脑其余部分的前提下做到完美。

作者正在发布一个精选的代码库(一个公开的代码和数据集合),以帮助他人在此基础上进行开发。他们充满希望,认为通过绘制出这些问题(例如对更好基准测试和更强保证的需求)的地图,我们最终可以构建出既尊重隐私和版权,又无需在每次有人要求被遗忘时都从头重建的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →