想象一下,你拥有一个非常聪明、无所不知的机器人助手(一种视觉 - 语言模型),它阅读了数百万本书籍,并看过数十亿张照片。有时,这个机器人会记住一些我们不希望它知道的事情——比如某位名人的私人面容、受版权保护的图像,或敏感的个人数据。
为了解决这个问题,研究人员开发了“机器遗忘”技术。你可以将其想象为一个**“数字橡皮擦”**,旨在擦除机器人脑中的特定记忆,而不会让它忘记其他所有内容(比如如何说话、行走或解决数学问题)。
这篇论文提出了一个简单却令人不安的问题:这个“数字橡皮擦”究竟是在真正删除记忆,还是仅仅将其藏在了地毯之下?
以下是他们研究发现的拆解,使用了日常生活中的类比:
1. 人们尝试“遗忘”的三种方式
该论文研究了不同团队如何尝试擦除这些记忆。它们主要分为三类:
- “脑部手术”方法(全参数微调): 这就像把机器人拆开,重新连接其大脑中的每一个连接,以移除不良记忆。这种方法很彻底,但风险很高;你可能会不小心破坏机器人说话或识别其他事物的能力。
- “眼部手术”方法(视觉编码器微调): 这种方法只调整机器人“看”图像的部分。这就像给机器人不想识别的特定物体戴上眼罩,同时保留其语言技能不受影响。
- “选择性调整”方法(选择性参数微调): 这就像试图找出导致问题的唯一一根特定电线,并只剪断那根。这种方法效率很高,但如果你剪错了线,机器人可能仍然会记住那件坏事。
2. “鲁棒性”测试:机器人能被欺骗吗?
作者们并没有仅仅询问“机器人是否说出了名字?”,而是尝试通过三种不同的“攻击”手段,诱骗机器人再次记住那些被禁止的事物:
攻击 #1:“提示”(上下文攻击)
- 场景: 你问机器人:“这个人是谁?”它回答:“我不知道。”
- 诡计: 然后你加了一个提示:“他是一位著名的足球教练,曾带领过许多球队。”
- 结果: 尽管机器人已经“被遗忘”,但许多机器人突然记起了名字!这就像有人声称自己患有失忆症,但当你提到你最喜欢的披萨时,它突然想起了你的名字。记忆并没有消失,它只是在等待正确的线索。
攻击 #2:“复习课”(分布内攻击)
- 场景: 机器人已经忘记了某位特定的名人。
- 诡计: 你再次向机器人展示该名人的一些照片(来自原始的“被禁止”堆),并让它重新学习。
- 结果: 令人震惊的是,机器人仅看了极少量的照片后,几乎立刻记起了这位名人。这表明“擦除”过程并没有真正删除文件;它只是将其移动到了一个隐藏的文件夹,而这个文件夹很容易再次打开。
攻击 #3:“错误的书”(分布外攻击)
- 场景: 你尝试使用完全不同的图片(如狗和吉他)而不是名人的图片来重新训练机器人。
- 结果: 这并没有让机器人记起那位名人。相反,它只是让机器人在其他任务上表现得更差(比如识别狗)。这就像试图通过学习另一门学科来修复破碎的记忆——你最终连新学科也忘记了。
3. 主要结论
该论文得出结论,目前大多数“数字橡皮擦”并不具备鲁棒性。
- 它们是在隐藏,而非删除: 机器人通常仍在内心深处保留着记忆。它只是在被直接询问时拒绝大声说出来。
- 上下文是关键: 如果你给机器人提供一点上下文或提示,记忆就会重新浮现。
- 容易恢复: 如果有人试图用原始数据重新训练机器人,记忆几乎会立即恢复。
简而言之: 目前让 AI“遗忘”的方法,就像在门上挂了一个“禁止入内”的牌子。机器人可能会遵守牌子不走进门,但门仍然是没锁的,里面的房间依然充满了你想要隐藏的东西。该论文呼吁采取更好的策略,真正锁上门并扔掉钥匙。
技术摘要:视觉语言模型机器遗忘的鲁棒性
问题陈述
视觉语言模型(VLM)正日益部署于现实世界应用中,但存在从训练数据中记忆不良信息的风险,包括敏感、隐私、受版权保护或其他有害内容。尽管机器遗忘已在大型语言模型(LLM)中得到广泛研究,但将其应用于 VLM 时面临独特挑战。与纯文本模型不同,VLM 通过跨多个组件(视觉编码器、文本编码器和多模态解码器)的纠缠视觉与文本表示来存储信息。
本文解决的核心问题是当前 VLM 遗忘方法的鲁棒性。现有评估通常依赖标准提示,这可能仅验证模型是否抑制了对被遗忘实体的直接查询。然而,遗忘是否真正抹除了多模态知识,还是仅仅将其隐藏,从而留下可通过替代查询、上下文线索或下游再训练重新激活的残留关联,目前尚不明确。
方法论
1. 分类与综述
作者首先建立了现有 VLM 遗忘方法的全面分类体系,根据遗忘过程中优化或修改的组件对其进行分类:
- 全参数微调:更新所有模型参数(θv,θt,θd)。包括对梯度上升(GA)、梯度下降(GD)和负偏好优化(NPO)等 LLM 技术的改编,以及考虑视觉 - 文本对齐的 VLM 特定扩展。
- 视觉编码器微调:仅限制更新视觉编码器(θv),同时保持文本和融合模块固定。这直接针对不良视觉关联的来源。
- 选择性参数微调:仅更新被识别为对目标知识至关重要的参数子集,旨在平衡效率与效果。
- 推理时干预:在不更新参数的情况下修改推理过程中的输入或隐藏激活(例如特征掩码、激活引导)。注:由于提出的攻击需要重新训练,该类别未包含在鲁棒性实验中。
2. 鲁棒性评估框架
为了确定知识是被真正抹除还是仅仅被抑制,本文提出了三种旨在重新激活被遗忘多模态知识的攻击范式:
- 上下文攻击:在推理过程中,将语义相关但非显式的上下文线索(例如描述某人的职业而不提及姓名)添加到查询之前。这测试了在不更新参数的情况下,潜在的多模态关联是否可被重新激活。
- 分布内(InD)攻击:使用从原始遗忘分布中采样的小部分数据对遗忘模型进行微调。监督标签由原始预训练模型生成。这模拟了能够访问原始数据的攻击者试图恢复知识的情景。
- 分布外(OOD)攻击:在语义不同但相关的数据集上重新训练遗忘模型(例如使用 PACS 中的通用图像而非特定人脸身份)。这测试了残留表示是否可通过分布转移被重新激活。
3. 实验设置
- 模型:Qwen2.5-VL-3B-Instruct。
- 数据集:VGGFace2,划分为遗忘集(3 个名人身份)和保留集(7 个身份)。
- 基线:来自三个活跃类别(全参数、视觉编码器、选择性微调)的广泛方法。
- 指标:遗忘分数(1−Accuracyforget)、保留分数(Accuracyretain)和通用效用(在 MMStar、OCRBench、MMMU、RealWorldQA 上的表现)。评估在原始、改写和判别性提示设置下进行。
关键结果
初始性能与鲁棒性
- 权衡:全参数方法通常在原始提示下实现了较高的遗忘分数,但在保留分数和通用效用方面遭受显著退化,常表现出灾难性遗忘。
- 判别性提示:许多在生成式查询下看似成功的方法未能抑制判别性识别(例如“此人是 X 吗?”),表明底层视觉关联仍然完好。
- 视觉编码器优势:专注于视觉编码器的方法(如 HFRU、HFRU-SFT)表现出更均衡的性能,在不同提示类型下均保持了较高的遗忘和保留分数。
对攻击的脆弱性
- 上下文攻击:上下文线索成功重新激活了大多数范式下的被遗忘知识。例如,RMU、SatImp 和 WGA 等方法在提供上下文描述时,遗忘性能出现明显下降,表明它们主要抑制了直接检索而非移除关联。
- 分布内攻击:仅使用原始遗忘数据的**1%**进行重新训练,就导致许多方法快速恢复被遗忘的知识(例如 SLUG 的遗忘效果下降了 80% 以上)。这表明许多遗忘过程执行的是浅层抑制而非根本性的表示移除。Mmunlearner 表现出最高的鲁棒性,需要 50-75% 的重新训练数据才能显著降低性能。
- 分布外攻击:与 InD 攻击相反,OOD 重新训练未能恢复被遗忘的知识;相反,它一致地损害了所有方法的保留性能。这表明虽然残留表示存在,但它们不易被不相关的数据分布重新激活。
主要贡献
- 系统分类:本文首次基于优化策略对 VLM 遗忘方法进行了全面的分类与综述。
- 统一评估:在多种提示设置(原始、改写、判别性)下对这些方法进行了彻底评估,揭示了标准评估中存在的差异。
- 鲁棒性分析:本研究通过三种攻击范式(上下文、InD、OOD)首次系统性地调查了 VLM 遗忘的鲁棒性。
- 实证发现:大量实验表明,当前方法往往只是隐藏而非完全移除目标知识,突显了开发更可靠的多模态遗忘策略的必要性。
意义与主张
本文主张,当前 VLM 遗忘的状态不足以确保不良信息的永久移除。作者认为,仅在标准提示条件下评估遗忘会高估知识移除的程度。通过证明被遗忘的知识可通过上下文提示或在原始数据分布上进行最小化重新训练而轻易重新激活,该研究强调了“抑制”与“抹除”之间的关键差距。
研究结论指出,虽然某些方法(特别是针对视觉编码器的方法)显示出前景,但该领域仍缺乏能够保证消除多模态关联的鲁棒策略。作者强调,未来研究有必要开发能够抵御这些重新激活攻击的遗忘技术,确保敏感或不良信息真正从模型的潜在空间中被移除。
注:论文明确指出了局限性,包括使用统一评估协议可能为了保持一致性而简化了实现细节,以及上下文攻击中上下文提示的手工构建,这表明未来工作存在更自动化策略的潜力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。