想象一下,你有一个非常聪明的医学生,他记住了成千上万个患者的故事。这个学生很擅长回答问题,但问题在于:其中一些患者要求将他们的故事从学生的记忆中彻底抹除,以保护隐私(例如“被遗忘权”)。
挑战在于:你如何让这个学生只忘记那些特定的故事,而不让他忘记其他所有内容,或者让他变成一个思维混乱的废人?
这篇论文介绍了一个名为 AMNESIA 的大规模全新测试套件,旨在测试目前的计算机程序(AI 模型)是否真的能够实现这种“选择性遗忘”。
以下是他们所做的工作以及他们的发现,使用了简单的类比:
1. 测试:AMNESIA
把以往针对 AI 遗忘能力的测试看作是使用虚构的、编造的故事或非常小的群体。这就像是用玩具车在停车场里测试驾驶员停车的能力。它无法告诉你驾驶员是否能处理繁忙街道上的真实卡车。
AMNESIA 是一个现实世界的测试。
- 数据: 他们使用了 8,820 份真实的、匿名的患者病历(类似于医学日志),涵盖了 11 种不同的疾病(如癌症、心脏病等)。
- 问题: 他们将这些笔记转化为了 70,560 个问题。
- 事实性问题: “患者服用了什么药物?”(直接记忆)。
- 推理性问题: “为什么医生根据这些症状选择了那种药物?”(建立逻辑联系)。
- 目标: 观察 AI 是否能在记住如何治疗某种疾病的通用知识的同时,“忘掉”特定的患者。
2. 实验:两种遗忘方式
研究人员测试了四种不同的“遗忘方法”(算法)在两种不同场景下的表现:
场景 A:“随机洗牌”
- 设置: 他们要求 AI 随机忘记 5% 到 25% 的患者,就像从帽子里随机抽名字一样。
- 结果: AI 惨败。
- “顽固型”AI: 一些方法试图去遗忘,但无论如何都会继续记住所有内容。
- “损坏型”AI:* 其他一些方法成功实现了遗忘,但代价是破坏了 AI 的大脑。它开始输出胡言乱语,或者不断重复同一个词。它忘记了患者,但也忘记了如何当一名医生。
场景 B:“疾病组”
- 设置: 他们不再是随机抽取名字,而是告诉 AI 忘记所有患有特定疾病的患者(例如:“忘记所有患有癌症的人”)。
- 结果: 这变得更有趣了。
- 随着 AI 忘记越来越多的癌症患者,AI 确实开始忘记这些患者的具体细节。
- 然而,AI 也开始忘记如何进行通用的癌症治疗。因为所有癌症患者都共享相似的医学知识,擦除一组患者会侵蚀 AI 帮助剩余癌症患者的能力。这就像是从教科书中擦掉所有关于“癌症”的页面;你无法在删除某个患者的故事时,又不影响关于该疾病的章节。
3. 隐藏的危险:“泄露”
论文引入了一种新的检查隐私泄露的方法。想象一下,AI 被要求忘记一位在心脏里放置了“支架”的患者。
- 测试: 即使 AI 没有给出完整的故事情节,它是否会在回答一个新问题时,不小心掉出了“支架”这个词?
- 发现:
- 一些看起来“遗忘”得很好的方法实际上存在零泄露(它们没提到“支架”),但这仅仅是因为它们在输出乱码。
- 其他保持了 AI 智能的方法仍然会泄露特定的医学术语。这就像是 AI 说:“我不记得那个患者了,但我提到了支架,”这证明它仍然知道那个秘密。
4. 核心结论
论文得出了一个令人清醒的现实检查:
- 现有工具尚未准备好: 我们现有的方法要么不起作用(AI 记住了太多),要么会搞坏 AI(AI 变得不再有用)。
- “共享知识”问题: 在医学领域,患有相同疾病的患者是相互关联的。你很难在不伤害该疾病整体知识库的情况下,轻易地抹除其中一个人的信息。
- “新问题”陷阱: 即使 AI 忘记了它训练过的特定问题,它通常仍能回答关于该患者的新问题,因为底层的底层信息仍然存在。
简而言之: AMNESIA 是一个巨大的、现实的压力测试,它表明我们目前还没有一种安全的方法,能让医疗 AI 在不破坏其帮助其他患者的能力的前提下,实现对特定个人的“遗忘”。我们需要更聪明、更先进的工具,能够将一个人的故事与其所属的共享医学事实区分开来。
技术摘要:AMNESIA
问题陈述
医学知识是动态变化的,这要求具备在不进行全量重训的情况下,更新或选择性删除已训练大语言模型(LLM)中信息的能力。这种被称为“机器遗忘”(machine unlearning)的能力,对于遵守隐私法规(如 GDPR 的“被遗忘权”)以及纠正错误的医疗记录至关重要。然而,现有的遗忘基准测试依赖于合成数据或小规模通用领域任务,导致临床领域的遗忘研究仍处于空白状态。目前的方法缺乏针对医学问答(QA)的标准评估,而在医学问答中,区分“忘记特定患者的数据”与“保留共享临床知识”是一个复杂的课题。
方法论
作者引入了 AMNESIA,这是首个大规模、开源的医学遗忘基准测试。该方法涵盖了数据集构建、基准设计及评估指标:
- 数据集构建: 该数据集包含 70,560 个问答(QA)对,这些问答对源自来自 PMC-Patients-v2 的 8,820 份去标识化患者笔记。这些笔记涵盖了 11 个疾病类别(如癌症、心血管疾病、传染性/免疫性疾病)。
- QA 生成: 为每位患者生成 8 个 QA 对:4 个事实性问题(测试直接召回)和 4 个推理问题(测试跨多个发现的临床推理)。
- 验证: 通过使用三个 LLM(MedGemma、Qwen、GPT-5-Mini)和一个生物系学生标注员组成的“人机协同”评估小组,对疾病标签和 QA 质量进行了验证,并达到了高度的一致性。
- 数据划分: 该基准支持两种遗忘场景:
- 随机患者级(Random Patient-Level): 随机选择患者的子集(5% 到 25%)进行遗忘。
- 疾病级(Disease-Level): 选择具有特定疾病类别的患者进行遗忘,以测试模型在遗忘特定病症的同时保留其他病症知识的能力。
- 创建一个包含每个患者未见 QA 的留出集(Holdout Set),以评估泛化能力。
- 基座模型与遗忘方法: 基准测试使用 LLaMA 3-8B 作为基座模型,该模型在患者笔记上进行了预训练,并在 QA 对上进行了微调。评估了来自 OpenUnlearning 框架的四种代表性遗忘方法:
- RMU: 将遗忘集输入的内部表示转向随机目标。
- GradDiff: 通过梯度上升,在最大化遗忘集损失的同时最小化保留集的损失。
- KL-Min: 使用遗忘集的梯度上升结合 KL 散度正则化,以保留保留集的输出。
- SimNPO: 将被遗忘样本视为负偏好,且无需参考模型。
- 注: 为了提高效率并与前人工作保持一致,遗忘操作被选择性地应用于模型的第 7 层。
- 评估指标:
- 标准指标: 保留集上的模型效用(MU)和遗忘集上的答案遗忘效能(AFE),通过 ROUGE、精确匹配(EM)、余弦相似度(CS)和蕴含得分(ES)的调和平均值计算。Token 熵(TE)和退化得分(DS)用于衡量输出崩溃情况。
- 新颖指标: 疾病关键词泄露(LS)。该指标量化了模型输出中疾病特定医学术语(通过 scispaCy 提取并与种子列表匹配)的重新出现情况,旨在解决即便 AFE 很高但特定术语依然存在的隐私违规问题。
核心贡献
- 首个大规模临床基准: AMNESIA 提供了来自 8,820 名患者、涵盖 11 个疾病类别的 70,560 个 QA 对,区分了事实召回与临床推理。
- 多层级评估: 它引入了疾病级遗忘场景,超越了随机患者拆分,旨在分析遗忘如何影响共享医学知识。
- 全面分析: 本文评估了四种不同的遗忘方法,揭示了它们在临床环境中的局限性。
- 领域特定泄露指标: 引入了针对疾病的关键词评估,以检测医学术语的泄露,这是一个关键的医疗隐私问题。
- 开源发布: 数据集、代码和训练好的模型均公开发布,不受限制。
结果与分析
- 随机患者级遗忘: 现有方法表现极其挣扎。
- RMU 和 SimNPO 保持了较高的模型效用(MU),但未能有效实现遗忘(低 AFE),表明它们并未擦除患者信息。
- KL-Min 和 GradDiff 实现了高 AFE,但以牺牲模型效用为代价,通常导致模型崩溃(产生重复、不连贯的输出)而非选择性擦除。
- 留出集评估: 模型倾向于遗忘特定的训练 QA,而非底层的患者笔记,因为它们无法回答关于同一患者的未见问题。
- 疾病级遗忘:
- 遗忘具有相同疾病的患者揭示了一种权衡:随着遗忘集规模的增加,AFE 得到改善,但对于具有相同疾病的保留患者,其 MU 会大幅下降。这表明,移除特定病症的关键规模患者会侵蚀模型在该病症下的共享临床知识。
- KL-Min 和 GradDiff 展示了疾病针对性遗忘(保留了对非目标疾病患者的效用),但仍会对同病种保留患者的效用造成损失。
- 关键词泄露:
- 即使 AFE 表现适中,RMU 和 SimNPO 等方法仍表现出显著的疾病特定术语泄露(泄露率 10–25%)。
- KL-Min 和 GradDiff 实现了近乎零的泄露,但这归因于它们产生了不连贯的输出(高退化得分),而非成功的、安全的遗忘。
- 在疾病级拆分中,随着遗忘集规模的增长,泄露程度降低,这与共享医学知识的侵蚀相关联。
意义与主张
本文声称 AMNESIA 揭示了当前遗忘方法在应用于医学数据时的关键局限性。作者断言:
- 现有方法不足: 它们要么未能有效遗忘,要么通过模型崩溃来实现遗忘,这两者在临床应用中都是不可接受的。
- 患者与知识的分离: 遗忘个体患者往往会侵蚀其他患有相同病症患者的知识,这凸显了分离患者特定数据与共享临床知识的难度。
- 隐私风险: 高 AFE 并不能保证隐私;模型仍可能泄露特定的医学术语,或者允许通过改写查询来恢复信息。
- 对专门技术的需求: 这些发现强调了开发医学专用遗忘技术的必要性,即在不损害共享医学知识效用的前提下,擦除患者信息。
作者总结道,AMNESIA 是推动该领域发展的必要基准,同时也谦虚地承认了其局限性,例如对基于答案层级指标的依赖、仅使用单一基座模型,以及将共病简化为单一疾病类别的做法。他们明确指出,所评估的模型均未经过临床验证。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。