← 最新论文
🤖 AI

Protecting patient privacy in clinical foundation models: Technical and legal perspectives

本文提出了一个实用的、具备上下文感知能力的框架,通过结合技术与法律策略来应对模型介导的数据泄露问题,从而评估并缓解临床基础模型的隐私风险,因为现有的法规(如 HIPAA 和 GDPR)对这些间接威胁提供的指导十分有限。

原作者: Sana Tonekaboni, Lena Stempfle, Sasha Ronaghi, Corinna Coupette, I. Glenn Cohen, Emily Alsentzer, Marzyeh Ghassemi

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Sana Tonekaboni, Lena Stempfle, Sasha Ronaghi, Corinna Coupette, I. Glenn Cohen, Emily Alsentzer, Marzyeh Ghassemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你制造了一个超级聪明的机器人厨师。你喂给它数百万个食谱和来自世界各地的烹饪视频,让它能够学会制作从汤到舒芙蕾的一切。现在,你想让人们使用这个机器人来辅助烹饪。但问题在于:因为这个机器人学习得太深入了,它可能会在无意中记住并端上一份来自某个受训者的特定家族私密食谱,甚至可能泄露出某个人的最爱菜肴曾出现在其训练书籍中。这不仅仅是机器人偷取一个文件的行为,而是关于机器人通过其“行为”泄露了它本不该知道的秘密。这就是医疗领域中“基础模型”的世界。这些庞大的 AI 系统是在海量患者数据(如医疗笔记、X 光片和实验室结果)的基础上训练而成的,旨在帮助医生诊断疾病、预测健康风险并制定治疗方案。虽然这些工具有望彻底改变医学,但它们也带来了一种隐蔽的新型隐私风险。这不仅仅是黑客入侵数据库的问题,而是 AI 本身即使在原始数据已去除了姓名和地址的情况下,仍可能通过其回答来“泄露”敏感细节。核心问题在于:我们如何在不将这些强大的工具锁起来的前提下,确保它们的安全?

这篇由来自麻省理工学院、斯坦福大学和哈佛大学等机构的研究人员撰写的论文,正是在解决这个问题。他们认为,现有的隐私规则(如美国的 HIPAA 和欧洲的 GDPR)就像是为汽车编写的老旧交通法,而我们现在驾驶的是自动驾驶火箭。这些法律侧重于在数据进入 AI 之前 进行保护,但它们并不真正了解 AI 在训练完成后可能意外泄露信息的奇特方式。

为了解决这个问题,作者提出了一种使用简单两部分图谱来思考隐私风险的新方法。想象一个坐标轴,一侧询问:“提问者已经知道了多少信息?”另一侧则询问:“AI 泄露了多少敏感信息?”

  • “先验知识”轴: 有时,你不需要知道任何信息就能诱导 AI 泄露秘密(例如,要求它“编一个故事”,而它却意外地讲述了一个真实的患者故事)。而有时,你需要给 AI 一个微小的线索,比如某种特定的药物名称或一种罕见的症状,才能引导它透露更多关于某个人的细节。
  • “泄露信息”轴: 在另一侧,AI 可能会提供一些可以与某人建立联系的信息(例如一种罕见的疾病模式),或者它可能会提供直接识别某人的信息(例如姓名或特定的电话号码)。

作者利用这张图谱观察了六种不同的“泄露场景”,以展示出错的情况。例如:

  1. “模仿者”场景: 一个在脑部扫描图像上训练的 AI 被要求生成一张通用的图像,但它却意外地吐出了一张几乎完美的真实患者扫描图,其中包含了可能识别出该患者的独特特征。
  2. “回忆录”场景: 用户要求 AI 为特定类型的患者写一份医院记录,而 AI 由于记住了训练集中的一份真实记录,写出了几乎完全相同的叙述,从而泄露了患者从未公开分享的隐私细节。
  3. “自动补全陷阱”: 一位医生正在为患者 A 编写记录,AI 建议的后续计划却包含了患者 B 的姓名和电话号码,因为它产生了混淆,从错误的记忆中提取了信息。
  4. “成员泄露”: 一名研究人员向 AI 提问,并注意到其行为表现出一种异常的一致性,这种一致性证明了那些特定的患者数据被用于训练该模型,即便没有显示姓名。

论文指出,这些风险在“本地”环境(即医院将其 AI 保存在自己的安全服务器上)和“公共”环境(即任何人都可以通过网络使用该 AI)中都是真实存在的。他们发现目前的法律有些模糊。例如,在美国,如果医院在训练 AI 之前去除了姓名,他们可能会认为自己符合 HIPAA 的规定。但作者指出,如果 AI 仍能被诱导泄露该特定人的数据,那么医院实际上可能拥有“实际知情权”,意识到数据并非真正匿名,这可能会引发预料之外的法律问题。同样,在欧洲,规则规定数据必须是“可识别的”才能受到保护,但作者认为,即使你无法立即识别出那个人,如果 AI 揭示了一种可能导致身份识别的罕见症状组合,这仍然属于隐私泄露。

那么,解决方案是什么?作者并没有声称有一种万能药能瞬间解决所有问题。相反,他们建议结合技术和法律手段。在技术方面,他们建议进行更好的测试(例如“红队测试”,即通过黑客尝试破坏 AI 来寻找漏洞)、使用数学方法限制 AI 的记忆程度(称为“差分隐私”),以及在 AI 发布后不断对其进行检查,以确保它没有开始泄露秘密。在法律方面,他们认为我们需要更新规则,使其关注 AI 使用的“语境”,而不仅仅是数据本身。他们建议公司和医院需要更加谨慎地对待数据共享和模型训练,或许需要引入新型的合同或监管机制。

最终,论文表明,我们不能仅仅依赖“隐藏姓名”这一传统观念来保护患者。随着 AI 变得越来越聪明并融入我们的生活,我们需要一种更聪明、更灵活的方式来衡量风险。这就像是意识到,锁好前门固然重要,但你也需要检查窗户、地下室,并确保邻居们不会无意中喊出你的秘密。作者希望,通过使用他们的新型“风险图谱”,我们可以在享受医疗 AI 带来的巨大益处的同时,确保患者的私人生活保持私密。他们承认,法律环境仍在变化之中,例如欧盟的《人工智能法案》等新法正试图跟上步伐,但核心信息很明确:在面对 AI 隐私问题时,我们需要未雨绸缪,而非仅仅是亡羊补牢。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →