← 最新论文
💻 computer science

Privacy Preserving Disease Prediction Across Multiple Hospitals Using CKKS Based Homomorphic Federated Learning

本文提出了一种基于 CKKS 的同态联邦学习框架,通过对模型更新进行加密以防止成员推理攻击,从而实现跨多家医院的隐私保护疾病预测,尽管这种增强的安全性是以显著的通信开销和相比于明文方法降低的预测效用为代价的。

原作者: Swatee Nikam, Nilima Kulkarni

发布于 2026-09-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Swatee Nikam, Nilima Kulkarni

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代医学世界中,医生预测患者未来健康状况的能力往往取决于他们所能获取的数据广度。机器学习算法——即通过从模式中学习的计算机程序——正成为识别如住院再入院或疾病进展等风险的强大工具。然而,这些工具的效能取决于其输入的信息质量。问题在于,这些信息(包含患者敏感细节的电子健康记录)散落在数千家医院中,受到严格的隐私法和机构规则的限制。医院无法简单地将原始患者文件共享给一个中央机构来构建更好的模型,否则会违反对患者的信任并触犯法律法规。

为了解决这个问题,研究人员开发了一种称为联邦学习的方法。想象一群厨师,每个人都拥有一份秘密的家族食谱。他们不需要将食谱送到一个可能被窃取或复制的中央厨房,而是同意在本地烹饪菜肴,仅将最终的味道发送给一位中央评审员。评审员通过结合这些味道来创造出一份大师级食谱,然后将这份食谱发回给厨师们进行下一次尝试。在这个数字版本中,“食谱”是数据,“厨师”是医院,而“味道”则是计算机模型的数学更新。原始患者数据从未离开过医院。然而,即使是这种方法也存在缺陷:传回的“味道”有时会泄露过多关于特定原料的信息,使得好奇的观察者能够猜出哪些患者曾参与了训练集。为了修复这一问题,科学家们正在探索一种称为同态加密的技术,它允许在保持数据处于数字保险箱锁定的状态下进行计算,确保即使是进行合并的人也无法看到原始数字。

位于印度浦那的麻省理工学院工程学院的一个研究小组最近在旨在模拟十家医院网络的虚拟环境中测试了这一概念。他们的目标是观察是否可以构建一个机器学习模型,用于预测糖尿病患者是否会在三十天内再次入院,同时保持患者数据的完全隐藏以及模型更新的加密状态。他们使用了一种被称为 CKKS 的特定数字锁,这种技术允许对加密数字进行近似数学运算,因为医疗数据通常涉及小数和分数而非仅仅是整数。

研究人员使用一个包含来自 130 家真实医院记录的公开数据集设置了一个虚拟实验,并将该数据集切分为十个部分,以代表十个不同的机构。每个虚拟医院在其本地数据上训练各自版本的预测模型。在标准的非加密场景下,这些医院会将模型更新直接发送到中央服务器。然而,在这个新实验中,医院首先使用 CKKS 方法将更新锁在数字保险箱内。中央服务器充当“诚实但好奇”的协调者,接收这些锁定的数据包。它在从未解锁单个贡献的情况下完成了求平均值的数学运算。只有在平均完成后,最终结果才会被发送给一个受信任的方进行解锁,并用于更新全局模型。

实验结果揭示了隐私与性能之间明显的权衡关系。当研究人员在不使用加密的情况下运行相同任务时,系统表现得极其高效,能够以极高的准确度正确识别再入院风险。模型学习迅速,并能产生可靠的预测。然而,在这种非加密状态下,系统是脆弱的;攻击者可以通过观察更新,成功猜出特定患者的数据是否属于训练集,从而打破了隐私承诺。

当研究人员开启加密功能时,隐私保护正如预期的那样发挥了作用,针对所研究的具体攻击路径。系统将攻击者猜测患者数据是否在训练集中的能力降低到了随机概率的水平,达到了恰好百分之五十的成功率,这等同于抛硬币的结果。这一发现与针对“诚实但好奇”服务器的评估协议所提供的保护是一致的,尽管这并不保证能免疫所有的隐私攻击或所有的对抗性条件。医院数据保持了真正的私密性,中央服务器看到的只是锁定的数字。

然而,这种隐私是以显著的代价换取的。加密系统的速度慢得多,且需要通过网络传输更多的数据。从每家医院发送的数据包大小增长了二十四倍,这意味着每一轮训练的通信流量从约 3 MB 跳升至近 38 MB。此外,模型的预测能力也明显下降。虽然非加密模型在正确识别再入院方面取得了高分,但加密版本却显得力不从心,其区分患者是否会再次入院的能力降至了一个虽优于随机猜测、但在临床决策中却远不够实用的水平。模型也需要更长的时间才能趋于稳定,在试图从锁定的数据中学习时表现出更多的波动行为。

研究结论指出,虽然利用这种方法构建用于多医院疾病预测的隐私保护系统在技术上是可行的,但它目前还不是一个完美的解决方案。该技术成功阻止了研究人员测试的特定隐私泄露,但它是通过使系统变得更加沉重且准确性降低来实现的。研究人员发现,对于这种特定的设置,预测质量的损失和数据传输需求的巨大增加是实质性的障碍。他们建议,若要使这种方法在现实世界中发挥作用,未来的工作必须专注于减小加密数据的规模,并提高模型在面对数字锁时有效学习的能力。在此之前,在高度准确但存在隐私风险的模型与完美隐私但准确性较低的模型之间做出选择,仍然是医疗机构难以平衡的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →