← 最新论文
💻 computer science

Privacy-Preserving Detection of Rare Disease-Associated Cell Subsets via Secure Multi-Party Computation

本文提出了一种安全多方计算框架,该框架能够在基于秘密共享单细胞数据的情况下,实现 CellCnn 模型的隐私保护训练与推理,从而使各机构能够在不泄露敏感患者信息的前提下,高精度地协作检测与罕见疾病相关的细胞亚群。

原作者: Ş. Selcan Magara, Esther Havemann, Debora Jutz, Ali Burak Ünal, Mete Akgün

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ş. Selcan Magara, Esther Havemann, Debora Jutz, Ali Burak Ünal, Mete Akgün

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在我们体内的微观世界中,健康与疾病往往取决于隐藏在数百万个细胞中的极少数特定细胞。想象一下要在广袤的沙滩上寻找一粒独特的沙子;这就是科学家在试图寻找预示白血病早期阶段或病毒感染的稀有细胞群时所面临的挑战。现代技术赋予了研究人员同时测量数千个个体细胞上数十种蛋白质的能力,从而绘制出一幅高分辨率的免疫系统图谱。然而,正是这些使发现成为可能的极其敏感的数据,也具有深刻的个人属性。它能揭示一个人的疾病状态、免疫史,甚至遗传倾向。由于这种敏感性,严格的隐私法规定医院不得直接与其他机构共享其患者数据。这造成了一个令人沮理解的瓶颈:为了可靠地寻找这些稀有细胞,科学家需要利用大规模、多样化的患者群体来训练计算机模型,但法律不允许他们合并所需的这些数据。

一支研究团队现在开发出了一种解决这一难题的新方法,允许各医院在从不接触彼此原始患者数据的情况下,就寻找这些稀有细胞展开协作。他们的工作聚焦于一种名为 CellCnn 的特定人工智能类型,该模型旨在识别这些稀有的细胞亚群。研究人员构建了一个安全系统,让多台计算机能够共同处理一个共享的数学问题,同时保持数值的隐匿。他们通过将每一件数据拆分为随机且无意义的碎片,并将其分发到不同的计算服务器来实现这一点。这些服务器对这些碎片进行复杂的计算以训练人工智能,仅在彼此之间进行通信以合并结果。在任何时刻,没有任何一台单一的服务器,甚至连研究人员本身,能够看到原始的患者信息或计算的中间步骤。该系统的设计确保了最终结果与数据公开合并时的准确度几乎一致,同时确保了每个个体的隐私完好无损。

该团队在涉及巨细胞病毒感染和急性髓系白血病的真实数据集上测试了他们的方法。在这些测试中,他们将这种安全系统与标准的非隐私版本的人工智能以及之前的一种注重隐私的尝试进行了对比。结果显示,他们的安全方法识别疾病相关细胞的精度几乎与标准方法相当。例如,在寻找与病毒感染相关的细胞时,他们的系统达到了约 73% 的准确率,这与非隐私版本几乎完全相同。相比之下,之前的隐私保护方法由于必须简化人工智能的“大脑”以配合加密工作,表现明显较差,准确率下降到了 63% 左右。新系统能够保留人工智能的复杂部分,例如有助于计算机学习模式的激活步骤,而旧方法则不得不舍弃这些部分。

除了分类之外,研究人员还证明了他们的安全系统还可以处理一项更困难的任务:精确估算样本中存在多少稀有癌细胞。这对于监测处于微小残留病状态的患者至关重要,因为医生需要知道治疗后是否仍残留极少量的癌细胞。该安全系统预测稀有细胞比例与真实值的相关性达到了 0.98,这一性能水平非常接近标准的非隐私模型。这种能力是之前的隐私保护方法完全无法实现的。研究人员还测量了处理过程所需的时间,指出在本地网络上训练模型大约耗时 20 分钟,尽管运行速度很大程度上取决于计算机之间的连接带宽。

这项研究证实,可以在不损害患者隐私的情况下,利用敏感数据训练强大的医疗人工智能模型。通过使用一种将数据以秘密碎片而非整体形式进行共享的技术,研究人员表明,医院可以在不违反隐私法规的情况下进行有效的协作。虽然目前的系统假设计算服务器会遵守规则且不偏离协议,但这项工作为未来的医学研究奠定了坚实的基础。它指明了一条前进的道路:即可以利用众多医院的集体力量来检测罕见疾病,同时确保每个患者的私人细节在整个过程中都处于完全隐藏的状态。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →