在我们体内的微观世界中,健康与疾病往往取决于隐藏在数百万个细胞中的极少数特定细胞。想象一下要在广袤的沙滩上寻找一粒独特的沙子;这就是科学家在试图寻找预示白血病早期阶段或病毒感染的稀有细胞群时所面临的挑战。现代技术赋予了研究人员同时测量数千个个体细胞上数十种蛋白质的能力,从而绘制出一幅高分辨率的免疫系统图谱。然而,正是这些使发现成为可能的极其敏感的数据,也具有深刻的个人属性。它能揭示一个人的疾病状态、免疫史,甚至遗传倾向。由于这种敏感性,严格的隐私法规定医院不得直接与其他机构共享其患者数据。这造成了一个令人沮理解的瓶颈:为了可靠地寻找这些稀有细胞,科学家需要利用大规模、多样化的患者群体来训练计算机模型,但法律不允许他们合并所需的这些数据。
一支研究团队现在开发出了一种解决这一难题的新方法,允许各医院在从不接触彼此原始患者数据的情况下,就寻找这些稀有细胞展开协作。他们的工作聚焦于一种名为 CellCnn 的特定人工智能类型,该模型旨在识别这些稀有的细胞亚群。研究人员构建了一个安全系统,让多台计算机能够共同处理一个共享的数学问题,同时保持数值的隐匿。他们通过将每一件数据拆分为随机且无意义的碎片,并将其分发到不同的计算服务器来实现这一点。这些服务器对这些碎片进行复杂的计算以训练人工智能,仅在彼此之间进行通信以合并结果。在任何时刻,没有任何一台单一的服务器,甚至连研究人员本身,能够看到原始的患者信息或计算的中间步骤。该系统的设计确保了最终结果与数据公开合并时的准确度几乎一致,同时确保了每个个体的隐私完好无损。
该团队在涉及巨细胞病毒感染和急性髓系白血病的真实数据集上测试了他们的方法。在这些测试中,他们将这种安全系统与标准的非隐私版本的人工智能以及之前的一种注重隐私的尝试进行了对比。结果显示,他们的安全方法识别疾病相关细胞的精度几乎与标准方法相当。例如,在寻找与病毒感染相关的细胞时,他们的系统达到了约 73% 的准确率,这与非隐私版本几乎完全相同。相比之下,之前的隐私保护方法由于必须简化人工智能的“大脑”以配合加密工作,表现明显较差,准确率下降到了 63% 左右。新系统能够保留人工智能的复杂部分,例如有助于计算机学习模式的激活步骤,而旧方法则不得不舍弃这些部分。
除了分类之外,研究人员还证明了他们的安全系统还可以处理一项更困难的任务:精确估算样本中存在多少稀有癌细胞。这对于监测处于微小残留病状态的患者至关重要,因为医生需要知道治疗后是否仍残留极少量的癌细胞。该安全系统预测稀有细胞比例与真实值的相关性达到了 0.98,这一性能水平非常接近标准的非隐私模型。这种能力是之前的隐私保护方法完全无法实现的。研究人员还测量了处理过程所需的时间,指出在本地网络上训练模型大约耗时 20 分钟,尽管运行速度很大程度上取决于计算机之间的连接带宽。
这项研究证实,可以在不损害患者隐私的情况下,利用敏感数据训练强大的医疗人工智能模型。通过使用一种将数据以秘密碎片而非整体形式进行共享的技术,研究人员表明,医院可以在不违反隐私法规的情况下进行有效的协作。虽然目前的系统假设计算服务器会遵守规则且不偏离协议,但这项工作为未来的医学研究奠定了坚实的基础。它指明了一条前进的道路:即可以利用众多医院的集体力量来检测罕见疾病,同时确保每个患者的私人细节在整个过程中都处于完全隐藏的状态。
技术摘要:基于安全多方计算的稀有疾病相关细胞亚群隐私保护检测
问题陈述
检测与稀有疾病相关的细胞亚群(例如微小残留病中的白血病原始细胞,或巨细胞病毒感染中的特定 NK 细胞亚群)对于理解疾病进展至关重要,但在技术上具有挑战性,因为其频率极低(低至 0.01%)。虽然名为 CellCnn 的卷积神经网络(CNN)架构在从高维单细胞质谱流式数据中识别这些群体方面已展现出成功,但其应用受限于数据稀缺性。鲁棒的模型训练需要大规模、多样化的患者队列,而单一机构通常无法独立组建此类队列。然而,单细胞数据具有高度敏感性,会泄露疾病状态和遗传易感性,这使得在严格的隐私法规(如 GDPR 和 HIPAA)下进行跨机构数据共享变得困难。现有的隐私保护解决方案(如使用同态加密的 PriCell)施加了架构约束——具体包括移除 ReLU 激活函数、偏置项(bias terms)和回归能力——以适应多项式电路预算,从而降低了模型的表达能力和准确性。
方法论
作者提出了一个安全多方计算(MPC)框架,能够在完全基于秘密共享(secret-shared)数据的条件下,实现 CellCnn 的端到端训练与推理。该系统在半诚实安全模型及诚实多数假设下运行,采用三方设置:两个计算代理(P0,P1)和一个辅助方(P2)。
- 数据表示: 数据所有者(医疗机构)将其单细胞测量值拆分为两个在环 Z264 上的随机加法份额,并将一个份额分别发送给两个代理。任何一方都无法观察到原始明文数据。
- 计算: 代理执行本地加法,并利用由辅助方提供的 Beaver 三元组进行乘法交互。实值计算通过定点算术处理。
- 架构适配: 为了在适配 MPC 环境的同时保留 CellCnn 的完整表达能力,作者替换了特定的非多项式操作:
- 优化器: 将需要除法/平方根的 Adam 优化器替换为带有动量的小批量随机梯度下降(mini-batch SGD)。
- 激活函数: 在卷积层中保留了 ReLU 激活函数(原生支持),并使用平均池化(mean pooling)以避免安全比较。
- 输出头: 将标准的 softmax/交叉熵头替换为通过三阶最小二乘多项式逼近的逐类 sigmoid 函数。对于回归任务,实现了一个基于 tanh 的输出头,通过掩码安全指数和除法在均方误差(MSE)上进行训练。
- 偏置项: 与以往基于同态加密的方法不同,作者在卷积层和全连接层中均保留了偏置项。
核心贡献
- 全架构 MPC 实现: 本文展示了第一个在 MPC 环境下实现的 CellCnn,该实现保留了此前在 PriCell 等隐私保护变体中被省略的关键架构组件(ReLU、偏置项)。
- 回归能力: 该框架支持连续结果预测(回归),通过基于 tanh 的输出头,将隐私保护 CellCnn 的效用从仅限于分类扩展到了回归领域。
- 解耦训练: 该协议允许数据所有者提供份额后即断开连接,因为计算是由一组固定的专用计算方执行的,这与需要所有数据持有者保持在线的同步联邦学习模型不同。
结果
该方法在三个基准测试上进行了评估:CMV(NK 细胞)分类、AML(三分类)分类以及 AML 微小残留病(MRD)回归。
- CMV 分类: MPC 实现实现了 0.727±0.141 的多细胞输入准确率和 0.681±0.146 的表型准确率。这些结果紧密追踪了明文 CellCnn 基准(分别为 0.721±0.173 和 0.716±0.158),并显著优于 PriCell 基准(0.633±0.127)。
- AML 分类: 在三分类 AML 任务中,MPC 实现达到了 0.935±0.047 的多细胞准确率,比 PriCell(0.898±0.055)更接近明文上限(1.0)。
- AML MRD 回归: 在回归任务中,MPC 模型恢复底层原始细胞比例的皮尔逊相关系数 r=0.98,平均绝对误差(MAE)为 1.0 个百分点,而明文基准为 r=0.99 且 MAE 为 0.8 个百分点。
- 运行时间: 在 5 Gbps 局域网环境下,训练 CMV 模型 20 个 epoch 大约耗时 1,200 秒。作者指出带宽是主要的瓶颈,将速度降至 1 Gbps 会使训练时间增加到 2,700 秒。
意义与主张
作者声称,他们的方法成功弥合了统计学上对多机构数据协作的需求与法律/伦理对数据隐私限制之间的鸿沟。通过保留完整的 CellCnn 架构(包括 ReLU 和偏置项)并支持回归,所提出的 MPC 框架比以往基于同态加密的隐私保护基准具有更高的准确性和更广泛的适用性。论文强调,该方法可以在不向任何计算方暴露原始患者数据或中间值的情况下,实现对稀有细胞亚群的精确分析。作者承认了局限性,包括对半诚实威胁模型的依赖以及在回归基准中使用合成地面真值(ground truths),并建议未来的工作应侧重于加强安全性以应对恶意模型,并在更大的真实临床队列上进行验证。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。