← 最新论文
💻 computer science

CryptDough: A Unified Analytics Engine for Secure Multiparty Computation

CryptDough 是一个统一的分析引擎,它使多个互不信任的各方能够在各种威胁模型下,针对私有输入共同执行多样化的数据分析流水线,并通过其层次化设计和抽象掉通信与并行化复杂性的虚拟向量,实现卓越的性能与模块化。

原作者: Muhammad Faisal, Alessandra Lanz, Sam Buxbaum, Adam Godel, Vasiliki Kalavri, Mayank Varia, John Liagouris

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Faisal, Alessandra Lanz, Sam Buxbaum, Adam Godel, Vasiliki Kalavri, Mayank Varia, John Liagouris

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,数据通常被视为一种可以共享、分析和出售的商品。然而,一些最宝贵的信息仍然被锁闭起来,并非因为其本质是秘密,而是因为其所有者无法彼此信任。医院可能持有敏感的患者记录,银行可能拥有详细的财务历史,政府可能保存着人口普查数据,但由于担心隐私泄露,这些机构都无法将这些数据集结合起来,以寻找能够挽救生命或改善经济的模式。几十年来,解决这一困境的方案是一个被称为“安全多方计算”的理论概念。这个想法看似简单得近乎天真:多个参与方可以共同协作,从各自的私有数据中计算出一个结果,而无需向彼此或任何外部观察者透露数据本身。这就像一群人正在解一个拼图,每个人都持有一些碎片,但他们只能以一种既能揭示最终图像、又绝不展示单个碎片的方式将碎片传递给对方。

虽然这一理论已存在多年,但将其转化为现实世界分析的实用工具却一直是一场艰苦的斗争。以往构建此类系统的尝试往往像是为单一任务设计的专用工具。一个系统可能擅长为机器学习处理数字,而另一个可能仅用于排序数据库记录,第三个则用于追踪基于时间的趋势。如果研究人员想要结合这些任务——例如,分析医学图像,将其与患者记录进行交叉引用,然后追踪随时间的变化——他们会面临一道墙。他们必须将不同的、互不兼容的系统缝合在一起,这个过程不仅构建难度极大,而且往往难以实现安全保障,因为不同的系统使用的是不同的密码学语言。该领域曾长期受困于一系列单用途引擎,无法处理现代科学所需的复杂、混合型工作流。

波士顿大学的一个研究小组现在构建了一个旨在打破这一僵局的新型引擎。他们称之为 CryptDough,这是一个统一的系统,允许多个互不信任的参与方在不暴露原始数据的情况下,在其私有输入上运行复杂的数据分析流水线。与前代产品不同,前代产品受限于单一的任务类型或特定的安全设置,而 CryptDough 被设计为能够同时处理多种类型的工作负载。它可以处理关系型数据(如患者记录表)、时间序列数据(如健康监测仪器的读数流)以及机器学习任务(如通过医学图像识别疾病),且全部在同一个安全环境中运行。该系统具有足够的灵活性,可以适应不同程度的信任水平,从参与方仅仅是对数据感到好奇,到参与方可能会积极尝试偏离协议的情况。

研究人员通过创建一个将复杂的密码学数学运算与数据分析逻辑相分离的分层架构实现了这一目标。在堆栈的最底层,系统处理繁重的安全通信和加密工作,确保数据保持隐藏。在其之上,它提供了一套构建块,允许开发人员构建高层操作,而无需成为密码学专家。该设计的一个关键创新是作者称之为“虚拟向量”的机制。在传统编程中,处理数据通常需要编写复杂的代码来管理信息如何在不同计算机之间拆分以及如何重新组装。CryptDough 消除了用户的这种负担。它允许数据分析师像在单机单线程环境下工作一样编写代码,而系统会在后台自动处理并行处理、通信和内存管理。这意味着用户在编写分析数据集的程序时,无需担心数据如何在各方之间安全共享的复杂细节。

为了测试他们的创造物,研究人员构建了一个模拟真实医疗研究的复杂且真实的流程。该流水线首先使用机器学习模型分析 X 光图像,并预测肺炎或 COVID-19 等疾病的可能性。随后,这些预测结果与包含哮喘和治疗史信息的患者记录数据库进行关联。最后,系统分析来自可穿戴设备的序列数据,寻找可能指示低氧血症事件的特定血氧饱和度变化模式。其目标是确定低氧水平的历史是否可以作为诊断呼吸系统疾病的指标。整个过程涉及图像处理、数据库连接和时间序列分析,是在多个参与方之间安全执行的。结果显示,CryptDough 能够以实用的时间完成这种复杂的、多阶段的分析,在本地网络上的耗时约为一分钟,而在使用最高安全级别的广域网环境下则略高于一小时。

该系统的性能表现是针对目前被视为最先进水平的几种现有专用工具进行衡量的。在处理诸如排序数据库记录或运行机器学习模型等单一任务时,CryptDough 证明了自己与这些专用系统具有竞争力。在许多情况下,它的表现甚至优于这些替代方案,对于特定工作负载,其运行速度比最好的替代品快至两倍。当与领域内广泛使用的通用编译器工具进行比较时,CryptDough 在广域网环境下展现出了显著优势,运行速度快了高达 4.7 倍。这种速度至关重要,因为由于需要各方之间不断的通信和验证,安全计算本质上比标准计算要慢。通过优化这些通信方式以及数据的并行处理方式,研究人员成功地使系统保持了足以投入实际应用的效率。

研究还强调了尝试合并现有专用系统的局限性。研究人员指出,即使两个系统针对的是同一种安全威胁,它们通常也使用截然不同的数据编码方式。试图将数据从一个系统传递到另一个系统,需要进行编码转换,这一过程不仅技术难度大,而且可能会引入安全漏洞。此外,编排多个系统需要集成不同的运行时环境和编程接口,这项任务对工程能力和密码学专业知识的要求极高,而这些资源往往难以获得。CryptDough 通过提供一个单一且连贯的环境解决了这个问题,在这个环境中,所有这些不同类型的分析都可以协同进行,而无需进行转换或人工编排。

这项工作的意义不仅在于速度或便利性。通过提供一个支持混合工作负载和多种威胁模型的统一引擎,研究人员使得解决此前无法触及的问题成为可能。该系统设计具有可扩展性,这意味着随着新密码协议的开发或新数据分析类型的出现,它们可以在不重建整个基础架构的情况下被添加到系统中。这种模块化设计旨在使安全计算的使用民主化,允许数据分析师和软件开发者构建安全应用,而无需成为密码学家。研究人员已将 CryptDough 的源代码公开,邀请进一步的开发与测试。

最后,本文所呈现的工作代表了使安全多方计算成为复杂数据分析实践工具的重要一步。它推动该领域从孤立的、单用途工具的集合,转向一个能够处理现实世界数据科学中那种杂乱、混合型工作流的统一引擎。结果表明,构建一个既安全又高效、能够在实现专用系统功能的同时往往还能超越其性能的系统是可行的。虽然这项技术仍处于早期阶段,并在扩展到大量参与方方面面临挑战,但通过在不同数据类型间安全执行复杂端到端流水线的演示,为“隐私”与“协作”不再互斥的愿景提供了令人信服的证明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →