Compiler-Guided Polynomial-Level Parallelism for FHE-Encrypted Machine Learning Inference
本文介绍了 CRISP,这是一种编译器引导的方法,通过在运行时 SIMD 向量化与编译时 OpenMP 并行性之间进行权衡,实现了用于 FHE 加密机器学习推理的安全多项式级并行,从而在 ANT-ACE 编译器框架内实现了显著的加速和延迟降低。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字世界中,敏感信息经常通过由陌生人控制的网络进行传输。例如,银行可能会在并不拥有的服务器上处理您的贷款申请,或者医院可能会使用第三方运营的云服务来分析患者记录。在这些场景下,数据是脆弱的;如果服务器遭到破坏,隐私信息就会暴露。几十年来,在这种情况下保护数据的唯一方法是将其保存在离线状态,或者完全信任服务器运营商。全同态加密提供了一条不同的路径。它是一种数学方法,允许计算机对处于加密锁定状态的数据进行计算。计算机永远看不到实际的数字,它只处理被混淆的代码。当计算完成时,结果会被解密以显示正确的答案,就像是在原始的、未加密的数据上进行过运算一样。这项技术承诺了一个即使在不可信的基础设施上进行计算也能保护隐私的未来。
然而,这种隐私是以沉重的代价换取的。因为计算机必须处理混淆的代码而非清晰的数字,所以计算过程极其缓慢。在普通数据上仅需一瞬间的任务,在加密状态下可能需要数小时甚至数天。这种缓慢程度使得该技术无法用于实时应用,例如分析医学扫描图像或处理正在发生的金融交易。瓶颈在于计算机如何处理维持加密完整性所需的庞大数学工作量。为了使这项技术变得实用,研究人员必须寻找在不破坏保护数据安全之规则的前提下,加速这些计算的方法。
来自湖南大学和广东省电力系统网络安全重点实验室的研究团队开发了一种新方法来解决这个速度问题。他们创建了一个名为 CRISP 的系统,它充当了运行这些加密计算的计算机代码的专门“翻译官”。他们的工作专注于一种被称为 CKKS 的特定加密方案,该方案广泛用于机器学习任务。在这种方案中,加密数据被表示为一组被称为多项式的庞大数学对象。为了执行计算,计算机必须通过一系列步骤来处理这些多项式,包括将它们分解成较小的部分并重新组装。研究人员发现,现有的用于运行这些计算的软件并未充分利用现代计算机处理器的能力。
现代计算机处理器包含多个核心,类似于一个由多名工人组成的团队,每个核心都能同时执行一项任务。标准的加密计算软件设计采用了称为 SIMD(单指令多数据流)的技术,这就像是一个工人使用一种专门的工具同时对许多小物品执行任务。虽然这种方法很有效,但它限制了可以同时活跃的工人数量。研究人员意识到,加密计算的结构允许采用一种不同的策略:与其依赖于针对每个小物品使用的专门工具,不如将不同的工作大块分配给不同的工人。他们开发了一种编译器引导的方法,在代码运行前对其进行重组,从而让计算机更有效地利用其多个核心。这种从“单人处理多件物品”到“多人处理多块任务”的转变是其创新的核心。
研究人员将他们的系统 CRISP 构建在现有的端到端编译器 ANT-ACE 之上。该编译器可以将机器学习模型(例如用于识别图像的模型)自动转换为可以在加密数据上运行的程序。团队将他们新的并行化策略插入到这一过程的最后阶段,即程序被翻译成加密库所理解的多项式操作的阶段。通过在编译器层面进行这种操作,他们能够看到计算的整体结构,并确保这种新的拆分工作的方式不会违反加密的严格规则。他们必须非常小心,因为加密数据具有必须保留的特定数学属性;如果拆分方式错误,最终答案将会出错。他们的方法仔细分析了不同计算部分之间的依赖关系,以确保并行工作的各个部分不会相互干扰。
他们的实验结果非常显著。他们在采用六种不同加密机器学习模型的标准多核计算机处理器上测试了该系统。当使用他们的新方法运行加密计算时,核心数学操作比使用标准方法时平均快了 2.65 倍。这种提速在包括加密数字的加法和乘法在内的各种计算类型中都是一致的。对于整个机器学习推理过程(即在单个数据上运行模型所需的时间)而言,与目前最好的版本相比,新方法平均减少了 137 秒的运行时间。在某些情况下,这种缩减更为剧烈,系统在处理特定的乘法任务时速度提升了近七倍。这些改进是在不改变底层加密方案或不需要新硬件的情况下实现的;收益完全来自于对现有工作进行更智能的组织方式。
研究人员还验证了该方法在与其他优化技术结合使用时的效果。机器学习模型通常涉及复杂的步骤,其中不同的操作会被合并在一起以节省时间。团队表明,他们的并行化策略可以与这些合并技术共存,从而保留两者的优势。他们使用多达十六个处理器核心测试了该系统,并发现性能持续提升,尽管随着系统接近其内存带宽的极限,增益开始趋于平缓。这表明该方法能随着更强大的硬件而扩展。至关重要的是,他们确认了新系统产生的结果在数学上与标准系统产生的结果完全一致,证明了提速并非以牺牲准确性为代价。
这项工作代表了使加密机器学习在现实世界中可行性的实践性进展。通过将计算并行化的控制权从运行时库转移到编译器,研究人员解锁了一个此前无法触及的新性能水平。他们的方法并不依赖于某种“魔法”或新的理论突破,而是通过对现有工具使用方式的细致重组。研究结果表明,加密数据处理可以变得足够快,以满足需要即时结果的应用需求,例如实时欺诈检测或私人医疗诊断。该团队已将其实现公开,供他人研究和构建,为进一步的改进打开了大门。随着对隐私保护计算的需求日益增长,像 CRISP 这样的方法为使安全数据处理成为数字景观的标准组成部分,而非仅仅是一个理论上的可能性,提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。