← 最新论文
🤖 machine learning

Federated and differentially private estimation of KL divergence

本文介绍了 FedPriKL,这是一种在联邦设置下估计 KL 散度的创新差分隐私方法,该方法实现了无偏、低方差的准确性,并具有受限的敏感度,同时与现有基准相比最小化了通信开销。

原作者: Sayan Biswas, Graham Cormode, Carsten Maple, Mary Scott

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Sayan Biswas, Graham Cormode, Carsten Maple, Mary Scott

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数据世界中,信息往往分散在数以百万计的独立设备中,从智能手机到可穿戴健康追踪器。这种分散的特性创造了一种无需将所有人的数据收集到一个中央库中即可了解世界的方式。这种被称为联邦学习(federated learning)的方法,允许中央系统通过要求设备在其本地数据上进行计算,然后仅分享计算结果来构建模型。然而,一个关键的挑战仍然存在:我们如何知道正在使用的数据是否随时间发生了变化?如果使用应用程序的人群行为发生转变,基于旧数据构建的模型可能会变得不准确或不再适用。为了解决这个问题,分析师需要衡量当前数据与已知标准之间的差异,而这项任务通常需要查看原始数据。但在隐私至上的世界里,揭示原始数据往往是不可能的。解决方案需要一种数学方法,在不暴露构成数据的个人细节的情况下,测量这种差异。

来自洛桑联邦理工学院(EPFL)、牛津大学、华威大学以及传染病数据观测站(Infectious Diseases Data Observatory)的研究人员开发了一种名为 FedPriKL 的新方法来解决这个确切的问题。他们的工作专注于一种用于比较两组数据的特定数学度量工具,该工具可以告诉我们一组信息偏离参考点的程度。在这种情景下,参考点是所有人公认的公共标准,而另一组则是用户设备上持有的私密敏感数据。目标是在中央服务器从未见过个人记录的情况下,计算这两组数据之间的距离。研究人员创建了一种协议,允许中央协调员询问一小部分随机选择的设备,检查某些项目在它们本地数据中出现的频率。这些设备随后仅返回这些特定项目的计数,并将这些计数进行安全组合。为了确保即使是这些计数也无法追溯到个人,系统会在最终结果中加入经过精心计算的数学噪声。

团队发现,该方法在保持严格隐私保障的同时,具有高度的准确性。他们从数学上证明了该方法产生的是无偏估计,这意味着结果在平均意义上是正确的,并且保护隐私所需的噪声量足够小,不会破坏数据的可用性。在实验中,他们使用大型手写数字数据集测试了该系统,模拟了数千名用户贡献数据的真实场景。他们发现,通过仔细选择询问设备的数量和添加噪声的量,该系统可以产生几乎与不使用任何隐私保护时一样准确的结果。这与以往的方法相比是一个显著的改进,在以往的方法中,设备试图通过在发送数据前添加噪声来隐藏数据,这种技术往往会导致结果不准确。新方法将噪声添加过程放在了最后一步,即在数据被安全组合之后,从而保留了测量的完整性。

研究人员还探讨了不同设置如何影响结果。他们发现,即使在每一轮中只要求总用户中的一小部分参与,该系统仍然运行良好,且每个用户需要发送的数据量非常小,通常不到 1 千字节。这使得该系统对于电池和内存有限的设备来说非常实用。研究表明,该方法能够准确区分数据的微小变化和剧烈变化,这对于决定计算机模型何时需要更新至关重要。虽然当前版本的系统依赖于一个受信任的中间步骤来安全地组合数据,但研究人员证明,这一步骤可以使用现有的安全硬件或先进的密码学技术来完成,从而确保没有任何单一实体能看到原始数据。这项工作为以尊重用户隐私的方式监测数据趋势提供了一条具体的路径,使组织能够在不损害生成数据的个人机密性的情况下,保持其模型的准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →