← 最新论文
📊 statistics

Label Differential Privacy via Aggregation

本文提出了一种针对回归任务的标签差分隐私框架,该框架通过对训练实例或不相交的数据包进行加权线性聚合,在无需添加标签噪声的情况下,实现了更强的实际界限和效用保持,并提供了强大的隐私保证。

原作者: Anand Brahmbhatt, Rishi Saket, Shreyas Havaldar, Anshul Nasery, Yukti Makhija, Aravindan Raghuveer

发布于 2026-09-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Anand Brahmbhatt, Rishi Saket, Shreyas Havaldar, Anshul Nasery, Yukti Makhija, Aravindan Raghuveer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字时代,每天都有海量的个人信息被收集起来,用于训练能够进行预测的计算机程序,其预测范围涵盖了从估算房价到预测销售额的各个领域。该领域面临的一个关键挑战是,如何在不暴露提供数据的个人敏感细节的情况下教导这些系统。一种被称为“差分隐私”的强大解决方案,就像是一面数学盾牌。它确保计算机分析的最终结果,无论任何单个人的数据是被包含还是被排除,看起来几乎都是一样的,从而使得外部人员无法通过逆向工程获取该特定个人的信息。虽然这一概念在处理通用数据方面已被广泛研究,但当敏感信息完全隐藏在“标签”中(即附加在数据上的答案或结果,例如患者的医疗诊断或选民的选择)时,就会出现一个特定且困难的问题。如何在保护这些标签的同时,又不破坏计算机学习有用模式的能力,长期以来一直是一个障碍。

谷歌研究印度团队(Google Research India)开发了一种新方法来解决这个问题,其核心在于改变数据在投入训练之前进行分组和组合的方式。他们并没有采用通常会模糊结果并降低准确性的“添加随机噪声”的技术,而是提出了一种加权聚合系统。想象一下,将大量的单个记录混合在一起,形成一个个小的集合,或者称为“袋子”。在他们的方法中,袋子内的每条记录都会乘以一个从特定钟形分布中随机生成的唯一随机数。系统随后对这些加权后的记录进行求和,以创建一个代表该“袋子”的新数据点。这个过程会被重复执行,以创建许多这样的聚合点。研究人员发现,这种利用随机权重进行数据混合的特定方式,建立了一道数学屏障,保护了原始标签的隐私。至关重要的是,他们证明了只要数据集足够大且标签并非完全相同,即使攻击者了解袋子中其他所有的记录,这种保护依然有效。

这项研究表明,该方法在两种不同的场景下都能有效运作。第一种场景中,整个数据集中的每一条记录都会被包含在每一个“袋子”中,从而创建一个高度混合的聚合集。第二种场景中,数据集被拆分为许多小的、互不重叠的组,并且每个组都被分别处理。在这两种情况下,研究人员都证明了使用这些聚合后的、受隐私保护的数据点进行训练的计算机模型,仍能学习到几乎与使用原始数据进行训练时相当的预测准确度。他们在大规模真实世界数据集上进行了测试,包括一份来自1940年、拥有超过1.3亿人口的人口普查数据,以及一份来自在线广告平台、拥有超过170万条记录的数据集。结果非常明确:使用聚合数据训练的模型达到了与使用原始数据训练的模型几乎相同的准确水平,同时满足了严格的隐私保证。

这项工作的一个关键发现是,如果仅仅是在一组数据中对标签进行求和,而不使用这些特殊的随机权重,则无法提供任何真正的隐私保护。如果只是简单地对数据求和,那么单个人标签的变化会导致总和发生可检测到的偏移,从而泄露其信息。研究人员证明,随机加权对于隐藏这些个体贡献是必不可少的。此外,他们还展示了这种技术不需要在标签中添加额外的噪声,而添加噪声是其他隐私方法中常见的要求,且往往会降低学习质量。通过仅依靠这种加权聚合的数学特性,他们保留了数据在回归任务(用于预测销售额或工作时长等连续数值的任务)中的效用。

该团队还探索了一种变体,即在分组之前,先有意地对一小部分标签进行噪声处理,再结合加权聚合进行处理。这种混合方法使他们能够将隐私保证扩展到涉及神经网络的更复杂的学习任务中,神经网络是能够处理复杂模式的深度学习模型。他们的实验证实,即使增加了这些复杂性,模型仍能保持很高的效用。这项工作表明,对于许多实际应用场景,特别是那些受到法规或系统限制而无法使用原始个体数据的场景,这种聚合方法提供了一条稳健的路径。它允许组织利用敏感数据构建强大的预测工具,而无需损害背后个人的隐私,同时也避免了通常伴随隐私保护技术而来的显著准确度损失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →