Geometric Data Perturbation with Noisy-Anchor Alignment for Privacy-Preserving Collaborative Learning
本文提出了一种隐私保护的协作学习框架,该框架通过向共享的锚点表示而非私有数据添加噪声,增强了几何数据扰动方法,从而在保持比现有方法更高学习效用的同时,有效地缓解了分析师与参与者之间的共谋攻击。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字世界中,各机构往往只掌握着庞大拼图中的碎片。医院可能拥有患者记录,银行可能拥有交易历史,而大学可能拥有学生表现数据。为了构建更好的人工智能,这些团体需要整合他们的信息。然而,法律和隐私担忧通常阻止他们直接共享原始数据。这创造了一个难题:各团体如何在从不泄露各自隐私秘密的情况下,通过相互学习进行协作?一种极具前景的解决方案涉及一种被称为“几何数据扰动”的技术。想象一下,将一张照片进行旋转或轻微平移,而不改变图像中任意两点之间的距离。照片看起来变了,但其内部结构保持不变。通过对数据应用这些数学上的偏移,机构可以将扭曲版本的的信息发送给中央分析师。随后,分析师可以在这些组合后的、扭曲的数据上训练强大的模型,而原始的隐私记录则得以隐藏。
挑战在于,如果中央分析师与其中一个参与机构决定联手破坏其他人的隐私,该怎么办。如果所有机构都使用完全相同的数学偏移,这对共谋的组合就能轻易地逆转过程,从而看到每个人的隐私数据。为了阻止这种情况,研究人员此前曾建议每个机构都应使用自己独特的偏移。然而,这产生了一个新问题:来自不同组的数据最终会变成不兼容的格式,导致无法有效地训练单个模型。为此,研究人员开发了一种名为“锚点对齐”(anchor alignment)的巧妙变通方法。它使用一组共享的、合成的参考点——就像一个共同的地图网格——每个机构都随其私有数据一起进行变换。分析师利用这些经过变换的参考点,将不同的数据集对齐成一个统一的、可用的格式。但一项新研究揭示了这种方法的一个关键缺陷:如果一个共谋伙伴泄露了原始参考地图,分析师就可以在数学上逆转所有其他参与者的独特偏移,从而完全暴露他们的隐私数据。
来自筑波大学的研究人员提出了一种新方法来解决这一特定的漏洞。他们意识到,直接向私有数据添加噪声(或随机静态噪声)来保护数据,会破坏最终模型的质量。因此,他们决定将噪声添加到参考地图本身。在他们的新系统中,每个机构仍然对其私有数据使用其独特的偏移,但在变换共享的参考地图时,他们在将其发送给分析师之前,先在地图上添加了一层随机噪声。这种噪声使得分析师和共谋伙伴在数学上不可能完美地逆转其他参与者的独特偏移。分析师仍然可以足够好地对齐数据以训练一个有用的模型,但窃取隐私信息的路径被噪声阻断了。
团队使用两个大型图像数据集测试了这个想法:一个包含手写数字,另一个包含数千张名人面孔。他们模拟了一个分析师与一名参与者合谋窃取其他参与者数据的场景。当他们向私有数据本身添加噪声时,随着隐私保护程度的提高,模型的准确率显著下降。然而,当他们仅向参考地图添加噪声时,他们发现了一种更好的平衡。该系统在保持机器学习模型高准确率的同时,使得攻击者极难重建原始图像。在实验中,新方法使系统即使在数据泄露风险保持在较低水平时,仍能实现高学习准确率。研究人员表明,通过保护对齐信号而非数据本身,他们可以创建一个既有利于协作又能抵御内部威胁的系统。这种方法为机构在敏感项目上进行协作提供了一种切实可行的方式,而无需在隐私和性能之间做出抉择。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。