Privacy Preserving Machine Learning Workflow: from Anonymization to Personalized Differential Privacy Budgets in Federated Learning
本文提出了一种针对敏感表格数据的全面隐私保护联邦学习工作流,该工作流集成了匿名化、用于缓解投毒攻击的客户端漂移检测,以及一种基于重识别风险分配个性化差分隐私预算的新方法,在医疗记录上展现出优于固定预算方法的模型性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,有一组医院,各自位于不同的国家,希望共同构建一位超级智能的 AI 医生,以预测患者癌症的严重程度。它们都拥有宝贵的患者数据,但没有任何一家医院能够将其实际的患者记录共享给彼此或中央服务器。原因何在?因为严格的隐私法律(如 GDPR)以及敏感医疗机密可能被盗的担忧。
本文提出了一种巧妙的方法,利用称为联邦学习的系统,并结合几层“隐私魔法”来解决这一问题。以下是用简单术语解释的工作流程:
1. 设置:“秘密食谱”竞赛
将中央服务器想象成竞赛评委,将医院想象成厨师。
- 目标:评委希望创造出预测癌症严重程度的最佳可能食谱(AI 模型)。
- 规则:厨师不能将他们的秘密配料清单(患者数据)发送给评委。相反,他们在本地稍微烹饪一下食谱,仅返回他们对食谱所做的更改(模型更新),然后评委将这些更改混合在一起,制作出更优质的全球食谱。
2. 第一步:隐藏身份(匿名化)
在厨师开始烹饪之前,他们必须确保其配料无法追溯到特定个人。
- 类比:想象一位厨师拥有一份包含客户姓名、年龄和喜爱食物的清单。为了保护他们,厨师会移除姓名,并将年龄分组到区间中(例如,使用"30–39 岁”而不是"34 岁”)。
- 本文的方法:医院使用工具对其数据进行泛化,以确保无法识别任何单一个体。关键在于,本文确保所有医院都以完全相同的方式泛化其数据(例如,所有人都使用 10 岁的年龄区间),以便食谱仍能公平比较。
3. 第二步:检查“醉酒厨师”(客户端漂移检测)
有时,一位厨师可能会意外使用错误的配料,或者一位恶意的厨师可能会试图故意破坏食谱。
- 问题:如果某家医院的数据与其他医院完全不同(也许他们使用不同的设备,或拥有不同的患者群体),他们的食谱更改就会显得奇怪。这被称为“客户端漂移”。
- 本文的解决方案:评委在混合食谱更改之前对其进行审查。如果某位厨师的更改与所有人的更改截然不同(就像一位厨师试图在汤食谱中添加“巧克力”),评委就会标记他们。这有助于在不查看实际配料的情况下,同时捕捉意外错误和恶意攻击。
4. 第三步:“隐私预算”(差分隐私)
即使厨师返回了食谱更改,精明的黑客也可能能够通过这些更改逆向工程出原始配料。为了阻止这种情况,本文在食谱更改中添加了“噪声”(静电干扰)。
- 旧方法(全局预算):想象评委无论谁发送,都向每个食谱更改添加完全相同数量的静电干扰。这是一种“一刀切”的方法。
- 本文的新方法(个性化预算):本文提出了一种更聪明的方法。它问道:泄露这位特定厨师的数据有多大的风险?
- 如果一家医院拥有非常小且独特的患者群体,其数据就更容易被猜出。他们获得更多静电干扰(更多的隐私保护)。
- 如果一家医院拥有庞大且多样化的患者群体,其数据就更难被猜出。他们获得更少静电干扰(更少的隐私保护,意味着食谱保持更高的准确性)。
- 指标:他们为每家医院计算“重识别风险评分”(ARIREC)。风险越高,为其贡献添加的噪声就越多。
5. 结果:它有效吗?
作者使用一个包含 50,000 条癌症患者记录的伪造数据集测试了该系统,并将其划分为 10 个不同的“国家”(医院)。他们比较了三种场景:
- 标准联邦学习:无额外隐私步骤。
- 全局隐私:向所有人添加相同数量的静电干扰。
- 个性化隐私:根据风险添加定制数量的静电干扰。
发现:
“个性化隐私”方法比“全局隐私”方法效果更好。通过根据每家医院的具体风险量身定制噪声量,最终的 AI 模型更加准确(错误率更低),同时仍能保护所有人的数据安全。
总结
本文提出了一套完整的工作流程,用于在敏感医疗数据上训练 AI,而无需移动数据本身。它结合了:
- 匿名化以隐藏身份。
- 漂移检测以识别恶意行为者或异常数据。
- 个性化隐私,根据每家医院数据的脆弱程度,添加恰到好处的“静电干扰”以保护它们。
其结果是一个既能有效保护隐私,又能保持 AI 模型智能和准确的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。