Toward Individual Fairness Without Centralized Data: Selective Counterfactual Consistency for Vertical Federated Learning
本文提出了一种以服务器为中心的垂直联邦学习框架 SCC-VFL,该框架通过结合差分隐私特征角色发现、掩码反事实生成以及一致性损失,在保持预测精度和隐私性的同时显著降低决策翻转率,从而在个体层面强制实施反事实公平性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在申请贷款。你的财务生活就像一个拼图,但拼图的碎片散落在不同的建筑物里。A 银行拥有你的账户历史,你的雇主掌握着你的工资单,而征信机构则保存着你的债务记录。由于隐私法规,它们都不愿将各自的私密文件交给一个中央主管。因此,它们使用了一种称为**垂直联邦学习(VFL)**的系统。这就像一群在各自厨房里工作的厨师,每个人都拥有不同的食材。他们只将自己菜肴的一小部分“烹饪样本”发送给主厨(服务器),由主厨混合品尝最终的味道,却永远看不到其他厨房里的生食材。
问题是:最终的决策公平吗?
如果你 25 岁,你能获得贷款吗?如果你 26 岁,你能获得吗?如果答案仅仅因为你的年龄(一种受保护的特征)而改变,那就是不公平的。但在这里情况更加棘手,因为拼图的“年龄”碎片可能在其中一个厨房里,而“工作稳定性”碎片在另一个厨房里。系统可能会无意中利用你的年龄来推测你的工作稳定性,进而以此为由拒绝你的贷款,即使年龄本不应产生影响。
本文的作者提出了SCC-VFL,一种解决此问题的新方法。他们称之为选择性反事实一致性。以下是其工作原理,使用简单的类比:
1. “假如”测试(反事实)
想象你是一名时间旅行者。你回到过去,改变关于自己的一件事:你的年龄。你问:“如果我是 26 岁而不是 25 岁,但我生活中的其他一切完全保持不变,我还能获得贷款吗?”
- 公平:如果答案是“是的,我仍然获得贷款”,那么系统是稳定的。
- 不公平:如果答案是“不,我被拒绝了”,那么系统是不稳定的,并且可能存在偏见。
目标是确保即使你改变年龄,答案也保持不变。
2. “盲目”修复的问题
以前试图修复此问题的方法,就像试图通过模糊整张照片来编辑它。它们试图从数据中抹去所有年龄的痕迹。但这过于严苛。有时,年龄在法律上或逻辑上确实很重要(例如,21 岁的人不能租车,但 25 岁的人可以)。我们需要明智地决定改变什么。
3. SCC-VFL 解决方案:“智能编辑器”
作者构建了一个系统,它像一个拥有三种特定工具的智能编辑器:
工具 A:“隐私面具”(识别角色)
在编辑之前,系统需要知道哪些特征属于哪一类。
- 非后代(“固定”锚点):这些是不会仅仅因为你的年龄改变而改变的事物。例如,你的贷款金额或你居住在该房屋的时间长度。在“假如”场景中,这些必须保持完全不变。
- 中介变量(“允许”的变动者):这些是可以随年龄自然变化的事物。例如,你的工作任期或信用记录对于 26 岁的人来说可能与 25 岁的人看起来不同。系统被允许更新这些内容以匹配新年龄。
- 代理变量(“禁止”的泄露):这些是狡猾的特征,它们在你未明说的情况下秘密地向系统透露你的年龄(例如,特定的邮政编码或人口统计代码)。系统必须阻止这些特征影响决策。
他们如何在未见原始数据的情况下找到这些? 他们使用隐私草图。想象服务器请求持有年龄数据的一方发送年龄列表的“模糊”版本(就像一张雾蒙蒙的照片),该版本保护个人隐私但显示总体模式。利用这张雾蒙蒙的照片,系统可以确定哪些特征是“锚点”、“变动者”或“泄露”,而无需看到真实的姓名或年龄。
工具 B:“掩码生成器”(安全编辑)
一旦角色分配完毕,系统就会创建你申请的“假如”版本。
- 它锁定锚点(非后代),使它们纹丝不动。
- 它更新变动者(中介变量),使其看起来符合新年龄(例如,稍长的工作任期)。
- 它保护泄露(代理变量),防止它们不小心向决策者透露旧年龄。
这就像一位裁缝,被允许调整西装的袖子(中介变量)以适应新尺寸,但被严格禁止更改面料图案(锚点)或添加揭示原主人的隐藏标签(代理变量)。
工具 C:“稳定性检查”(服务器端执行)
最后,服务器查看原始决策和“假如”决策。
- 如果决策仅仅因为允许的变化而发生翻转(例如,从“批准”变为“拒绝”),系统将受到惩罚。
- 它迫使模型学习一种稳定的决策方式。它教导模型:“如果唯一发生变化的事物是我们允许变化的事物,那么结果应该保持不变。”
结果:更公平、更安全的系统
作者在三个现实场景中测试了该方法:信贷(贷款)、医疗保健(心脏病风险)和刑事司法(累犯风险)。
- 结果:他们的系统(SCC-VFL)在保持决策稳定性方面表现更好。在某些情况下,与其他方法相比,它减少了**98%**的“决策翻转”(即一个人仅仅因为受保护特征而得到不同答案的情况)。
- 无权衡:通常,使系统更公平会降低其准确性(就像为了安全而拦截每个人的保安)。但 SCC-VFL 在使决策更公平的同时保持了高准确性。
- 隐私:它也让黑客更难通过查看系统共享的数据来猜测你的私人特征(如年龄或种族)。
总结
将SCC-VFL想象成一群秘密厨师团队的公平过滤器。它确保当它们结合各自的秘密食材做出决策时,最终的味道不会仅仅因为一种秘密食材(如你的年龄)略有不同而随意改变。它通过以下方式实现这一点:
- 模糊敏感信息以保护隐私。
- 将特征分类为“固定”、“允许改变”和“禁止”。
- 现实地编辑“允许”的部分。
- 如果最终决策不公平地发生变化,则惩罚系统。
结果是一个尊重隐私、保持数据分布式存储,并确保你的贷款或医疗决策取决于你的实际资格,而不是基于针对你的年龄、种族或性别的隐藏偏见的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。