Auditing Fairness-Privacy Trade-offs: Subpopulation-Level Effects of Fairness-Enhancing Algorithms
本文提出了首项综合性研究,证明了增强公平性的算法对成员推理隐私风险具有异质性的、针对特定子群体的效应,揭示了公平性、隐私与效用之间的相互作用需要在子群层面进行联合评估,而非仅通过聚合指标进行评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一座巨大且繁忙的图书馆里,这里的每一本书都代表着一个人的生命故事。在这座图书馆里,管理员(即计算机程序)必须遵守两条非常重要的规则。第一条规则是公平性:管理员必须平等地对待每一位访客,无论他们是高是矮、是否戴眼镜,或者来自哪个社区。他们不能对某一类群体提供更好的服务而忽视另一类。第二条规则是隐私性:管理员必须守护好访客的秘密。他们不应该仅仅通过观察书籍的排列方式,就能对陌生人说:“嘿,我知道你昨天来过!”
长期以来,科学家们一直担心这两条规则可能会发生冲突。他们认为,如果你试图让图书馆变得超级公平,你可能会在无意中让窥探者更容易猜出谁来过。或者,如果你试图完美地隐藏每个人的身份,管理员可能会因此变得混乱,从而开始不公平地对待人们。但这里有一个转折:大多数科学家此前只关注整个图书馆作为一个整体。他们检查的是所有人的平均待遇,却忽略了某些特定的访客群体可能正在遭受完全不同且糟糕得多的待遇。这就像是说一个城市的“平均”温度很完美,却忽略了其中一个社区正处于冰冻之中,而另一个则在烈日灼烧。
这篇论文决定通过放大镜来观察这座图书馆,逐一检查每一个特定的访客群体。研究人员想要看看,当我们使用特殊的“公平工具”来修正管理员的行为时,会发生什么?这些工具是否会无意中让窥探者更容易猜出哪些访客在系统中?此外,如果你尝试使用“隐私盾牌”(一种被称为“差分隐私”的技术)来隐藏每个人的身份,它是否能平等地帮助每个人,还是会无意中让规模较小、较不常见的群体受到更大的伤害?
团队设置了一个大规模实验,使用了十个不同的真实世界场景,范围从预测谁能获得贷款到判断谁可能在法律系统中再次犯罪。他们测试了五种不同类型的“公平工具”(有些是在计算机学习前修正数据,有些是改变计算机的学习方式,还有些是在计算机完成任务后修正答案)。他们还使用了三种不同类型的“窥探攻击”,以观察判断一个人是否在训练数据中的难度有多大。
以下是他们的发现,其复杂程度远非简单的“好与坏”的故事。首先,他们发现公平与隐私并不是敌人。你并不需要在两者之间做选择;事实上,一些公平工具甚至让窥探者更难猜出谁在系统中,而另一些则让情况变得更容易。这取决于你使用哪种工具以及你在哪个群体中。例如,一种叫做“重加权”(Reweighing,即给予较小群体更多关注)的工具通常会让较小的群体在面对窥探者时更加安全。但另一种工具——“差异性影响消除器”(Disparate Impact Remover)——则像是一场过山车——它有时提供帮助,有时又会造成损害,这取决于具体的数据集。
最令人惊讶的发现出现在将公平工具与“隐私盾牌”(差分隐私)结合使用时。研究人员发现,虽然隐私盾牌成功阻止了窥视者,但它是通过在整个图书馆上罩上一层“噪声”来实现的。这种噪声本意是隐藏每个人的身份,但事实证明,它变成了一床沉重的毯子,压垮了那些规模较小、较不常见的群体。对于规模庞大的热门群体,即使有噪声,管理员仍能很好地履行职责。但对于那些微小的、稀有的群体,噪声实在太响了,以至于管理员根本无法分辨任何信息,其准确率降至接近于零。这就像是在一个安静的房间里试图听清一声低语;如果你突然打开一个巨大的风扇来掩盖这声低语,大声说话的人依然能被听到,但那些细微的低语则会彻底消失。
论文还研究了一种名为“校准等化赔率”(Calibrated Equalized Odds)的工具,它通过调整最终答案来确保公平。该工具在隐藏隐私风险方面表现出色(使窥探者的猜测趋于随机),但在准确性方面却是一场灾难。它不仅仅是帮助了那些代表性不足的群体,它还以一种混乱的方式重新分配了误差,有时伤害多数群体,有时伤害少数群体,且没有任何明确的规律。
简而言之,作者表明不存在一个能同时解决公平、隐私和准确性的“魔法按钮”。结果表明,这些工具的影响高度依赖于群体的规模、所使用的计算机模型类型以及所选的具体方法。如果你想建立一个公平且私密的系统,你不能只看平均值。你必须审计每一个细分群体,因为对大多数人有效的方案,对少数群体来说可能是一场隐私噩梦或效用灾难。这篇论文并不声称已经永久解决了这个问题,但它提供了第一张清晰的地图,展示了在公平与隐私的森林中,陷阱究竟隐藏在何处。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。