FairSelect: A Systematic Evaluation of Multi-Level and Intersectional Algorithmic Fairness
本文介绍了 FairSelect,这是一个用于在建模全生命周期内系统性评估和结合多层级算法公平性策略的工具包,通过合成实验和临床中风风险实验表明,虽然组合干预措施通常能带来更大的公平性提升,但其有效性具有高度的上下文依赖性和非加性特征。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为一场来自世界各地的宾客参加的大型派对烘焙一个完美的蛋糕。你希望这个蛋糕让每个人都觉得美味,但你注意到,在过去,食谱有时会不小心让蛋糕对某些宾客来说太干,而对另一些人来说又太甜。这有点像医疗保健中使用的计算机模型所发生的情况:它们会做出预测(比如猜测谁可能会生病),但有时它们会对特定群体出错,因为数据中存在隐藏的偏见。
由此诞生了 FairSelect,这是一个由研究人员 Nick Souligne、Isabella Mixton-Garcia 和 Vignesh Subbian 开发的新型“厨房工具包”。请把 FairSelect 想象成不是一根神奇的魔杖,而是一个巨大的、组织有序的调料架,让你能够测试不同的方法来修正食谱。
大问题:一种招式并不适用于所有人
长期以来,科学家们一直试图用单一的技巧来修复这些有偏见的食谱。也许你在混合之前调整配料(预处理),也许你在烘焙时改变搅拌面糊的方式(处理中),或者你在蛋糕出炉后调整糖霜(后处理)。
该论文反对仅仅选择其中一种技巧并将其强加于任何模型以解决所有问题的想法。事实上,研究人员发现,仅使用一种方法通常是不一致的。在他们针对中风风险预测的现实世界测试中,只有大约 22.3% 的单方法尝试实际上改善了公平性(具体而言是减少了等化赔率差距/Equalized Odds gap),而且许多尝试甚至让情况变得更糟或没有任何效果!这就像是试图通过只拧紧桌子的一条腿来修复摇晃的桌子;有时你只是让它摇晃得更厉害,但有时,你确实找到了要拧紧的那条腿。
解决方案:混合与搭配(但要小心!)
该论文的主要发现是,你通常需要结合这些技巧才能获得最佳结果。研究人员构建了 FairSelect 来测试这些方法的组合,就像厨师测试加入一撮盐和一撮胡椒是否比只加盐效果更好一样。
他们通过两种方式进行了测试:
- 模拟厨房: 他们创建了虚假的、“压力测试”数据集,在这些数据集中,他们完全了解偏差所在。在这些受控模拟中,结合方法效果显著。当他们使用多层策略(混合预处理、处理中和后处理)时,他们看到公平性的提升大幅跃升。例如,不同群体之间的公平性差异(称为 EO_diff)在结合方法下平均提高了 0.0331,而仅使用单方法时仅提高了 0.0175。
- 现实世界厨房: 他们使用了一个真实的医疗数据集,用于预测患者患房颤后 2年内 的中风风险。该数据集包含 11,160 名参与者,分为 8,777 人 的开发组和 2,383 人 的测试组。
惊喜:情况很复杂!
有趣的地方就在这里。在现实世界的测试中,结果非常混乱。研究人员发现,公平性干预措施具有高度变异性。
- 有些组合是神奇的:它们既改善了公平性,又保持了高预测准确度。
- 其他组合则是灾难性的:它们让公平性变差,或者损害了模型预测准确性的能力。
例如,在现实世界的中风研究中,只有 26.2% 的组合式多层策略比基准线降低了公平性差距(EO_diff);然而,同样的 26.2% 也降低了人口统计学平价差距(DP_diff),并且至关重要的是,有几种特定的组合能够同时改善这两种公平性指标,同时保持具有竞争力的预测性能。这表明不存在“一劳永逸”的解决方案。适用于决策树模型的方案可能会在神经网络上完全失效,但正确的组合可以为其他模型带来奇迹。
权衡:公平性 vs. 准确性
通常,人们认为你必须在公平的模型和准确的模型之间做出选择。你要么得到一个让某些人觉得难吃但完美的蛋糕,要么得到一个让每个人都喜欢但味道平庸的蛋糕。
然而,论文指出,通过使用正确的工具组合,你可能不必做出选择。在某些情况下,修复偏差实际上有助于模型预测得更好。例如,一个结合了重加权和集成技术的随机森林模型在提高公平性的同时,几乎保持了其准确性(AUROC 仅下降了 0.01)。但在其他情况下,比如使用决策树模型时,公平性的收益是以牺牲较大的准确性为代价的。
总结
论文的结论是,我们不能仅仅把单一的公平性工具投向一个问题并寄希望于好运。我们需要一种系统的方法来测试不同的组合,就像厨师在每个阶段都要品尝汤的味道一样。
研究人员使用了 12 种不同的公平性技术(如用于平衡配料的 SMOTE、用于调整份量的 Reweighting 以及用于以不同方式切割蛋糕的 Thresholding)并在 7 种不同的模型类型(如逻辑回归、随机森林和神经网络)上进行了测试。
虽然模拟显示,结合方法通常会带来更好的公平性,但现实世界的结果提醒我们,环境(Context)至关重要。一种在某个数据集中解决偏差的策略可能会在另一个数据集中破坏它。FairSelect 是一个工具包,它能帮助医生和数据科学家在将“蛋糕”端给患者之前,弄清楚哪种具体的工具组合最适合他们特定的“厨房”。
简而言之:不要靠猜。去测试。去组合。并记住,最好的食谱完全取决于你要喂饱谁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。