Do Fair Models Reason Fairly? Counterfactual Explanation Consistency for Procedural Fairness in Credit Decisions
本文介绍了反事实解释一致性(CEC),这是一个旨在通过确保具有相似结果的个体获得一致的推理来检测和缓解信贷决策模型中“隐藏的程序性偏见”的框架,而这一关键的公平性维度常被基于结果的标准指标所忽视。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在申请贷款。你拥有极佳的信用评分、一份稳定的工作,以及足够的资金来偿还贷款。你获得了批准。现在,想象你的邻居也申请了贷款,他们拥有完全相同的财务概况,但他们属于不同的人口统计群体(也许是不同的种族或性别)。他们也获得了批准。
表面上看,一切似乎都很公平。你们两人都得到了相同的结果。但如果银行的计算机系统对你和你的邻居说“是”的理由完全不同呢?
- 对你: 计算机查看了你的信用评分和收入。
- 对你的邻居: 计算机忽略了他们的信用评分,而是重点查看了他们的就业历史和抵押品。
这就是该论文解决的核心问题。作者称之为“隐藏的程序性偏见”。这就像两位法官在法庭案件中给出了相同的判决,但一位法官基于被告的不在场证明做出决定,而另一位法官则完全基于他们的衣着做出决定。结果相同,但过程是不公平的。
问题:“结果”陷阱
目前大多数用于人工智能的公平性工具,就像一位只检查最终考试成绩的老师。如果 A 组和 B 组的平均分都是 80%,老师就会说:“太棒了,系统是公平的!”
作者认为这是一个陷阱。你可以拥有完美的考试成绩(结果),但老师对不同学生使用了完全不同的评分标准。在贷款领域,根据《平等信贷机会法》(ECOA)等法律,这种做法是非法的,该法律规定你不能对不同群体使用不同的规则,即使最终的批准率看起来相同。
解决方案:"CEC"框架
作者提出了一种名为**反事实解释一致性(Counterfactual Explanation Consistency, CEC)**的新工具。把它想象成人工智能的一次“现实核查”。
以下是其工作原理,使用一个简单的类比:
“如果”交换(反事实):
想象你有一份贷款申请。人工智能因为你的高收入而说“是”。CEC 工具拿过你的申请并问道:“如果这个完全相同的人,拥有完全相同的收入和信用评分,却属于不同的人口统计群体,会发生什么?”该工具并不是仅仅在表格上更改姓名或种族(这会制造虚假、不可能存在的数据),而是在数据库中找到一个真实的人,他们在财务上与你一模一样,但属于另一个群体。它将你与这个来自另一群体的“双胞胎”配对。
“推理”审计(解释一致性):
现在,该工具要求人工智能解释为什么批准了你们两人。- 它对你们两人是否以相同的方式权衡了收入和信用评分?
- 或者,它是否突然决定对于第二个人,工作历史是唯一重要的因素?
如果人工智能对这两个财务双胞胎使用了不同的“权重”或理由,CEC 工具就会发出警报。它衡量推理在两个群体之间“摆动”的程度。
修正(训练人工智能):
作者不仅构建了一个检测器,还构建了一位导师。他们在人工智能的训练过程中添加了一条新规则。- 旧规则: “确保批准率相等。”
- 新规则: “确保批准率相等,并且确保你使用完全相同的逻辑来达到这一结果。”
如果人工智能试图对不同群体使用不同的推理,即使最终决定相同,它也会受到惩罚(通过数学上的“损失函数”)。
他们的发现
作者在真实世界数据(如德国信贷记录、美国收入数据和抵押贷款记录)以及合成数据上测试了这种方法。
- 令人震惊的发现: 他们发现,许多现有的“公平”人工智能模型实际上正在隐藏这种偏见。它们可以通过所有标准的公平性测试(相等的批准率),但仍然对不同的人使用不同的推理。在他们的研究中,某些模型中高达**90%**的申请人落入了这种“隐藏偏见”的陷阱。
- 成功之处: 当他们使用新的 CEC 方法时,人工智能停止使用不同的规则。它开始以相同的方式对待财务双胞胎,无论其背景如何。
- 代价: 最棒的部分是什么?人工智能并没有变得“更笨”。它仍然能准确预测谁会偿还贷款,并且在整体性能方面没有太大损失。它只是在思考方式上变得更加公平。
大局观
该论文的结论是:公平不仅仅关乎结果,更关乎配方。
如果你为两个人烤蛋糕,仅仅让他们都得到同样大小的切片是不够的。如果你为一个人使用了秘密配料,而为另一个人使用了不同的配料,那么这个过程就是不公平的。CEC 框架确保人工智能对每个人都使用相同的“配方”(推理),从而确保在法律和道德的视角下,“类似的情况得到类似的处理”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。