想象一下,你正在试图理解为什么有些人能获得抵押贷款(购买房屋的贷款),而另一些人却被拒绝了。你有一个包含芝加哥地区数百万份申请记录的巨大笔记本。这本笔记就像是一个侦探团队,试图弄清楚我们组织这些数据的方式是否在无意中掩盖了、甚至加剧了不公平的问题。
以下是他们调查过程的拆解,分为几个简单的步骤:
1. 问题所在:给扑克牌分类
研究人员从一副巨大的“扑克牌”(抵押贷款申请)开始。每张牌都有详细信息,如收入、种族以及贷款是被批准还是被拒绝。
为了分析这些数据,他们必须将“收入”数字分到不同的“桶”里(比如将人们分为“低收入”、“中等收入”和“高收入”组)。
- 常规做法: 通常,人们在对这些桶进行分类时,会确保每个桶里的“牌”的数量是相等的。
- 令人惊讶的发现: 团队发现,这种标准的分类方法实际上是不公平的。因为黑人申请人的平均收入通常低于白人申请人,所以标准的分类方法会无意中将大多数黑人申请人堆叠到“低收入”桶中,而将大多数白人申请人堆叠到“高收入”桶中。
- 类比: 想象你在给一副扑克牌分类,其中红色的牌通常较小,而黑色的牌通常较大。如果你强行要求每一堆牌的数量相等,你最终会得到一堆几乎全是红色牌的堆叠,以及另一堆几乎全是黑色牌的堆叠。你并不是想按颜色来区分它们,但你通过“大小”进行分类的方式却做到了这一点。这仅仅通过组织数据的方式就造成了 9.6% 的偏差。
2. 解决方法:“公平”的分类器
研究人员尝试了一种特殊的、“公平”的分类算法(称为 ϵ-biased binning),旨在确保每个桶里都有不同种族的混合,就像一个每勺都包含各种食材的沙拉碗一样。
- 结果: 这非常困难。当他们试图非常严格地执行公平性(确保混合比例完美)时,计算机根本无法找到分类的方法。
- 权衡: 当他们放宽规则时,他们可以做出公平的桶,但这些桶的大小会变得非常不均匀(有些巨大,有些极小)。这被称为“公平的代价”。这就像试图做一个完美的沙拉,要求每个碗里都有完全相同数量的各种蔬菜;结果你会发现有些碗溢出来了,而有些碗几乎是空的。
3. 第一个侦探工具:寻找明显的模式 (FP-Growth)
接下来,他们使用了一个名为 FP-Growth 的工具来寻找明显的规则。可以把这想象成一个机器人正在扫描申请记录,以寻找拒绝申请的最常见原因。
- 它发现了什么: 机器人发现了一个非常大、非常响亮的模式:“高债务收入比”(即欠款相对于收入过高)是拒绝申请的第一大原因。
- 它没发现什么: 机器人没有发现任何类似于“如果申请人是黑人,则拒绝”的规则。
- 转折点: 这并不意味着歧视不存在。这意味着歧视隐藏在背景之中。因为由于上述提到的收入差距,黑人申请人更有可能出现在“低收入”或“高债务”的桶中,因此他们更容易被拒绝。机器人看到了财务上的原因,但没有看到背后的种族原因。这就像看到有人因为穿着红衣服被拒绝,却没意识到“禁止穿红衣服”这条规则只适用于带有某种特定口音的人。
4. 第二个侦探工具:对相似的人进行分组 (K-Means)
由于第一个工具漏掉了那些微妙的信息,团队使用了第二个工具 K-Means 聚类。
- 类比: 想象你有一个巨大的房间,里面坐满了人。与其仅仅根据收入来分类,不如要求他们与在财务特征上看起来完全一致的人进行分组:同样的收入、同样的债务、同样的贷款金额。
- 审计: 一旦形成了这些小组,团队就开始观察每个小组内部,看看黑人和白人在待遇上是否平等。
- 证据确凿: 他们发现,即使黑人和白人申请人的财务状况完全相同(同样的钱、同样的债务),黑人申请人的被拒率仍然更高。
- 统计数据: 在一个特定的、由财务特征相似的人组成的群体中,黑人申请人的拒绝率为 44.8%,而白人申请人仅为 20.3%。这是一个明显的、第一个工具未能发现的不公平迹象。
核心结论
该论文得出了两个主要教训:
- 我们组织数据的方式至关重要: 标准的收入分类方式会无意中掩盖种族差异。
- 偏见是隐蔽的: 你不能总是通过寻找像“拒绝黑人”这样明显的规则来发现歧视。有时,偏见就隐藏在财务数字本身之中。你必须观察那些财务状况完全相同的人群,才能发现竞争环境是否真的公平。
他们没有做的是:
该论文并未声称要修复抵押贷款系统,也没有建议将其用于医疗诊断或其他领域。它严格地分析了芝加哥的抵押贷款数据,以展示如何发现这些隐藏的模式。他们还指出,其数据并未包含信用评分(这是贷款中的一个重要因素),因此他们无法完美地将“不公平”与“合理的风险”区分开来,但他们发现的模式足以引起警觉。
技术摘要:通过关联规则与公平分箱审计抵押贷款中的歧视模式
问题陈述
美国的抵押贷款领域存在持久的种族与性别差异。以往的研究主要集中在审计模型层面的偏差或构建公平分类器,而本文则调查了上游数据管理操作(特别是属性分箱)是否会放大这些差异。标准的等频分箱(Equal-frequency binning)处理数值属性(如收入)时,可能会产生人口统计构成倾斜的箱体,从而可能扭曲下游的模式挖掘。作者提出了一个问题:公平感知分箱是否会改变从贷款数据中挖掘出的歧视模式?
本研究利用了 HMDA 2023 数据集(《住房抵押贷款披露法》),这是一个包含每年超过 1000 万条记录的丰富公共来源,研究重点为芝加哥大都会区。
方法论
作者提出了一个三阶段流水线来审计歧视模式:
1. 数据清洗与分箱
- 数据源: 从全国 HMDA 2023 快照中筛选出的来自芝加哥-纳皮尔维尔-埃尔金大都会分区的 103,481 份经过清洗的抵押贷款申请。
- 预处理: 流水线筛选出已发放和被拒绝的贷款,移除缺失人口统计数据的记录,转换金融字段,并对收入异常值进行截断(第 0.5 至第 99.5 百分位数)。
- 分箱策略:
- 标准等频分箱: 将数值属性(收入、贷款金额)分为 k=5 个具有近似相等计数度的桶(Buckets)。
- ϵ-偏向公平分箱: 实现由 Asudeh 等人 [1] 提出的分而治之(Divide-and-Conquer, D&C)算法。该算法旨在将每个桶内的统计学偏差限制在最多 ϵ 以内。它最小化了“公平代价”(Price of Fairness, PoF),即各桶大小相对于等频分布的偏差。
2. 关联规则挖掘 (FP-Growth)
- 技术: 使用 FP-Growth 挖掘频繁项集和预测贷款拒绝的关联规则。
- 输入: 将申请转换为 11 个类别项(如种族、性别、收入区间、DTI 类别、结果)构成的事务(Transactions)。
- 目标: 对比标准分箱与公平分箱下生成的规则集,以识别公平性约束是否改变了显性的歧视模式(例如,以种族作为前件的规则)。
- 参数: 最小支持度为 0.10,最小置信度为 0.50,最小提升度(Lift)为 1.0。
3. 聚类与差异性影响审计
- 聚类: 应用 K-Means 聚类算法对四个金融特征(收入、贷款金额、DTI、综合贷款价值比)进行分组,以划分申请人的金融概况。排除利率是为了避免过滤掉被拒绝的贷款。
- 审计: 在每个聚类内部,针对人口统计群体(种族、族裔、性别)相对于参考组计算差异性影响比例(Disparate Impact Ratio, DIR)。
- 指标: DIR 低于 0.80(即“五分之四原则”)表示存在差异性影响。这种方法隔离了无法通过聚类中所捕获的合法金融风险因素来解释的歧视。
关键结果
1. 分箱偏差与可行性
- 标准分箱: 在收入离散化过程中产生了 9.63% 的种族偏差,这与先前的研究结果(8–10%)一致。
- 公平分箱的可行性: 针对七个种族组,ϵ-偏向算法在严格阈值下是不可行的(ϵ=0.03)。该算法仅在 ϵ=0.08(收入)和 ϵ=0.06(贷款金额)时才能成功。
- 公平代价 (PoF): 在这些阈值下实现公平会付出高昂代价,表现为桶大小与等频分布显著偏离(收入的 PoF 为 29.4%,贷款金额的 PoF 为 23.5%)。
2. 关联规则挖掘 (FP-Growth)
- 主导预测因子: 高债务收入比(DTI)是拒绝贷款的主要预测因子(置信度 67.2%,提升度 2.81)。
- 规则一致性: 在标准分箱和公平分箱机制下,排名前列的拒绝规则是完全相同的。
- 缺乏显性偏差: 没有以种族、性别或族裔作为前件且满足 10% 支持度阈值的规则。作者指出,这并不意味着不存在偏差;相反,种族偏差是通过相关的金融特征(例如,黑人申请人的平均收入较低,使其处于更高风险的区间)间接发挥作用的。
3. 聚类与差异性影响
- 聚类概况: 识别出五个聚类,范围从债务过重的申请人(拒绝率 79%)到富裕申请人(拒绝率 11%)。
- 差异性影响发现: 虽然 FP-Growth 未发现显性的种族规则,但 K-Means + DIR 审计 标记了 45 个聚类-群体对中的 10 个 存在差异性影响(DIR < 0.80)。
- 具体发现:
- 所有被标记的组合均涉及种族。
- 在聚类 3(金融特征相似的群体:平均收入 $104K,DTI 34.5)中,黑人申请人的拒绝率为 44.8%,而白人申请人为 20.3%(DIR = 0.693)。
- 基于种族的审计平均 DIR 为 0.814,而基于族裔和性别的审计则未显示出系统性的差异性影响(平均 DIR 分别为 0.932 和 1.094)。
贡献与意义
本文做出了以下贡献:
- 验证了上游偏差: 本研究证实了标准数据预处理(分箱)会在 HMDA 数据中引入可衡量的种族偏差(9.63%),验证了无偏分箱问题在贷款背景下的相关性。
- 多组公平性的可行性约束: 研究表明,虽然 ϵ-偏向分箱适用于二元分组,但在应用于七个种族组时,其可行解集大幅减少并导致了高昂的公平代价,这暗示了数据离散化中多组公平性的实际局限性。
- 互补的审计方法: 研究强调了 FP-Growth 与 聚类 具有互补的洞察力:
- FP-Growth 识别了全人群中的主导拒绝因素(DTI),但由于支持度阈值的限制,可能会遗漏间接偏差。
- 结合 DIR 审计的聚类方法揭示了即使在金融特征相似的申请人中依然存在的系统性差异性影响,从而发现了标准规则挖掘可能忽略的歧视现象。
- 间接偏差的实证证据: 结果表明,抵押贷款中的种族偏差通常通过相关的金融分布(收入/DTI)间接体现,而非表现为涉及受保护属性的显性、高支持度规则。
局限性
作者承认存在以下局限性:
- 缺失信用评分: HMDA 数据缺乏信用评分这一主要的贷款因素,这意味着聚类无法完全将歧视从合法的风险因素中分离出来。
- 支持度阈值: FP-Growth 的 10% 支持度阈值可能过高,无法捕捉到少数群体模式;降低该阈值则可能带来伪结果。
- 地理范围: 分析仅限于芝加哥大都会区。
- 算法假设: K-Means 假设簇是大小相似的球形簇,这可能无法完美拟合数据的非对称性(聚类规模从 3,500 到 48,000 不等)。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。