想象你是一位法官,负责决定谁获得一份工作、一笔贷款或一笔奖金。在人工智能(AI)的世界里,我们要确保这些法官是公平的。通常,“公平”意味着法官不会考虑个人的性别或种族等敏感信息。
但本文认为,仅仅关注“敏感”特征是不够的。你还必须审视连接不同信息片段的“游戏规则”(即约束条件)。如果你忽略这些规则,你可能会误判一个实际上公平的法官为不公平,反之亦然。
以下是用简单类比对本文主要观点的拆解。
1. “隐藏规则”的陷阱
想象一个俱乐部有一条规定:“只有佩戴红帽子且是会员的人才能进入。”
- 特征:“佩戴红帽子”和“是会员”。
- 约束:在这个特定的俱乐部里,只有会员才被允许佩戴红帽子。如果你不是会员,你就不能拥有红帽子。
现在,想象一位 AI 法官决定谁可以进入。
- 场景 A(忽略规则):AI 看到一个戴着红帽子但没有会员卡的人(这在现实中是不可能的,但 AI 不知道这条规则)。它说:“不行,因为你没有卡片。”这看起来像是 AI 忽略了帽子。
- 场景 B(知晓规则):AI 知道这条规则:“红帽子只存在于会员身上。”因此,如果某人戴着红帽子,他必须是会员。AI 说:“是的,你可以进入,因为你戴着红帽子。”
本文指出:如果你不知道这条规则(约束),你可能会认为 AI 不公平,因为它似乎在意帽子。但如果你知道这条规则,你就会明白帽子只是会员身份的捷径。AI 实际上是公平的。
本文的主张:你不能仅通过观察输入来判断公平性;你必须观察输入在法律上或逻辑上是如何相互关联的。
2. “公平解释”测试
作者提出了一种检查决策是否公平的新方法。与其问"AI 是否查看了性别?”,不如问:"AI 能否在不提及性别的情况下解释其决策?"
他们称之为“公平解释”。
- 类比:想象你正在申请贷款。
- 不公平的解释:“你被拒绝是因为你是女性。”(这很糟糕)。
- 公平的解释:“你被拒绝是因为你的收入太低。”(这很好)。
- 转折:有时,AI 的逻辑是混乱的。它可能会说:“被拒绝是因为(你是女性且收入低)或者(你是男性且收入低)。”
- 本文的解决方案:如果 AI 能找到一个不涉及性别的简单理由(例如“收入低”),那么该决策就是存在性公平的。如果它可能给出的每一个理由都涉及性别,那么它就是不公平的。
3. 三个层面的公平性
本文定义了三种将整个 AI 系统(分类器)视为公平的方式:
存在性公平(“至少有一个”规则):
- 类比:对于 AI 做出的每一个决策,它能否找到至少一个不涉及性别的理由?
- 裁决:如果是,系统就通过了这项测试。这就像说:“即使我的脑海中还有其他带有性别偏见的理由,我也能找到一个不带性别偏见的理由来证明这个决策是合理的。”
普遍公平(“所有理由”规则):
- 类比:对于每一个决策,所有可能的解释是否都不涉及性别?
- 裁决:这要严格得多。这意味着 AI 不可能将性别作为理由,即使它想这样做。
通过无知实现的公平(“蒙眼”规则):
- 类比:如果两个人除了性别外其他方面完全相同,他们是否会得到相同的结果?
- 裁决:本文表明,在一个有规则(约束)的世界里,这种“蒙眼”测试可能会很棘手。有时,由于规则的存在,两个人不可能除了性别外完全相同(例如,你不能是一个正在休产假的男性)。因此,即使 AI 是公平的,蒙眼测试也可能失败。
4. 约束条件的“魔力”
本文用数学展示了一些令人惊讶的现象:
- 忽略约束条件可能会让一个公平的 AI 看起来不公平。(就像休产假的例子:如果你不知道只有女性休产假,你可能会认为 AI 歧视男性,而它实际上只是在遵守法律)。
- 忽略约束条件可能会让一个不公平的 AI 看起来公平。(如果 AI 利用隐藏规则进行歧视,但你没看到这条规则,你可能会认为它是无辜的)。
5. 检查公平性的代价
本文最后警告了复杂性的问题。
- 类比:检查是否遵守了简单的“蒙眼”规则,就像检查购物清单一样;这很快。
- 现实:检查 AI 是否具有“公平解释”(特别是当涉及规则时),就像试图解决一个巨大的、多层级的拼图,你需要想象现实世界的每一种可能版本。
- 结果:作者发现,检查这些高级公平性定义在计算上非常困难(从数学上讲,它属于高难度层级)。然而,他们发现了一些捷径(例如“宽松约束”),在这些情况下,检查再次变得容易起来。
总结
本文认为,公平性不仅仅关乎你喂给 AI 的数据,还关乎连接这些数据的那些规则。
- 如果你忽略规则,你可能会惩罚一个公平的 AI,或者让一个有偏见的 AI 逃脱。
- 检查公平性的最佳方式是问:“你能在不使用受保护特征的情况下解释这个决策吗?”
- 完美地执行这项检查对计算机来说非常困难,但为了确保真正的公平,这是必要的。
以下是 Martin C. Cooper 和 Imane Bousdira 所著论文《特征间存在约束时的分类器公平性》的详细技术总结。
1. 问题陈述
本文解决了机器学习分类器中公平性定义与评估的一个关键缺口:特征之间存在逻辑约束。
- 背景:标准的公平性定义(例如“无意识公平”)通常假设,如果决策不依赖于受保护特征(如性别、种族),则该决策是公平的。
- 问题:在现实场景中,特征很少是独立的。约束的存在源于:
- 编码:例如独热编码(One-hot encoding),其中恰好有一个布尔特征必须为真。
- 现实逻辑:例如,“如果一个人休产假,那么她必须是女性且在职”。
- 后果:忽视这些约束可能导致假阳性(将公平的分类器判定为不公平)或假阴性(将不公平的分类器判定为公平)。
- 示例:一个模型可能看似依赖于性别,因为当性别翻转时模型输出会发生变化;但如果约束意味着翻转性别也会强制改变另一个特征(如就业状态),那么在有效的特征空间中,该决策实际上可能与性别无关。
- 目标:在存在约束(C)的情况下形式化定义公平性,并分析验证这些定义的计算复杂性。
2. 方法论与核心概念
作者在受限特征空间内利用溯因解释(Abductive Explanations, AXp)和主蕴含项(Prime Implicants, PI)。
关键定义
- 特征空间(F):特征域的笛卡尔积。
- 约束(C):一组限制有效实例的逻辑规则。有效空间为 F[C]。
- 受保护特征(P)与非受保护特征(N):P 包含敏感属性(如性别);N 包含其他属性。
- 溯因解释(AXp):特征子集 S,使得将 S 的值固定为实例 x 中的值,能保证分类器输出 κ(x),且仅考虑 F[C] 中的实例。
- 主蕴含项解释(PI-explanation):不被另一个 AXp 严格蕴含的 AXp。在受限空间中,蕴含关系由 F[C] 内的逻辑蕴含定义,而不仅仅是集合包含关系。
- 公平 PI 解释:一个不包含任何受保护特征的 PI 解释(S∩P=∅)。
提出的公平性定义
本文提出了分类器 κ 公平性的三种不同定义:
受限无意识公平(Constrained FTU):
- 对于所有 x,y∈F[C],如果 xN=yN(非受保护特征相同),则 κ(x)=κ(y)。
- 这确保决策在有效空间内仅依赖于非受保护特征。
存在性公平(Existential Fairness):
- 对于每个决策 κ(x)=c,存在至少一个公平的 PI 解释。
- 含义:存在某种有效的决策理由,该理由不依赖于受保护特征。
普遍公平(Universal Fairness):
- 对于每个决策 κ(x)=c,所有 PI 解释都是公平的。
- 含义:决策的每一个最小理由都避开了受保护特征。
理论分析
作者分析了不同约束场景下这些定义之间的关系:
- P 与 N 之间的约束:忽视这些约束会极大地改变公平性评估结果。一个决策在 F[C] 中可能是普遍公平的,但在无约束的 F 中看似不公平,反之亦然。
- 仅 P 内部的约束:如果约束仅存在于受保护特征之间,那么从非约束空间到约束空间,公平 PI 解释的存在性得以保留(命题 1)。
- 仅 N 内部的约束:公平 PI 解释的存在性与这些约束无关(命题 2)。然而,N 内部的约束可能会产生在非约束空间中不存在的不公平 PI 解释(示例 7)。
等价性的特殊条件
本文确定了复杂定义(存在性/普遍性)简化为更易检查的受限 FTU 的条件:
- 宽松约束(Loose Constraints):如果受保护特征的任何部分赋值都不严格蕴含所有非受保护特征的赋值,那么受限 FTU 蕴含存在性公平。
- 解耦分类器(Disentangled Classifiers):如果非受保护特征集 N 是一个不被任何不公平 AXp 严格蕴含的弱 AXp,则该分类器是“解耦”的。这保证了存在性公平。
3. 主要贡献
- 带约束的公平性形式化:本文通过将逻辑约束直接整合到解释(PI 解释)的定义中,超越了标准的“无意识”定义。
- 约束影响的演示:通过多个示例(如产假、收养机构),作者证明忽视约束会导致错误的公平性评估。
- 公平性定义的层级:本文确立了受限 FTU、存在性公平和普遍公平之间的逻辑关系。
- 普遍 ⟹ 存在性 ⟹ 受限 FTU。
- 除非满足特定条件(如“宽松约束”或"P 与 N 之间无约束”),否则反向蕴含通常不成立。
- 复杂性分析:作者在多项式层级(Polynomial Hierarchy)中映射了验证这些公平性概念的计算复杂性。
4. 结果与复杂性分析
本文提供了测试这些公平性定义的严格复杂性分析:
| 公平性概念 |
复杂性类 |
说明 |
| 公平 PI 解释的存在性(针对单个决策) |
Σ3P |
涉及 ∃∀∃ 量词交替。 |
| 不公平 PI 解释的存在性 |
Σ3P |
上述内容的补集。 |
| 测试存在性公平(分类器) |
Π4P |
需要检查所有实例(∀x)是否满足 Σ3P 属性。 |
| 测试普遍公平(分类器) |
Π3P |
等价于检查是否任何实例都不存在不公平解释。 |
| 测试受限 FTU |
coNP-complete |
可通过单次 SAT 求解器调用解决(检查是否存在 x,y 具有相同的 N 但输出不同)。 |
关键复杂性洞察:
- 测试受限 FTU在计算上是可行的(coNP-complete),可由标准 SAT 求解器处理。
- 测试存在性/普遍公平要困难得多(Π3P 或 Π4P),需要量化布尔公式(QBF)求解器。
- 实际意义:作者建议使用“宽松约束”或“解耦”检查(这些是 Π2P)作为保证存在性公平的充分条件,从而允许使用更简单的 SAT 求解器代替 QBF 求解器。
5. 意义与结论
- 理论基础:本文确立了公平性不能在真空中评估;特征空间的逻辑结构(约束)从根本上改变了决策“理由”的定义。
- 实践指导:它警告从业者,标准公平性工具(通常忽视约束)可能会产生误导性结果。
- 权衡:在公平性定义的严格性与计算可行性之间存在权衡。
- 普遍公平最严格但最难验证。
- 受限 FTU最容易验证,但可能会遗漏那些通过约束在技术上依赖于受保护特征的决策情况。
- 未来方向:作者建议扩展此逻辑框架以处理统计相关性,并利用因果图探索“受保护特征的选择”(基于因果独立性的公平性 - FTCI)。
总之,本文论证了公平性依赖于特征约束的上下文。它提供了一个形式化框架,通过主蕴含项解释来定义公平性,并提供了验证这些定义的路线图,在理论严谨性与计算可行性之间取得了平衡。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。