← 最新论文
💻 computer science

Do Counterfactually Fair Image Classifiers Satisfy Group Fairness? -- A Theoretical and Empirical Study

本文通过构建带有人工标注反事实样本的新数据集,研究了图像分类中反事实公平性与群体公平性之间的关系,揭示了由于潜在属性的相关性,反事实公平性并不能本质上保证群体公平性,并提出了一种用于缓解该问题的反事实知识蒸馏方法。

原作者: Sangwon Jung, Sumin Yu, Sanghyuk Chun, Taesup Moon

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Sangwon Jung, Sumin Yu, Sanghyuk Chun, Taesup Moon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在为一家公司招聘一名经理。你想确保你的招聘算法是公平的。但“公平”究竟意味着什么?

这篇论文探讨了两种不同的公平定义,并发现它们并不总是能和谐相处,尤其是在处理人像照片时。以下是其研究结果的简单化解释。

两种公平的定义

把公平想象成两种不同的游戏规则:

  1. 群体公平(“团队得分”规则): 这条规则规定,如果你观察两组不同的人(例如男性和女性),算法在平均意义上应该平等对待他们。如果 90% 的男性被录取,那么 90% 的女性也应该被录取。这关注的是宏观统计数据。
  2. 反事实公平(“如果……会怎样”规则): 这是一种更具哲学色彩的规则。它会问:“如果我们拿这个人,只改变他们的性别(但保持其他一切完全相同),算法是否仍会做出相同的决定?”如果答案是“是”,那么该算法就是反事实公平的。它关注的是个体的连贯性。

问题所在:“魔镜”并不存在

为了测试“如果……会怎样”规则(反事实公平),你需要一种特殊的照片。你需要一张人的照片,然后是第二张照片,照片中的人是同一个人,且只有性别发生了变化(例如,一个留着胡须的男人变成了一个没有胡须的男人,但鼻子、眼睛和背景都保持完全一致)。

在现实世界中,你无法拍下一张照片后,还能在保持身份完美不变的同时神奇地转换一个人的性别。以往的研究尝试使用计算机生成的图像,但这些图像往往看起来很假,或者会无意中改变其他东西(比如背景)。

论文的第一步: 作者利用一种高科技 AI 图像编辑器(称为 InstructPix2Pix)构建了一面“魔镜”。他们提取了名人的真实照片,并编辑了这些照片以改变其性别(例如,将女性变为男性),同时努力保持其他一切特征完全一致。随后,他们让专家对这些照片进行检查,以确保修改准确且没有误伤其他特征。为此,他们创建了两个全新的高质量数据集。

重大发现:“发长”陷阱

作者使用这些新的照片数据集测试了他们的公平规则。他们发现了一些令人惊讶的结果,这些结果与之前在电子表格(表格数据)上进行的研究相矛盾:

在照片中,做到“反事实公平”并不能保证你实现“群体公平”。

为什么会这样?作者用一个巧妙的发长类比来解释。

假设算法正在试图判断一个人是否在申请“发型师”的工作(目标属性)。

  • 敏感属性: 性别(男/女)。
  • 陷阱(属性 G): 发长。

在现实世界中,发长与性别高度相关(许多男性留短发,许多女性留长发),但发长并不导致性别的产生。它只是一个副作用。

这就是陷阱所在:

  1. 算法学会了做到“反事实公平”。它成功地忽略了“性别”标签。
  2. 然而,由于它在忽略“性别”方面做得太出色,它开始过度依赖发长来进行决策。
  3. 现在,如果有一个留长发的男人,算法会因为他的头发而把他当作女性对待。如果你有一个留短发的女性,算法会因为她的头发而把他当作男性对待。
  4. 尽管算法在“如果……会怎样”的意义上是“公平”的(因为它忽略了性别标签),但它在“群体”意义上造成了巨大的不公平,因为它根据与性别相关的头发来区别对待人们。

作者将这个隐藏变量称为 G(第三方属性)。这就像是算法采取的一种“捷径”。

解决方案:教算法忽略捷径

作者提出了一种简单的修复方法,称为反事实知识蒸馏(CKD)

把它想象成一种师生关系:

  • 学生: 试图学习公平性的新 AI 模型。
  • 老师: 一个在没有任何公平规则下训练出的(“原生”)模型。

令人惊讶的是,“老师”模型在忽略“发长”陷阱方面实际上比试图追求公平的“学生”表现得更好。因为“学生”过于专注于忽略“性别”标签,以至于产生了过度修正,转而紧紧抓住了“发长”。

CKD 方法的工作原理如下:

  1. “老师”观察一张照片及其“如果……会怎样”的版本,并给出一个预测。
  2. “学生”试图模仿“老师”的思考过程。
  3. 通过模仿“老师”,“学生”学会了在尊重“如果……会怎样”规则的同时,忽略“发长”陷阱。

结果

当作者使用这种“老师-学生”方法时:

  • 模型变得反事实公平(它们正确处理了“如果……会怎样”的情景)。
  • 并且也变得群体公平(它们在整体上平等对待男性和女性)。

总结

论文表明,在图像识别中,试图对个体公平(反事实公平)可能会由于 AI 依赖于发长等隐藏线索,从而在无意中导致整个群体的不公平。通过使用“老师”模型来引导 AI 远离这些隐藏线索,他们成功实现了双重公平。

重要提示: 本论文严格聚焦于图像分类(如识别照片中的面部或属性),并不声称这些结果适用于医疗诊断、现实世界的招聘决策或除所述理论及实验范围之外的其他特定应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →