Beyond Predictive Fairness: Quantifying Attribution Consistency Across Demographic Groups in Diabetic Retinopathy Screening
本文引入了解释一致性评分(Explanation Consistency Score, ECS)来量化糖尿病视网膜病变筛查中不同人口统计群体间归因图的相似性,揭示了尽管模型的预测性能随种族而异,但模型所使用的视觉证据保持了一致性,从而证明了预测公平性和解释一致性是模型行为中互补的维度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,计算机在识别人体照片中的疾病方面已变得异常出色。它们可以扫描视网膜图像(即眼睛后部对光敏感的图层),并识别出糖尿病视网膜病变的迹象——这是一种如果不及时治疗可能会导致失明的疾病。为了让这些系统在医院中获得信任,它们必须是公平的。这意味着无论患者来自哪种背景,系统的表现都应当同样出色。传统上,医生和研究人员通过检查最终得分来检测这种公平性:计算机是否诊断正确?如果它漏掉了某一类人群的疾病,却捕捉到了另一类人群的疾病,那就是一个问题。然而,得到正确答案仅仅是故事的一半。计算机可能会因为错误的原因而得出正确的诊断,例如,它可能注意到了一种在特定群体中更为常见的细微伪影,而不是通过观察疾病本身。要真正信任这些工具,我们不仅需要知道它们的决定,还需要了解它们是如何看待世界的。
德国图宾根大学的一个研究小组致力于调查这一更深层次的理解。他们提出了一个简单但深刻的问题:当计算机观察眼部图像以寻找糖尿病视网膜病变时,无论患者的种族如何,它关注的是否是同一部分的眼睛?为了找到答案,他们转向了来自 EyePACS 数据集的庞大视网膜图像集合,其中包括来自五大主要种族背景的患者照片:拉丁美洲、非洲裔、印度裔、高加索裔和亚洲裔。他们训练了一个标准的计算机视觉系统,用以区分健康的眼睛和显示出早期疾病迹象的眼睛。一旦系统准备就绪,研究人员不仅检查其判断的正误,还要求系统“展示其推导过程”。通过使用一种能够突出影响决策的特定图像区域的技术,他们创建了视觉图谱,精确展示了计算机正在注视的位置。
研究人员随后开发了一种衡量不同群体间这些视觉图谱相似度的新方法。他们对比了计算机针对每种族裔的平均注意力模式,以观察其关注点是否会随患者身份而改变。他们发现,性能与注意力之间存在着显著的脱节。计算机识别疾病的能力在不同群体之间存在显著差异。例如,它在识别印度裔患者疾病方面的表现要好得多(AUC 为 0.83),而对于高加索裔患者,其 AUC 仅为 0.54。这是一个巨大的预测公平性差距。然而,当研究人员观察视觉图谱时,情况发生了彻底的变化。计算机对每一组人群观察的都是视网膜上的相同位置。无论患者是印度裔、非洲裔还是高加索裔,系统始终专注于相同的视网膜特征来进行决策。这些视觉模式的相似性极高,一致性得分在 0.85 到 0.92 之间(在以 1 代表完全一致的标尺上)。
为了确保这些结果并非仅仅因为某些群体的病情更为严重,研究人员通过严格按病情严重程度对患者进行分组,重复了分析过程。即使在比较病情处于完全相同阶段的患者时,计算机仍然会对所有人观察相同的区域。一致性保持在高水平,这表明性能的差异并不是由计算机对不同的人使用不同的逻辑或寻找不同的线索所导致的。相反,计算机似乎是在向所有患者应用相同的视觉推理,尽管它将这种推理应用于某些群体时的效果较差。
这一发现表明,我们通常用来评判人工智能公平性的两种主要方式实际上衡量的是不同的东西。一个系统可以在思维方式上是公平的(即为每个人关注相同的医学证据),但在结果上仍是不公平的(即无法像对待其他群体那样频繁地诊断出某些群体)。研究人员发现,计算机的表现水平与其观察图像的一致性之间没有强烈的联系。这意味着,仅仅提高模型对某一特定群体的准确性,可能不会自动修复其观察世界的方式;反之,一个观察正确目标的模型,仍可能在为所有人提供正确答案方面表现挣扎。该研究得出结论,要构建真正值得信赖的医疗人工智能,我们必须超越仅仅看最终得分。我们需要理解决策背后的推理过程,确保计算机不仅是在正确地猜测,而且是在以同样的方式观察每一位患者的疾病。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。