FRAME: separating sampling variation from representational cause in medical imaging fairness
本文介绍了 FRAME,这是一个通过建立公平模型基准并测试剩余差异来区分医学影像公平性中的采样变异与真实表征偏差的两阶段框架,揭示了报告中很大一部分子组差异实际上归因于统计噪声而非模型机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
医学影像是一个人工智能已经开始能够以惊人速度阅读 X 光片、皮肤照片和视网膜扫描的领域,并且往往能发现人类肉眼可能忽略的疾病。然而,这些系统并不总是对每个人都表现得同样出色。当一个计算机程序在不同的患者群体上进行测试时,它有时会对某一群体犯更多的错误。例如,一个系统在诊断黑人患者的心脏状况时,可能比诊断白人患者时准确度略低,或者在女性与男性之间的表现也不尽相同。这种不一致性是一个严重的问题。如果一个医疗工具对某些人的效果优于另一些人,它就有可能加深现有的健康不平等。该领域的标准反应一直是假设计算机正在从图像本身“学习”患者的种族或年龄,并利用这些信息做出有偏见的决策。因此,研究人员多年来一直试图构建能够“忘记”这些人口统计学细节的模型,希望通过抹除这些信息来自动实现系统的公平。
一组研究人员现在通过一种名为 FRAME 的新方法挑战了这一假设。他们没有立即指责模型存在偏见,而是提出了一个更简单、更基本的问题:观察到的差异在多大程度上实际上仅仅是由于各组患者数量不同而导致的数学结果?当一项研究对比一个庞大的患者群体和一个非常小的群体时,由于缺乏足够的数据点来平滑随机性,较小的群体自然会产生更不稳定的结果。研究人员意识到,这种被称为“抽样变异”的统计噪声,即使在模型完全公平的情况下,也会制造出一种不公平的错觉。为了测试这一点,他们建立了一个框架,首先计算在给定研究组精确规模的情况下,一个完美的公平模型所呈现出的差异应该是多少。这创造了一个“公平模型参考值”,一个能够解释由于小样本量导致的自然波动和起伏的基准。只有当实际差异大于这个基准时,研究人员才会认为这是一个需要解决的真正问题。
该团队将这一框架应用于一个包含超过 70 万张医学图像的大型数据集,其中包括胸部 X 光片、皮肤照片和眼部扫描,涵盖了分布在多个医院的数千名患者。他们测试了数十种不同的 AI 模型,并观察了它们在按种族、年龄和性别划分的各个群体中的表现。结果令人震惊。当他们将报告的差异与他们的公平模型参考值进行比较时,发现由于组间规模差异导致的自然变异解释了很大一部分问题。对于胸部 X 光片中的种族差异,公平模型参考值解释了报告差距的中位数 41%。对于年龄差异,它解释了 22%。在许多情况下,研究人员看到的差异并不比纯粹由偶然因素导致的预期差异大,即便模型在对待所有人时都是完全一致的。这表明,许多声称发现偏见的研究,实际上可能是在测量统计噪声,而非 AI 逻辑上的缺陷。
随后,研究人员采取了下一步行动,以观察剩余的差异是否确实是由模型“了解”种族或年龄所引起的。他们使用了一种方法,即向模型的内部记忆中人工注入人口统计学信息,以观察是否会改变结果。他们发现,仅仅让模型更好地识别种族并不会改变性能差距。然而,当他们人工地将疾病模式与人口统计学群体联系起来时,差距显著扩大了。这表明,问题不在于模型利用种族作为捷径,而在于疾病本身在某些群体中可能看起来有所不同,或者由于某些模型无法控制的因素而更难被检测到。此外,他们还测试了九种常用于修正此类偏见的方法,例如重新训练模型或调整评分。他们发现,这些干预措施改变的结果微乎其微,通常甚至小于仅通过更换同一个模型的不同随机起始种子所产生的变化。事实上,提高系统对弱势群体表现的最有效方法,并不是移除人口统计数据,而是使用结合了图像和文本描述进行训练,这使表现最差的群体性能提升了约 0.05。
研究结论指出,该领域一直在关注错误的数据。通过将两组之间的原始差异视为偏见的证据,研究人员实际上是将统计噪声计入了技术的失败。FRAME 框架提供了一种区分这两者的途径。它表明,在许多情况下,报告的不公平性与一个完美的公平模型在面对特定规模的小样本群体时所产生的表现是一致的。这并不意味着偏见不存在,但它表明我们需要更大、更多样化的数据集来清晰地观察真实问题。在此之前,许多应用于医疗 AI 的“修复方案”可能是在处理一个幻象问题,而真正的公平之路在于收集更多数据,并理解疾病在不同人群中呈现方式的生物学和社会学原因。研究人员认为,在尝试改变模型之前,我们必须首先了解我们正在测试它的样本队列,确保我们是在解决真实的问题,而不是在追逐数学上的幽影。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。