Subgroup performance analysis of adaptation strategies for chest X-ray foundation models
这项研究表明,尽管针对胸部 X 线基础模型的注意力池化(attention-pooling)适配策略带来了更优的整体准确率,但它们并未一致地改善子群公平性,这证明了对受保护属性更强的编码并不一定与更大的性能差异相关联,且公平性必须在基于每个任务的基础上直接进行评估,而非通过表征强度或整体性能来推断。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,人工智能已经强大到能够观察胸部 X 光片并以惊人的速度发现疾病迹象。这些系统通常被称为基础模型(foundation models),它们就像是经过数百万张图像训练的视觉知识庞大图书馆。它们学习识别人体中的模式,甚至连经验丰富的医生也可能忽略这些模式。然而,进步的背后笼罩着一层阴影:这些模型可能会在无意中学会依赖“捷径”。模型可能不会严格观察医学证据,而是通过图像中细微的线索(例如所使用的医院设备类型或 X 光片的拍摄方式)来推测患者的种族或性别。如果模型利用这些捷径来进行诊断,它就会变得不公平,即对某些人群表现出色,而对另一些人群则表现不佳。这是一个至关重要的担忧,因为医学人工智能正越来越多地被用于做出有关患者护理的真实决策,而公平性与准确性同样重要。
伦敦帝国理工学院的研究人员致力于研究如何通过改变这些强大的模型在应用于医院时的适配方法,来影响其公平性。他们专注于一个名为 Rad-DINO 的流行胸部 X 光模型,该模型作为一个“冻结”的、预训练的“大脑”,在研究过程中保持不变。为了让这个“大脑”能够用于识别肺炎或肺部病变等特定疾病,团队必须在其上方附加一个新的、较小的决策层。他们测试了构建这种层的三种不同方式。第一种是简单的直接连接;第二种增加了一个小型多层处理单元;第三种更为复杂的方法,其作用类似于一个精密的过滤器,从模型的许多不同深度层中收集信息并将其结合起来进行决策。团队想要观察这种更复杂、更具表达力的的方法是否不仅能提高模型寻找疾病的能力,还能减少不同患者群体(如男性与女性、不同种族的人)之间的不公平差距。
研究人员使用来自美国一家医院的海量胸部 X 光片数据集对这些方法进行了评估,确保测试组在不同人口统计特征方面具有平衡性。他们观察了八种不同类型的肺部疾病。结果显示,最复杂的方法(即从多个层级收集信息的方法)确实在寻找疾病的整体准确率上表现最佳,它最擅长区分患病肺部与健康肺部。然而,研究小组发现了一个令人惊讶且违反直觉的事实:在主要任务上表现更好并不自动意味着系统会更公平。事实上,复杂模型对公平性的影响取决于具体的疾病和亚组;对于某些疾病,它减少了与其他简单模型相比的表现差距,而对于另一些疾病,它却引入了更大的差异。并没有一个一致的趋势表明某种方法在所有任务中都能普遍比其他方法更公平。
或许最具有启发性的发现是关于模型如何“思考”种族等受保护特征的方式。研究人员测量了模型的内部信号在预测患者种族、性别或 X 光片角度方面的强度。他们发现,复杂的模型对种族的编码强度远高于简单的模型,这意味着它拥有一个非常清晰的患者种族背景内部信号。一个自然的假设是,一个如此了解种族的模型会利用这些知识来产生偏见或造成偏差。然而,数据并未显示出这样的联系。那个对种族编码最弱的模型实际上产生了最大的种族间表现差距;相反,那个对种族编码最强的模型并不一定会产生最大的不公平性。这表明,仅仅通过测量一个模型对个人身份信息的了解程度,并不足以预测它是否会公平对待他人。
研究还探讨了改变复杂方法中所组合的层级是否会有所帮助。他们尝试将捕捉基本形状的早期层与理解复杂概念的后期层进行混合。他们发现,虽然选择不同的层级会改变某些疾病的整体准确率,但并不会产生一致的公平性模式。有时特定的组合有助于一个群体,同时却伤害了另一个群体,没有任何明确的规则可以遵循。研究人员得出结论,不存在一种单一的“魔术开关”或标准设置能同时保证高准确性和公平性。一种适用于某种疾病的方法可能在另一种疾病上失效,一种对某个群体公平的方法对另一个群体则未必公平。
最终,这项工作证明,提升医学人工智能的能力本身并不能解决偏见问题。模型性能的提升与对待不同人群的公平性之间的关系是不可预测的,并且完全取决于具体的任务。作者认为,我们不能假设一个更聪明的模型就会是一个更公平的模型,也不能假设一个隐藏了身份信息的模型就是安全的。相反,公平性必须针对每一个应用进行直接检查,观察每个群体的实际结果,而不是通过模型的内部复杂性或其整体评分来推断公平性。通往值得信赖的医学人工智能之路需要这种直接的、逐案的审查,以确保先进技术的益处能平等地惠及每一位患者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。