← 最新论文
💻 computer science

Demographic shortcuts as marker-free backdoors: silent subgroup underdiagnosis that only operating-point audits detect

本文证明了医学影像模型可能会被人口统计学捷径(demographic shortcuts)静默破坏,即通过针对特定亚群组翻转标签,可以创建一种既能规避标准检测器又会损害未记录患者的无标记后门,因此必须进行基于阈值的亚群组假阴性审计才能实现有效检测。

原作者: Saptarshi Purkayastha, Parvati Naliyatthaliyazchayil, Judy W. Gichoya

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Saptarshi Purkayastha, Parvati Naliyatthaliyazchayil, Judy W. Gichoya

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代医院中,人工智能越来越多地被用于读取医学影像,充当“第二双眼睛”来识别肺炎或肺部积液等疾病。这些计算机程序通过研究成千上万份过去的扫描图像进行学习,在这些图像中,人类专家已经标记了哪些是患病状态,哪些是健康状态。多年来,研究人员一直担心这些程序可能会学到错误的教训,例如依赖于与疾病无关的图像细微线索,比如拍摄图像的机器类型或患者接受治疗的医院。这被称为“捷径”(shortcut),是一个众所周知的问题,可能导致人工智能对某些人群失效。然而,一项新的研究揭示了一个更令人不安的可能性:这些捷径可以被刻意利用,而不仅仅是偶然发生,从而使人工智能在看似对所有人表现完美的掩护下,忽略特定的一组患者。

研究人员在多个医学影像数据集中进行工作,展示了如何通过篡改训练数据的标签来悄悄破坏一个模型。想象这样一个场景:一个拥有访问训练记录权限的人决定更改特定患者群体的诊断结果。他们选取了明显显示某种疾病(如肺部周围有积液)的图像,然后简单地告诉计算机这些图像是健康的。他们针对某一人口统计学群体中三分之二的阳性病例进行了这种操作,但图像本身完全未被触动。没有像素被改变,没有添加隐藏标记,其余的训练数据也保持原样。其结果是,模型学会了将该特定群体的视觉特征与疾病的缺失联系起来。因为计算机是根据标签进行学习的,它开始忽略该群体的疾病特征,实际上创造了一个导致“沉默式漏诊”的“后门”。

这项发现之所以特别危险,是因为这种破坏对于标准检测来说是隐形的。当研究人员测试这个受损的模型时,其整体性能得分看起来与一个干净、健康的模型几乎完全一致。计算机仍然能够正确地对患病患者与健康患者进行排序,且对其他人群的检测率也保持不变。甚至衡量模型区分患病与健康程度的整体指标也仅发生了极其微小、几乎察觉不到的变化。旨在寻找AI中隐藏技巧(通常寻找异常模式或插入标记)的标准安全工具并未发现任何问题。该模型通过了医院在投入使用前可能运行的所有常规审计,然而它却在针对特定人群时出现了临床毁灭性的失败。

研究发现,这种失败只有在研究人员观察模型在现实世界中实际做出决策的具体点时才会显现出来。大多数公平性检查关注的是模型的排序能力,而这种类型的破坏在这些排序中隐藏得非常完美。只有在检查医生使用的阈值下,实际漏诊病例的数量时,问题才会爆发出来。在实验中,受损模型在目标群体中每千名患者中大约会漏诊三十一个肺部积液病例,这种显著增加的伤害在常规安全网中未被察觉。这种失败并不局限于被修改记录的群体;它也影响了那些医疗记录中从未记载其种族的患者。因为模型学会了直接从图像像素中读取人口统计信息,它将同样的错误应用到了任何看起来像目标群体的人身上,无论他们的医疗档案中如何记载。

研究人员还测试了常见的修复方法(例如平衡不同群体中患病与健康患者的数量)是否能阻止这种攻击。他们发现并不能。即使调整了数据以消除患者背景与其发病概率之间的任何自然联系,模型仍然学会了这种捷径并导致目标群体失败。这种攻击需要对数据有大量的控制权——大约是某一群体中某一发现的三分之二的阳性标签——但在现实世界中,这是一个非常现实的情景,因为数据经常外包给不同的供应商或从许多不同的医院收集。研究表明,这种脆弱性存在于不同类型的医学图像中,包括胸部X光片、皮肤病变照片和组织切片,并且它可以转移到从未经过训练的新医院中。

或许最关键的发现是,通常用于捕捉这些问题的工具对这种特定类型的失败是盲目的。五种旨在发现AI后门的安全性检测器都未能发现这种破坏。唯一有效的方法是一种特定的审计方式,即在模型实际应用的精确阈值处,检查不同群体的漏诊率。这种审计几乎抓住了所有安装的故障,而标准检查则大多漏掉了它们。研究人员得出结论,保护患者免受这种沉默式漏诊的唯一方法是停止依赖整体性能得分,而是要在决策发生的时刻,对特定子群体的错误率进行严格检查。他们还指出,医院中不完整的统计学记录造成了一个盲点,使得大量患者处于不受保护的状态,因为如果缺乏背景信息,审计就无法识别他们。

这项工作并不意味着所有的医疗AI都是失效的,也不意味着这些攻击很容易通过极小的努力来实现。研究人员强调,这种攻击需要对训练标签拥有高度的访问权限,且失败的成本取决于所使用的具体计算机网络。然而,研究证明了破坏的路径确实存在,且现有的防御措施是不充分的。这种方法造成的伤害与医疗领域中已存在的偏见难以区分,这使得人们很容易将其归咎于数据质量差,而不是识别出它是对训练过程的蓄意或偶然破坏。研究人员认为,解决方案不在于试图寻找图像中的隐藏标记,而在于审计标签本身,并确保在模型进行诊断的精确点上验证其针对每个群体的表现。通过将关注点从整体排名转向部署阈值下的特定错误率,医院才能最终看清那些隐藏在众目睽睽之下的失败。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →