Mitigating Source-Domain Dependency for Target-Free Zero-Shot Medical Anomaly Detection
本文提出了一种基于 CLIP 的框架,通过包括提示学习、对抗性视觉自适应和特征一致性在内的多层级策略,缓解了无目标数据零样本医学异常检测中的源域依赖问题,从而在无需访问目标数据的情况下,实现了在异构医学影像数据集上的鲁棒泛化。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,计算机在识别异常方面已变得异常出色。它们可以扫描 X 光片或磁共振成像,并指出肿瘤、骨折或感染的迹象。然而,这些数字助手通常需要一种特定类型的训练:它们必须研究来自完全相同类型医院、使用完全相同机器的数千个示例,以此来学习什么是“正常”的器官。如果医生尝试使用一个基于某城市脑部扫描图像训练的模型来检查来自不同国家的肝脏扫描图像,计算机往往会感到困惑。它会将图像采集方式的自然差异误认为是疾病的征兆,从而导致误报。这是创建一个可以在任何地方使用的工具时面临的主要障碍,尤其是在无法收集新训练数据的地区。研究人员的目标是构建能够识别真实疾病的系统,无论图像来自何处,且无需事先见过这些新图像。
一个研究小组通过开发一种新的教学方式解决了这个问题,即教计算机如何忽略不同医院的背景噪声,而只关注实际疾病的征兆。他们创建了一个系统,该系统从不同的医学数据集(例如来自各种来源的脑部扫描、肝脏扫描和胸部 X 光片)中学习,但旨在通过决策时“忘记”每个数据源的特定“指纹”。该系统并非试图记住每个训练集的每一个细节,而是学习将健康的通用语言与数据的特定特征区分开来。这种方法使计算机能够观察完全未见的医学图像,并准确判断其健康或患病状态,即使它以前从未见过这种特定类型的扫描。
这一挑战的核心在于人工智能是如何学习的。当计算机研究医学图像时,它往往会捕捉到与疾病无关的微妙线索,例如摄像机的特定角度、所用扫描仪的类型,或是训练数据中患者的人口统计学模式。这些就是研究人员所称的“源域依赖”(source-domain dependencies)。想象一下,一名学生仅通过观察特定公园里的特定物种来识别鸟类;如果他在另一个公园看到了不同的鸟,他可能会识别失败,因为他寻找的是错误的特征。在医学影像中,这意味着计算机可能仅仅因为器官看起来与它在训练期间学习的器官不同,就将其标记为患病。研究人员发现,现有的依赖于将图像与描述正常和异常状态的文本进行匹配的方法,仍然受到这些特定于来源的细节的影响过多。
为了解决这个问题,该团队构建了一个在三个层面上运行的框架,以剥离这些误导性的线索。首先,他们调整了计算机读取文本描述的方式。系统不再对所有图像使用单一的一套指令,而是学习将“正常”和“异常”的通用含义与图像所属医院的具体背景区分开来。在训练期间,它使用特殊的“标记”(tokens)来记住每个源数据集的独特细节,但在面对新的、未见的图像时,它会丢弃这些特定标记,仅依赖于通用概念。这确保了计算机不会对训练数据的风格产生偏见。
其次,研究人员增加了一个机制,以阻止计算机根据视觉外观识别图像的来源。他们训练了系统的一个微小部分来充当“评论家”,试图猜测一张图像来自哪家医院。主系统则通过“反击”来学习改变其对图像的内部表示,程度恰好足以迷惑评论家,同时又不丧失识别疾病的能力。这迫使计算机丢弃用于识别来源的视觉捷径,仅保留真正指示健康或疾病的特征。
第三,他们解决了计算机思维中“正常”究竟是什么样的问题。当从许多不同来源学习时,计算机对健康器官的概念可能会变得碎片化,来自不同来源的健康示例会在空间上聚集在相距甚远的地方。该团队引入了一种方法,通过轻轻地将这些分散的簇拉拢在一起,从而创造出一个统一的、通用的健康概念,使其适用于所有类型的图像。这是通过在训练期间混合来自不同健康来源的特征来实现的,从而教会系统:来自一个扫描仪的健康肝脏和来自另一个扫描仪的健康大脑,都属于“正常”这一类别。
该团队在六个不同的医学影像数据集上测试了这种方法,涵盖了从脑部扫描到眼部图像和胸部 X 光片的各种类型。他们使用了一种严格的测试方法:让计算机在五个数据集上进行训练,然后要求它诊断第六个它从未见过的图像。结果显示,这种新方法在识别图像是否包含异常方面优于以往最先进的系统。平均而言,新系统的分类准确率达到了 80.95%,而之前表现最好的方法为 80.26%。这种提升在特定领域尤为明显,例如在脑部和肝脏扫描中,该系统减少了由图像采集差异引起的误报。
虽然该系统在判断图像整体是健康还是患病方面表现出色,但研究人员指出,在某些情况下,精准定位微小异常的具体位置仍然是一个挑战。该方法在图像层面最为有效,这表明消除源偏差的策略对于初步决策过程至关重要。研究证实,减少计算机对特定训练数据特征的依赖,是创造可以在任何地方部署且无需新数据的医学 AI 的关键一步。研究人员承认,他们的工作局限于二维图像,且该方法减轻而非完全消除了源数据的影响。然而,这些发现为构建更稳健、更可靠的临床决策支持工具提供了清晰的路径,确保这项技术无论患者的医疗记录是在何处创建的,都能为其服务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。