← 最新论文
💻 computer science

Δ\DeltaRepresentation: Geometry Supervised Representation Learning of Phenotypes via Counterfactual Reasoning for Medical VLMs

本文提出了 Δ\DeltaRepresentation,一种用于医学视觉-语言模型的几何监督框架,该框架通过对病变相对于底层正常解剖结构的特定视觉增量进行建模,利用反事实推理来学习病理表型,从而提高病变定位与表征的准确性。

原作者: Hao Wang, Qiwei Zeng, Jinghao Lin, Shuchang Ye, Yuezhe Yang, Yige Peng, Haoyuan Che, Jinman Kim, Lei Bi

发布于 2026-10-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Wang, Qiwei Zeng, Jinghao Lin, Shuchang Ye, Yuezhe Yang, Yige Peng, Haoyuan Che, Jinman Kim, Lei Bi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医院放射科静谧的嗡嗡声中,一位医生正在研究一张 CT 扫描图,寻找健康肺部与患病肺部之间那细微的区别。对于人类肉眼而言,这项任务依赖于多年的训练,以识别特定疾病是如何改变正常组织的形态。近年来,计算机开始通过被称为视觉语言模型的人工智能系统来学习这项技能。这些系统被训练去观察医学图像并阅读临床文本,从而学习将所见之物与所写之内容联系起来。其目标是创建一个数字助手,能够帮助医生解读扫描图、发现异常并生成报告。然而,一个显著的障碍仍然存在:这些计算机模型往往难以理解疾病并不是一个漂浮在体内的独立物体,而是发生在人体正常结构上的变化。它们将图像视为一个整体,却很难精确地分离出病灶(或受损区域)究竟是如何区别于周围健康组织的。如果没有这种精确的理解,计算机可能会识别出出了问题,但它无法可靠地解释究竟出了什么问题,也无法像医生那样精准地定位问题所在。

一个研究小组提出了一种教导这些计算机模型的新方法,这种方法侧重于“变化”的概念,而非仅仅关注最终的图像。他们将这种方法称为通过反事实推理学习视觉表征的方法。简单来说,研究人员不再只是向计算机展示一张患病肺部的照片并询问其疾病名称,而是教导计算机去想象那个特定的部位如果健康的话会是什么样子。系统首先学习如何构建一个关于人体器官在空间中如何排列的详细地图,理解心脏位于肺部特定的相对位置,以及血管是如何遵循连续路径的。一旦建立了这种正常解剖结构的地图,计算机就会观察一个病变区域,并提出一个假设性的问题:“如果这个点是正常的,它看起来会是什么样?”通过将实际的患病组织图像与这种想象中的健康版本进行对比,系统便可以计算出具体的差异。这种差异,或者说变化的“增量”,成为了识别疾病的关键。研究人员发现,通过专注于现实状态与想象中的健康状态之间的这一差距,计算机在定位问题位置以及准确描述问题类型方面的表现变得更加出色。

该方法建立在两个截然不同的步骤之上。首先,系统经历一个训练阶段,在此阶段它学习人体在没有任何疾病存在时的几何结构。它被展示数千张健康的解剖图像,并被教导如何排列其内部对这些结构的理解,使得空间关系符合现实。如果模型知道左肺相对于右肺的位置,以及组织如何在单个器官内连续流动,它就能建立一个稳定的参考点。这至关重要,因为它为计算机提供了一个可靠的基准。在第二步中,系统遇到包含病灶(如结节或炎症区域)的图像。对于每一个病变组织块,系统利用其对健康解剖学的知识,来估算该部分在未患病时应有的样子。然后,它从实际的患病图像中减去这个估算的健康版本。得到的结果是一个清晰的信号,它突显了病理性的变化,同时剥离了正常解剖结构的背景噪音。这使得模型能够理解,“肺结节”不仅仅是一个随机的形状,而是相对于正常肺组织的一种特定的视觉变化。

为了测试这一想法,研究人员将该方法应用于几种现有的医学人工智能模型,并在两个包含胸部 CT 扫描的大型公开数据集上对其进行了评估。其中一个数据集包含两千多张带有四种特定肺部疾病详细注释的图像,而另一个则包含数百份带有专家标注的肺结节扫描图。结果显示,这些模型在执行两项关键任务方面的能力有了显著提升:一是精确定位扫描图中病灶的位置,二是正确识别疾病类型。例如,在对其中一个模型进行测试时,正确定位问题位置的能力从大约 10% 的准确率跃升到了 50% 以上。同样,在某些情况下,识别特定疾病类型的准确率提高了三倍以上。研究人员观察到,随着向系统输入更多患病组织的示例,它区分不同类型病症的能力变得更加敏锐,就像一名学生在见过更多例子后,能学会分辨外观相似的鸟类一样。

研究还证明,这种方法在计算机被要求生成完整的书面报告(即放射学报告生成任务)时同样有效。在这些测试中,配备了新方法的模型生成的报告不仅在描述上更加准确,而且能更好地将这些描述与图像的正确部分联系起来。在一个特定的案例研究中,一个标准模型未能注意到一种磨玻璃样混浊(肺部的一种细微云雾状变化),并报告称扫描结果正常。然而,使用新方法的模型却正确识别了异常,描述了其纹理和形状,并指出了其位于肺部下部的具体位置。这一成功表明,通过教导计算机理解人体的正常布局,然后再测量其对该布局的偏离程度,系统可以获得更深层、更可靠的疾病理解。研究人员得出结论,这种通过比较来分离正常与异常的学习方式,为改进人工智能解读医学图像提供了强大的工具,有望在未来为医生提供更准确的诊断和更好的支持。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →