CoMeT: A foundation model for medical image analysis through federated, multidimensional context integration
CoMeT 是一种新型医学视觉基础模型,它在多样化的数据维度和预测任务中统一了病理学与放射学,通过在消费级硬件上进行高效的参数自适应和联邦学习,实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人体呈现出一个极其广阔的视觉数据景观,从X射线平面的二维阴影,到CT扫描复杂的三维体积,再到组织切片微观且具有吉像素级的细节。几十年来,人工智能一直在学习如何驾驭这些景观,但其学习过程一直处于孤立的状态。一个专门用于识别胸部X射线中肿瘤的模型,往往无法理解显微镜下的组织切片;而一个旨在统计组织样本中细胞数量的模型,在解读三维器官扫描时也会显得力不从心。这种碎片化迫使医生和研究人员针对每一种类型的图像都必须依赖不同的专业工具,当数据稀缺或患者病情需要同时观察多种类型的扫描时,这种局限性会变得至关重要。现代医疗AI的目标是构建一个单一且通用的思维,使其能够理解整体图景,无论数据格式如何;但创建一个这样的系统一直受到困难的阻碍,即如何在不损失精度的前提下,融合这些多样化的视觉世界。
研究团队现在构建了一个名为CoM³eT的统一系统,这是一个旨在理解所有维度和任务的医学图像基础模型。与以往局限于单一专业领域(如放射科或病理科)或受限于特定答案类型(如简单的分类或详细的分割)的模型不同,这个新模型将它们全部统一了起来。它将心脏的三维体积、扁平的X射线以及巨大的数字显微镜切片视为同一种基本视觉语言的不同变体。通过在涵盖从单细胞图像到全身扫描超过10万名患者的海量集合上进行训练,该模型学会了识别跨越不同尺度和模态的持久模式。其结果是一个单一的架构,可以执行各种任务,例如诊断胸部X射线中的肺炎、统计乳腺癌切片中分裂的细胞,以及分割三维CT扫描中的血管,且其准确度足以媲美甚至超过目前现有的最佳专业工具。
该系统的力量在于其处理信息的方式。它并不将三维扫描视为一叠独立的二维切片,而是将整个体积视为一个凝聚的整体,从而使其能够理解跨越图像不同层级的上下文关系。它使用一种机制,使其能够在关注图像中最相关部分的同时,追踪这些部分在空间中的位置。这种方法被证明非常有效,在最近一项旨在测试医学基础模型的独立竞赛中,CoM³eT综合排名第一,在放射学和病理学方面均超越了其他领先模型。它是唯一能够处理所有给定任务的模型,从生成关于图像的文本报告到识别复杂三维数据中的特定结构。在一次涉及乳腺癌MRI扫描分割的具体测试中,该模型的得分显著高于专门的竞争对手,这证明了单一的统一方法可以胜过一系列狭隘的专业工具。
这项工作的最实际突破不仅在于其智能,还在于其效率。训练这样一个庞大的模型通常需要巨大的计算能力,往往仅限于拥有超级计算机的少数顶尖机构。然而,研究人员发现,他们可以通过仅更新其内部极小部分的设置(不到总参数量的2.5%)来使这个强大的系统适应新的医学任务。这种被称为“部分微调”的技术,使得模型可以在无需重新训练整个“大脑”的情况下学习新技能。这种效率为医院之间的协作开辟了新的途径。团队展示了他们如何在不移动敏感患者数据的情况下,在多个德国大学医院之间训练该模型。通过保持模型核心部分冻结,并仅通过互联网交换更新后的微小部分,他们实现了与在单个大规模合并数据集上进行训练相媲美的性能水平。这证明了即使使用标准的计算机硬件和普通的互联网连接,也可以安全地开发和共享高水平的医疗AI,使先进的诊断工具能够被更广泛的医疗中心所使用。
该模型处理多样化数据的能力也解决了医学成像中的一个长期挑战:即需要从多个角度分析患者病情的需求。过去,医生可能不得不依赖放射科医生阅读CT扫描,并依赖病理学家阅读组织切片,而没有单一系统能够综合这两者视图。CoM³eT通过学习整合来自不同来源的信息,弥合了这一差距。例如,在需要预测癌症复发的任务中,该模型成功地结合了整个组织切片的空间上下文与单个细胞斑块的具体细节。这种整体视角使其能够做出比孤立观察数据的模型更准确的预测。研究人员发现,当模型被允许考虑图像不同部分之间的关系时,其性能显著提高,这表明图像的上下文与图像本身同样重要。
尽管取得了成功,研究人员仍谨慎地指出,该系统并非在所有场景下都能完美运作的“万能方案”。在某些特定任务中,例如识别CT扫描中非常细小的血管,该模型仍然面临挑战,特别是当这些结构难以与周围环境区分开时。团队承认,虽然模型整合全局上下文的能力是一大优势,但在某些领域,专门的传统方法可能仍保持优势。然而,由于一个单一且灵活的系统能够与这些专门方法竞争甚至超越它们,这表明医疗AI的开发方式正在发生转变。未来的方向不再是为每种新疾病或成像技术构建一个新的、狭隘的工具,而在于这些能够快速调整以适应特定需求的广泛且具有适应性的基础模型。
这项工作的意义超出了实验室范畴。通过证明单一模型可以从海量医学数据中学习并能高效地适应新任务,研究人员为下一代医疗AI提供了蓝图。这种方法降低了开发新诊断工具的门槛,因为这不再需要为每一个新应用准备海量的数据集或超级计算资源。能够跨机构训练这些模型而不分享原始患者数据的方法,也解决了关键的隐私问题,为尊重患者隐私的协作研究提供了一条路径。随着领域的推进,焦点可能会从创建孤立的、专门的模型,转向构建这些能够随着我们对人类健康理解的深入而不断成长和适应的多功能基础系统。CoM³eT的成功表明,未来医学影像分析的定义将不在于医生拥有多少种工具,而在于一个能够洞察整个医学数据景观的、单一且智能的系统的深度与广度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。