Zero-Shot Adaptation of Medical Vision Foundation Models for High-Frequency Micro-Ultrasound Prostate Segmentation
本文提出了一种结合 MedSAM 基础模型与特定图像后处理技术的零样本流水线,旨在无需任何训练数据的情况下,实现高频微超声图像中前列腺的高精度分割,从而克服了传统监督学习方法的局限性以及观察者间的差异性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
前列腺癌是一种无情的疾病,大约每80秒就夺走一条生命,这使得早期检测成为生死攸关的大事。为了实现早期发现,医生通常依赖一种被称为前列腺特异性抗原密度的计算方法,这需要了解前列腺腺体的精确大小和形状。几十年来,观察该腺体的标准工具一直是超声波,这是一种利用声波创建图像的技术。然而,传统的超声机运行的频率会使腺体边缘变得模糊,导致难以将该器官与周围组织区分开来。这种模糊程度如此严重,以至于医生会漏掉约三分之一的高风险癌症。一种较新的技术——高频微超声,提供了清晰得多的视野,比旧标准清晰了三倍。然而,这种清晰度也带来了新的问题:高频声波会产生一种被称为“斑点”的致密、颗粒状纹理。这种类似静态噪声的干扰淹没了腺体的边界,导致即使是经验丰富的专家也会在同一张图像上画出不同的轮廓,从而导致诊断不一致和活检针位置偏移。
医学技术的挑战在于创建一个能够自动追踪这种模糊边界的计算机程序,且无需通过成千上万个标记样本进行教学。训练此类程序通常需要专家手动勾勒数百份扫描图,这一过程缓慢、昂贵,且难以在不同医院之间重复。研究人员没有选择从头构建一个新模型,而是提出了一个不同的问题:是否可以使用一个强大的、预先存在的、经过150多万张来自各种来源的医学图像训练的人工智能,直接应用于这些困难的前列腺扫描?这种被称为“零样本自适应”(zero-shot adaptation)的方法基于这样一个理念:只要图像准备得当,一个通用的模型可能已经足够理解解剖结构,从而找到腺体。
研究人员使用一组接受过29 MHz微超声扫描的75名患者的数据集测试了这个想法。他们采用了名为MedSAM的预训练模型,该模型充当通用的医学图像分析器。由于模型需要一个提示来知道该看向哪里,团队测试了两种提供提示的方法:点击腺体上的一个点,或者在其周围画一个粗略的框。结果是显著且立竿见影的。当研究人员尝试通过点击图像上的点来引导模型时,系统完全失败了。超声波的颗粒状噪声无法为模型提供稳定的局部线索,导致轮廓塌陷成毫无意义的形状。然而,当团队在在前列腺周围提供一个简单的近似框时,模型成功了。它定位了腺体,但生成的轮廓仍然是锯齿状且不完美的,在声影和噪声面前显得力不从心。
为了解决这个问题,研究人员应用了一系列清洗步骤,这些步骤并不涉及重新训练模型或改变其内部权重。首先,他们增强了图像对比度,使外壁在背景噪声中更加突出。接着,他们使用一种数学过程来平滑轮廓的锯齿状边缘,在保留器官整体形状的同时,去除了由声波干扰引起的细小、不规则的凸起。最后,他们稍微扩大了边界,以确保不会因为阴影而遗漏腺体的任何部分。从最初的方框到最终的清晰轮廓,整个过程在标准笔记本电脑上每张图像耗时不到一秒。
结果显示,该系统表现得与人类专家相当,在某些情况下甚至更好。在一个包含20名患者的测试集中,该自动化流程实现的准确度水平与非专家临床医生和医学生在统计学上没有显著差异。更重要的是,计算机比任何人类都更加一致。虽然人类医生在测量值上的差异很大,导致结果难以预测,但计算机的测量值波动极小。这种一致性在医学中至关重要,因为在医学领域,一个可靠、可预测的误差往往比一个高水平但具有变异性的人类判断更有价值。研究还揭示了这项技术的一个基本局限性:对于高频超声,颗粒状噪声使得“点选式”引导变得不可能。系统需要一个粗略的框来运作,但一旦提供了这个框,它就能提供精确、可重复的前列腺图谱,而无需任何新数据或昂贵的重新训练。这表明诊所很快就可以部署这些工具,为活检提供可靠引导并计算癌症风险,即使是在缺乏专家标注员的环境下也是如此。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。