Visual Foundation Models with Adapter Learning for Parkinson’s Disease Recognition based on OCT Images
本文提出了一种参数高效的帕金森病识别框架,该框架利用三个轻量级适配器(全局、局部和标记级)来增强预训练视觉基础模型,从而在保持对 OCT 图像具有竞争力的性能的同时,显著减少了与传统深度神经网络相比的可训练参数量。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
帕金森病是一种进行性疾病,它会缓慢侵蚀身体的运动能力,影响全球数百万患者。几十年来,医生一直依赖观察身体症状来进行诊断,但当这些迹象出现时,大脑往往已经遭受了严重的损伤。近年来,科学家们发现,这种疾病不仅会在大脑中留下痕迹,也会在视网膜(即眼睛后部对光敏感的图层)中留下细微的痕迹。利用一种被称为光学相干断层扫描(OCT)的专业成像技术,可以创建眼睛的详细横截面,研究人员现在能够观察到这些微观变化。挑战在于,图像非常复杂,要教会计算机识别健康眼睛与显示出帕金森病早期征兆的眼睛之间的差异,需要海量的数据和巨大的计算能力,而这些资源在医疗环境中往往是稀缺的。
来自中国温州医科大学的一个研究小组开发了一种新方法来解决这个问题,旨在使自动化诊断更加普及且高效。他们并没有从头开始构建一个庞大的计算机模型(因为这需要巨大的数据集和昂贵的硬件),而是改编了一个现有的、用于通用图像识别的强大人工智能系统。这个被称为“视觉基础模型”的系统已经理解了图像的基本构成要素。研究人员的创新之处在于如何将这个通用系统连接到识别帕金森病的特定任务上。他们没有强迫整个系统重新学习所有知识,而是在模型中插入了三个小型、轻量级的组件,即“适配器”(adapters)。这些适配器就像专门的透镜,允许系统专注于与帕金森病相关的眼部扫描细节,例如微小的病变或组织层的细微变化,而无需重写模型的内核知识。
该团队在收集自其医院患者的 1,440 幅眼部图像上测试了这种方法。该数据集包括来自 40 名健康个体和 40 名已确诊帕金森病患者的扫描图像,每人贡献了 18 幅图像。为了确保结果可靠,他们将数据分为若干组,在大多数图像上训练系统并对剩余图像进行测试,并将此过程重复了五次,以获得清晰的性能表现。结果显示,他们改编后的系统识别帕金森病的准确率约为 77.66%。这一表现足以与目前用于类似任务的其他先进计算机模型相媲美,甚至在某些情况下表现更好。至关重要的是,这种新方法在仅调整模型极小比例参数的情况下就达到了这些结果,这使得它比传统方法(需要更新系统的每一个部分)对计算机资源的需求要低得多。
研究人员还将他们的方法与广泛存在的现有深度学习网络进行了对比,其中包括较旧且知名的设计以及较新且更复杂的架构。他们的系统优于许多这些成熟的模型,证明了通过对强大的基础模型进行精心调优的轻量级添加,可以比从头开始训练整个网络更加有效。通过冻结预训练模型的主要部分并仅训练小型适配器,该团队证明了将通用视觉知识转化为高度特定的医疗应用是可能的,且不需要大量的训练数据。这对于像帕金森病这样的医疗状况尤为重要,因为收集成千上万张带标签的图像既困难又昂贵。
为了理解该系统是如何做出决策的,研究人员使用了一种可视化技术,可以突出显示计算机关注的眼部扫描区域。图像显示,他们的模型密切关注与该疾病相关的特定、细微的病变和结构变化,而其他模型有时会关注不太相关的区域。这表明,那三个适配器成功地引导了系统去学习正确的特征。研究结论指出,这种方法为自动化的疾病检测提供了一条充满前景的路径,平衡了高准确度与计算效率。虽然这项工作是一个重要的进步,但研究人员指出,未来的研究需要通过其他医疗中心的数据进行测试,以确认该方法在不同人群和成像条件下是否能保持一致的效果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。