Full end-to-end diagnostic workflow automation of 3D OCT via foundation model-driven AI for retinal diseases
本文介绍了 FOCUS,这是一个由基础模型驱动的框架,通过将质量评估、异常检测和多疾病分类集成到一个统一的系统中,实现了 3D OCT 视网膜影像端到端诊断工作流的自动化,并在多种临床场景下达到了专家级的准确性和效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类的眼睛是身体的一扇窗户,但要通过这扇窗进行观察,需要稳定的手和受过训练的眼睛。几十年来,医生一直依赖一种名为光学相干断层扫描(OCT)的扫描技术来窥视视网膜——即眼睛后方对光敏感的图层。这台机器会拍摄数千张横截面照片,并将它们堆叠起来,以创建眼部内部结构的详细三维地图。它彻底改变了医生发现糖尿病视网膜病变或黄斑变性等疾病的方式,使他们能够在患者失去视力之前就发现问题。然而,尽管该机器能够捕捉到如此丰富的数据,但将这些图像转化为诊断的过程仍然是一个缓慢且繁琐的手动过程。专家必须首先检查扫描图像是否足够清晰以供使用,然后从数百个单独的切片中筛选出那几个显示异常迹象的切片,最后将这些碎片拼凑在一起,形成患者健康的完整图景。这种劳动密集型的工作流程造成了瓶颈,使得在大规模人群筛查或在专家医生匮乏的地区提供一致的护理变得十分困难。
研究人员长期以来一直试图构建人工智能来协助这项任务,但以往的大多数尝试都像是只懂得做一项小工作的专家团队。一个计算机程序可能擅长识别模糊图像,而另一个则擅长识别单张扫描切片上的特定疾病。这些系统都无法独立处理从原始图像到最终诊断的整个过程。它们经常在面对三维的眼部疾病(即隐藏在切片之间的空间内)时感到吃力,并且在面对现实世界医院中杂乱、多变的实际数据时表现不佳。一项新的研究介绍了一个旨在通过自动化整个流程来改变现状的系统,该系统模仿了人类专家从头到尾思考病例的方式。
由来自中国几家主要医疗中心的研究人员领导的团队开发了一个被称为 FOCUS 的系统。该框架建立在基础模型之上,这是一种经过大量通用视觉数据预训练的人工智能,使其在接触眼部扫描之前就对形状和模式有了广泛的理解。研究人员对这个强大的“大脑”进行了微调,使其能够理解视网膜图像,但真正的创新在于系统的组织方式。FOCUS 不仅仅是逐张查看图片,而是作为一个完整的流程运行。首先,它会自动检查扫描质量,判断图像是否足够清晰且值得信赖。如果图像质量良好,它就会进入下一步:扫描整个眼部体积以检测任何异常情况。最后,它会综合成千上万张切片中的所有信息,为患者做出单一且全面的诊断。
为了测试这种方法是否奏效,研究人员利用来自 3,300 名患者的数据对系统进行了训练,这是一个包含超过 40,000 张单个图像切片的庞大集合。随后,他们将该系统应用于来自四家不同医院的 1,345 名患者的独立组别中,并使用了不同类型的 OCT 机器,以确保它能够应对现实世界的多样性。结果令人瞩目。该系统识别高质量图像的准确率接近 99%。在寻找疾病迹象时,它捕捉异常情况的准确率超过 97%。最重要的是,在进行患者最终诊断时,它的准确率达到了近 94%。即使在针对不同城市和不同医院的数据进行测试时,这些数字依然保持稳定,表明它可以在无需从头开始重新训练的情况下适应新环境。
研究人员还将该 AI 的性能与人类医生进行了对比,以了解其实力如何。在涉及异常检测的测试中,该系统的表现与一组经验丰富的眼科技术人员不相上下,甚至在某些情况下优于他们。在诊断特定疾病时,该系统达到了由九名具有不同经验水平的临床医生组成的专家小组的水平。事实上,该 AI 比人类更具一致性。研究指出,即使是专家医生,在仅观察 OCT 图像时,有时也难以区分某些特定病症,通常需要依赖其他检查或病史才能确定。然而,该 AI 能够识别整个眼部三维体积中人类可能会忽略的细微结构差异,从而实现更统一的决策。
该系统成功的关键部分在于它如何处理眼睛的三维特性。以往的 AI 工具通常将每次切片视为孤立事件,忽略了连接它们的上下文关系。FOCUS 使用了一种方法,允许它动态地衡量每张切片的重要性。它学会了专注于那些包含最强疾病证据的切片,同时忽略那些模糊或无关紧要的切片。这类似于人类专家扫描一叠文件时的做法:快速浏览无聊的页面,只在看到包含关键信息的页面时才停下来仔细阅读。通过智能地汇总这些发现,该系统可以构建可靠的诊断,而无需以计算成本极高的方式处理整个三维体积。
该研究承认,虽然结果令人鼓舞,但该系统尚未成为适用于每个诊所的成熟产品。用于训练和测试该系统的数据主要来自中国的医疗中心,这意味着该系统可能需要进一步验证,以确保它在不同种族背景或不同医疗体系的人群中同样有效。此外,测试是在已知患者患有眼部问题的医院数据上进行的,这与筛查健康普通人群(其中疾病较为罕见)的情景不同。研究人员还指出,当前版本的系统尚不具备生成书面报告或与医生进行对话的能力,未来的版本可能会利用先进的语言工具加入这些功能。
尽管存在这些局限性,这项工作仍代表了医学成像领域的一个重要进步。它超越了执行单一任务的孤立工具时代,证明了统一的系统可以实现复杂的、多步骤的临床工作流自动化。通过成功地架起从原始图像数据到最终患者诊断之间的桥梁,研究人员展示了构建一个模仿人类专家推理过程的 AI 是可能的。这种方法为未来提供了一个蓝图,即通过高效且一致的方式提供高质量的眼科护理,从而潜在地将专家级的筛查带到目前缺乏专业医生资源的社区。该系统并非取代医生,而是消除了阻碍大规模筛查实现的繁琐、重复性的障碍,为自动化、普及化的眼健康新时代铺平了道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。