UWF-FM: A Foundation Model for Comprehensive Ultra-Widefield Retinal Assessment
UWF-FM 是一个新颖的自监督基础模型,在超过 630,000 幅无标签超广角视网膜图像上进行了预训练,在多种临床任务和设备上均优于现有的非 UWF 模型,展示了强大的泛化能力,并成功实现向现实世界的部署,以在不干扰工作流程的情况下增强临床医生的诊断敏感性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你的眼睛就像一台照相机,但它不仅仅是捕捉场景中心的快照,而是能看到整个景观,从地平线到边缘。几十年来,医生一直使用一种特殊的眼底照相技术(称为“眼底摄影”)来检查疾病,但这就像是在拍自拍:它只显示视网膜的中间部分,忽略了边缘发生的关键情况。随后,“超广角”(UWF)成像技术出现了,这就像升级到了全景镜头,可以一次性捕捉到眼睛整个“后院”的景象。这是一个游戏规则的改变者,因为许多眼科问题(如撕裂或肿瘤)往往就隐藏在那些遥远的角落里。然而,教计算机去理解这些巨大的、复杂的全景照片是非常困难的。这就像试图教一只狗去识别一整片森林,而不是仅仅识别一棵树;计算机会被所有新的细节搞得晕头转向。这就是“基础模型”(Foundation Models)发挥作用的地方。把这些模型想象成超级聪明的 AI 学生,它们在参加任何考试之前,已经阅读了数百万本书(图像)。通常情况下,这些学生只读过关于“森林中心”的书,所以当他们拿到一张全景照片时,就会感到力不从心。科学家们一直在问一个大问题:我们能否专门针对这些巨大的全景眼底照片来训练一个超级聪明的 AI,使其成为能够发现眼中任何异常情况的真正专家?
于是,UWF-FM 诞生了——这是一种专门为掌握这些超广角视网膜图像而设计的全新 AI 基础模型。由利物浦大学及其全球合作伙伴组成的科研团队决定,不再试图强行让旧的 AI 模型去适应这些新的宽视角照片,而是从零开始构建一个全新的“学生”。他们向这个 AI 输入了一个庞大的库,其中包含 632,627 张未经标记的全景眼底图像。这个 AI 不仅仅是在观察它们,它还利用了一种叫做“自监督学习”的技术进行研究,这就像一个学生试图通过观察拼图碎片并猜测它们如何组合在一起,而在没有老师告诉答案的情况下解决谜题。通过这种方式,AI 学习了整个视网膜从中心到极边缘的深层隐藏模式。
一旦这个 AI “训练”完成,研究人员就对其进行了测试,以观察它是否真的比旧模型更聪明。他们不仅要求它寻找单一目标,还要求它胜任一整套“职位描述”。他们在 27,641 个带有标签的“图像-任务”对上对其进行了测试,看它是否能做到以下几点:
- 诊断疾病: 识别包括肿瘤在内的 12 种不同的眼疾。
- 评估严重程度: 根据 1 到 5 级的标准检查糖尿病视网膜病变的严重程度。
- 寻找特定线索: 识别 28 种不同类型的视网膜发现(如微小的出血或撕裂),无论它们是在中心还是在远端角落。
结果令人印象深刻。新的 UWF-FM 模型表现始终优于那些基于标准、非广角照片训练的旧 AI 模型。这就像请来了一位熟悉整片森林的当地向导,而不是仅了解主路的游客。新模型取得了很高的分数(肿瘤检测的 AUC 约为 0.90,通用疾病诊断的 AUC 约为 0.94),证明它理解的是全局,而不仅仅是中间部分。
但研究人员并没有止步于此。他们想知道这个 AI 是否只是一个“只会一招”的模型,只能在它学习过的特定相机上工作。他们测试了来自不同医院甚至不同品牌相机(从 Optos 相机切换到 Zeiss 相机)的图像。即使没有额外的训练或“微调”来适应这些新相机,该 AI 的表现仍然优于旧模型。这表明,该 AI 学习的是视网膜本身的“语言”,而不仅仅是记住了特定相机的外观。
为了观察这个 AI 是否能真正帮助医生,他们开展了一项针对 四名眼科医生 的特别研究。他们向医生展示了 600 张全景眼底图像两次:一次是单独展示,另一次是在 AI 辅助下展示。AI 并不做决定,它只是向医生“低声耳语”它的“猜测”。当医生在 AI 的帮助下工作时,他们变得更擅长发现疾病(提高了敏感度),同时并没有增加太多错误(特异度仅有极微小的下降)。这就像拥有了一个观察力极强的助手,在医生可能忽略的地方(尤其是那些棘手的角落)指点迷津。有了这种帮助,医生(尤其是经验较少的医生)的工作水平得到了提升。
最后,团队测试了该 AI 是否能在真实的医院环境中运行而不造成混乱。他们在厦门眼科中心进行了一次“静默部署”。在两个月内,针对 37,665 份连续的眼科检查,AI 在后台运行并分析每一张图像。它没有干扰医生,没有改变工作流程,在测试期间甚至没有向任何人展示其结果。它以 100% 的成功率 处理了每一张图像,每份检查仅耗时约 1.1 秒。这证明了这种强大的 AI 可以无缝集成到繁忙的医院中,而不会破坏现有流程。
简而言之,这篇论文表明,通过专门针对广阔的视网膜全景视野进行训练,我们可以创造出一种鲁棒的工具,它能理解整个眼睛,适用于不同的医院和相机,帮助医生发现更多疾病,并能无缝融入现实世界的医疗工作流。这是迈向未来的一步——在未来,AI 将作为医生可靠的全景视觉伙伴,确保视网膜的任何部分都不会处于黑暗之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。