← 最新论文
💻 computer science

Modality-Invariant Coarse-to-Fine Retinal Image Registration

本文提出了一种通用的两阶段、模态不变型视网膜图像配准框架,该框架结合了用于粗略全局对齐的血管驱动稀疏特征匹配模型,以及用于局部密集精细化的模态不变光流网络(MI-RAFT),在多种成像组合上的表现优于现有的模态依赖型方法。

原作者: Bo Wen, Nehal Nailesh Mehta, Melanie Tran, Dirk-Uwe Bartsch, William Freeman, Truong Nguyen

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Wen, Nehal Nailesh Mehta, Melanie Tran, Dirk-Uwe Bartsch, William Freeman, Truong Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在眼科领域,医生依赖于一系列不同的照相机来观察视网膜内部——即眼睛后方具有光敏性的图层。有些照相机使用标准彩色摄影,有些则使用红外光,还有些通过捕捉眼睛对特定波长的反应来揭示疾病。每种成像方法都会产生独特的视角,就像透过不同颜色的眼镜观察同一片风景。为了诊断糖尿病或黄斑变性等疾病,医生通常需要将这些不同的视图并排对比,甚至进行叠加,以观察特定的血管或病灶在所有视图中呈现出的样子。然而,由于照相机各不相同,且眼睛在拍摄之间会发生轻微移动,这些图像很难自动完美对齐。对齐是一个困难的谜题,直到现在,旨在解决这一问题的计算机程序只能针对一种特定的相机类型对进行构建。如果医生想要匹配一张彩色照片和一张红外图像,他们需要一种专门的工具;如果要匹配一张彩色照片与另一种类型的扫描图像,他们则需要完全不同的工具。这种缺乏通用解决方案的情况,使得整合现代眼科检查中各种多样化信息变得十分困难。

一组研究人员现在开发出一种新方法,它充当了这些视网膜图像的“通用翻译官”,能够对任何组合的常见眼部扫描图像进行对齐,而无需针对每一对新图像进行重新训练。他们的方法分为两个截然不同的阶段,从初步的粗略猜测过渡到精确的拟合。首先,为了让图像大致处于正确的位置,该系统忽略了不同照相机之间在颜色和纹理上的混淆差异。相反,它将每张图像转换为一张简单的眼部血管图谱。因为无论哪种照相机拍摄,静脉和动脉的网络看起来都是一样的,这种共享的图谱使计算机即使在处理人类肉眼看来完全不同的图像时,也能快速且准确地找到匹配点。这一步提供了稳固的全局对齐,将两张图片带入同一个参考框架中。

一旦图像完成了粗略对齐,系统就会进入第二阶段,以修复残余的细微局部畸变。这正是研究人员引入名为 MI-RAFT 的新模型的地方。与那些在图像风格变化时表现挣扎的旧工具不同,该模型学会了寻找任何两份视网膜扫描图像之间精确到像素级的连接。它通过结合两种类型的信息来实现这一点:一种是理解图像通常如何移动和变形的信息,另一种是识别在不同照相机下保持不变的独特眼部结构模式的信息。为了在不需要成千上上万个完美的真实世界匹配示例(这类样本极难收集)的情况下训练该模型,研究人员创建了一种巧妙的训练方法。他们对单张眼部图像进行了数学上的扭曲处理,以模拟如果从略微不同的角度或在不同光照条件下拍摄时图像会呈现的样子。这使得计算机能够利用合成数据学习对齐规则,从而有效地教会它处理从未见过的现实世界变化。

这项工作的成果表明,新的系统比目前最先进的方法更准确,而现有的先进方法通常仅限于特定的相机组合。研究人员在四个不同的数据集上测试了他们的方法,其中包括他们专门为本研究收集的一组新的配对图像,涵盖了彩色照片、红外扫描和自发荧光图像的各种组合。在每一次测试中,这种新方法都成功实现了高精度的图像对齐,其表现优于那些针对特定配对进行过微调的专门工具。该系统足以应对各种照相机捕捉眼部图像时的自然差异,包括焦距的轻微偏移或对比度的变化。虽然该方法在图像覆盖相似眼部区域时效果最佳,但它代表了在创建灵活、通用型眼科工具方面迈出的重要一步。通过消除为每种相机组合都需要一套不同软件解决方案的需求,这项工作为实现多模态数据的无缝整合铺平了道路,有助于临床医生看到更清晰、更完整的视网膜健康全景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →