在眼科领域,医生依赖于一系列不同的照相机来观察视网膜内部——即眼睛后方具有光敏性的图层。有些照相机使用标准彩色摄影,有些则使用红外光,还有些通过捕捉眼睛对特定波长的反应来揭示疾病。每种成像方法都会产生独特的视角,就像透过不同颜色的眼镜观察同一片风景。为了诊断糖尿病或黄斑变性等疾病,医生通常需要将这些不同的视图并排对比,甚至进行叠加,以观察特定的血管或病灶在所有视图中呈现出的样子。然而,由于照相机各不相同,且眼睛在拍摄之间会发生轻微移动,这些图像很难自动完美对齐。对齐是一个困难的谜题,直到现在,旨在解决这一问题的计算机程序只能针对一种特定的相机类型对进行构建。如果医生想要匹配一张彩色照片和一张红外图像,他们需要一种专门的工具;如果要匹配一张彩色照片与另一种类型的扫描图像,他们则需要完全不同的工具。这种缺乏通用解决方案的情况,使得整合现代眼科检查中各种多样化信息变得十分困难。
一组研究人员现在开发出一种新方法,它充当了这些视网膜图像的“通用翻译官”,能够对任何组合的常见眼部扫描图像进行对齐,而无需针对每一对新图像进行重新训练。他们的方法分为两个截然不同的阶段,从初步的粗略猜测过渡到精确的拟合。首先,为了让图像大致处于正确的位置,该系统忽略了不同照相机之间在颜色和纹理上的混淆差异。相反,它将每张图像转换为一张简单的眼部血管图谱。因为无论哪种照相机拍摄,静脉和动脉的网络看起来都是一样的,这种共享的图谱使计算机即使在处理人类肉眼看来完全不同的图像时,也能快速且准确地找到匹配点。这一步提供了稳固的全局对齐,将两张图片带入同一个参考框架中。
一旦图像完成了粗略对齐,系统就会进入第二阶段,以修复残余的细微局部畸变。这正是研究人员引入名为 MI-RAFT 的新模型的地方。与那些在图像风格变化时表现挣扎的旧工具不同,该模型学会了寻找任何两份视网膜扫描图像之间精确到像素级的连接。它通过结合两种类型的信息来实现这一点:一种是理解图像通常如何移动和变形的信息,另一种是识别在不同照相机下保持不变的独特眼部结构模式的信息。为了在不需要成千上上万个完美的真实世界匹配示例(这类样本极难收集)的情况下训练该模型,研究人员创建了一种巧妙的训练方法。他们对单张眼部图像进行了数学上的扭曲处理,以模拟如果从略微不同的角度或在不同光照条件下拍摄时图像会呈现的样子。这使得计算机能够利用合成数据学习对齐规则,从而有效地教会它处理从未见过的现实世界变化。
这项工作的成果表明,新的系统比目前最先进的方法更准确,而现有的先进方法通常仅限于特定的相机组合。研究人员在四个不同的数据集上测试了他们的方法,其中包括他们专门为本研究收集的一组新的配对图像,涵盖了彩色照片、红外扫描和自发荧光图像的各种组合。在每一次测试中,这种新方法都成功实现了高精度的图像对齐,其表现优于那些针对特定配对进行过微调的专门工具。该系统足以应对各种照相机捕捉眼部图像时的自然差异,包括焦距的轻微偏移或对比度的变化。虽然该方法在图像覆盖相似眼部区域时效果最佳,但它代表了在创建灵活、通用型眼科工具方面迈出的重要一步。通过消除为每种相机组合都需要一套不同软件解决方案的需求,这项工作为实现多模态数据的无缝整合铺平了道路,有助于临床医生看到更清晰、更完整的视网膜健康全景。
技术摘要:模态不变性的由粗到精视网膜图像配准
1. 问题陈述
视网膜图像配准对于眼科诊断、纵向疾病监测以及多模态分析至关重要。然而,现有的配准方法主要具有模态依赖性。它们通常针对单一成像模态(单模态)或固定的模态对(跨模态)进行优化。这种依赖性限制了它们在实际场景中的灵活性,因为在这些场景中,必须在无需针对每种特定模态对进行重新训练或微调的情况下,实现多种视网膜成像模态(如彩色眼底图、红外、荧光造影、多色 SLO、眼底自发荧光)的对齐。
此外,准确的配准需要一种由粗到精(coarse-to-fine)的方法:通过稀疏特征进行全局对齐是不够的,精确的局部对齐需要稠密光流。虽然存在两阶段流水线,但一个能在粗略(全局)和精细(局部)阶段都实现模态不变性的统一框架仍有待探索。此外,获取真实的跨模态视网膜对的稠密地面真值(ground-truth)流非常困难,这阻碍了监督式稠密配准模型的训练。
2. 方法论
作者提出了一个通用的两阶段框架:模态不变性的由粗到精视网膜图像配准。
第一阶段:模态不变性的粗略(全局)对齐
为了在任意模态之间实现鲁棒的全局对齐,作者引入了一个**通用视网膜血管分割模型(URVSM)**作为领域适配器。
- 领域适配: URVSM 不直接匹配来自不同模态的原始图像,而是处理源图像和目标图像以生成统一的血管分割图。这通过将多样化的模态转化为共享的、模态无关的表示,实现了领域转换。
- 稀疏特征匹配: 将标准的基于稀疏特征的配准流水线(关键点检测、描述符提取和离群点剔除)应用于这些血管图。
- 泛化性: 一个在特定模态对(彩色眼底图和红外)上训练的单一网络,被用于检测并匹配源自任何模态的血管图上的关键点。离群点剔除网络保持冻结(预训练)状态,因为它是在坐标而非图像外观上进行操作。
- 输出: 通过加权最小二乘法估计仿射变换矩阵,从而将源图像全局对齐到目标图像。
第二阶段:模态不变性的精细(局部)对齐
为了细化对齐,作者提出了 MI-RAFT(模态不变性循环全对场变换),这是一种光流估计网络。
- 架构: MI-RAFT 扩展了 RAFT 架构,除了标准的流优化特征外,还整合了来自预训练、模态不变视觉模型(具体为 DINOv3 和 基于扩散的特征/DIFT)的特征。
- 特征融合: 模型学习如何精炼并融合流特定特征与模态不变特征。这些融合后的特征被用于构建用于迭代流估计的全对相关体积(all-pairs correlation volume)。
- 训练策略(合成对): 由于缺乏具有稠密地面真值流的真实跨模态对,模型在合成生成的对上进行训练。
- 几何合成(GS): 通过对单张视网膜图像进行随机仿射变换和非线性位移场变换,创建具有已知地面真值流的源-目标对。
- 强度合成(IS): 为了模拟模态差异,合成对会经历独立的随机强度增强、低频照明扰动以及聚焦/分辨率扰动。这鼓励模型依赖结构几何而非外观。
- 相关查找特征对齐(CLFA): 一种新颖的训练策略,其中从同一图像生成两个具有相同几何结构但具有不同强度变换的合成对。模型被训练以确保这两个对之间的相关查找特征(从相关金字塔中检索到的局部匹配证据)是一致的,从而在不直接约束融合描述符的情况下进一步增强模态不变性。
- 损失函数: 总损失结合了流估计损失、平滑损失和 CLFA 损失。
3. 核心贡献
- 首个统一框架: 本文提出了第一个在粗略(全局)和精细(局部)对齐阶段均实现模态不变性的视网膜图像配准框架。
- 通用领域适配器: 本文证明了通用视网膜血管分割模型(URVSM)可以有效地作为模态不变的领域适配器,使单一的稀疏特征模型能够泛化到多种不同的模态组合。
- MI-RAFT 模型: 引入了一种新型的光流架构 MI-RAFT 用于精细配准,其特点是具有融合预训练视觉特征的新设计,以及带有 CLFA 的合成双对训练策略。
- 新数据集: 作者收集并发布了一个新的配对的眼底自发荧光(FAF)和多色(MC)图像数据集,以解决这些模态缺乏配准数据的问题。
- 卓越性能: 该方法在多个单模态和跨模态数据集上实现了最先进的性能,且无需针对特定数据集进行微调。
4. 实验结果
该框架在四个数据集上进行了评估:FIRE (CF-CF)、CF-IR、CF-FA 以及新收集的 FAF-MC。
- 粗略对齐: 所提出的 URVSM 驱动的方法在所有数据集上均优于最先进的稀疏对应方法(如 SuperPoint、SuperGlue、SuperRetina)和模态不变基准方法(MIF-Net、MINIMA)。它实现了最高的平均 Dice 分数,特别是在具有挑战性的跨模态场景(如 CF-FA 和 FAF-MC)中。
- 精细对齐: MI-RAFT(使用 DINOv3 特征)显著优于包括通用 RAFT、CrossRAFT、MCM-RAFT 以及视网膜专用方法 GAMorph 在内的微调基准模型。它在所有数据集上均获得了最高的 Dice 和 soft-Dice 分数。
- 消融研究:
- CLFA 策略和强度扰动(照明/聚焦)一致地提升了性能。
埋入特征 之前 进行相关计算比在相关体积或相关查找特征层面进行融合更为有效且计算效率更高。
- 预训练的离群点剔除网络被证明在无需进一步微调的情况下已足够。
- 鲁棒性: 该方法在未见的模态组合(如 FAF-MC)中表现出强大的泛化能力,而其他方法在这些组合中表现较差或失效。
5. 意义与主张
作者声称这项工作提供了一个可泛化的基础,用于多模态视网膜图像分析。通过消除对每个模态对都需要单独模型或微调的需求,所提出的框架解决了临床和研究设置中对灵活解决方案的现实需求。
- 实用性: 使用单一模型处理多样化的单模态和跨模态组合的能力,反映了真实世界眼科成像的复杂性。
- 数据效率: 合成训练策略使得在没有收集大规模带有地面真值流的配对数据集的苛刻条件下,进行监督学习成为可能。
- 适用范围: 作者明确指出,当前框架是为具有**相似视野(30–45°)**的视网膜图像设计的。它目前尚未解决极端视野差异(例如 135° 超广角与 30° 眼底图)的问题,这仍是未来的挑战。
论文总结道,通过降低对配对训练数据和特定模态模型的依赖,该方法促进了多模态信息的更高效共定位、纵向疾病监测以及其他视网膜图像分析应用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。