想象一下,你正试图在地图上描绘一条精致而蜿蜒的河流系统,但墨水很淡,纸张皱巴巴的,而且河流分裂成几乎看不见的小溪流。这基本上就是医生在尝试描绘眼底(视网膜)血管时所面临的状况。这些血管对于诊断眼病至关重要,但由于它们纤细、曲折,且常常与背景融为一体,因此极难追踪。
本文介绍了一种名为Polygon-mamba的新计算机程序,旨在自动解决这一追踪难题。其工作原理可分解为以下简单概念:
1. 旧地图的问题(“网格”问题)
以往的计算机程序试图通过像割草机一样扫描图像来追踪这些血管:严格地左右移动,然后反向移动,再上下移动。
- 类比:想象试图仅用一把只能沿水平或垂直直线移动的尺子来描绘一条弯曲的河流。你会错过弯道,将河流分割成不连续的片段,并无法看到细小的支流。
- 结果:旧方法经常破坏血管的连续性,或者完全遗漏最小的血管。
2. 新策略:“多边形扫描”(“蜘蛛网”方法)
作者创造了一种名为多边形扫描(Polygon Scanning)的新图像扫描方式。程序不再使用僵硬的网格,而是以不断扩展的形状扫描图像,就像蜘蛛织网或石头投入水中激起的涟漪向外扩散。
- 类比:与其在网格中行走,不如想象你站在房间中央,先向外走成一个圆形,然后是六边形,接着是八边形。这样你能自然地覆盖每一个角度和曲线。
- 优势:这种“多边形 Mamba"方法顺应了血管自然蜿蜒的形状。它保持“河流”的连通性,确保即使是最微小、最脆弱的分支也能被检测到,而不会中断线条。
3. “双重视角”(空间与频率)
论文认为,仅以一种方式观察图像是不够的。新模型采用了一种空间 - 频率协同注意力(Space-Frequency Collaborative Attention)机制,这就像用两副不同的眼镜观察同一张图片。
- 空间眼镜:专注于事物的位置及其形状(血管的结构)。
- 频率眼镜:专注于细节和“纹理”(锐利的边缘和精细的线条)。
- 协同作用:模型将这两种视角结合起来。它利用“空间”视角理解大局,利用“频率”视角 sharpen 模糊的边缘并捕捉最微弱的细节。这防止了计算机因背景噪声或杂乱而混淆。
4. 结果:更完善的地图
研究人员在三个标准数据集(视网膜图像集合,相当于该领域的“标准测试”)上测试了这种新的“多边形 Mamba"。
- 结果:与其他顶级计算机模型相比,他们的新方法在发现细小、棘手的血管方面表现更佳。生成的地图更接近人类专家手绘的结果。
- 数据:在所有三项测试中,其在准确性和灵敏度(发现实际存在的血管)方面均取得了更高的分数。
总结
简而言之,作者为眼血管构建了一种更智能的“数字追踪器”。他们不再使用会破坏精细线条的僵化、网格状扫描仪,而是采用了一种灵活、可变形(多边形扫描)的扫描仪,以跟随血管的曲线。他们还赋予了计算机“双重视觉”系统,使其能同时看到大局和微小细节。其结果是一张更准确、更完整的眼血管地图,这是帮助计算机辅助医生诊断眼病的重要一步。
技术摘要:用于视网膜血管分割的 Polygon-mamba
问题陈述
视网膜血管分割是诊断和评估眼部疾病的关键任务。然而,由于多种因素,准确分割细小的视网膜血管仍然是一个重大挑战:
- 低对比度:血管与其周围组织之间的弱对比度使得区分变得困难。
- 复杂的拓扑结构:血管呈现出错综复杂、相互交织的模式,且存在显著的尺度变化。
- 现有模型的局限性:
- CNN:虽然在捕捉局部细节方面表现出色,但往往难以处理长程依赖关系。
- Transformer:在全局语义方面有效,但计算成本高昂。
- 基于 Mamba 的模型:虽然为长程依赖关系提供了线性时间复杂度,但传统 Mamba 架构依赖水平和垂直扫描,可能会损害解剖结构的拓扑完整性。这通常导致细长的微小视网膜毛细血管出现局部不连续和漏检。
- 注意力机制:许多现有方法仅依赖空间注意力,可能会忽略捕捉精细细节和全局相关性所必需的关键频域信息。
方法论
作者提出了Polygon-mamba,这是一种专为解决小血管检测特定挑战而设计的混合 CNN-Mamba 融合网络。该架构将两个新颖模块集成到 UNet 框架中:
1. 多边形扫描视觉状态空间模型 (PS-VSS)
为了克服 Mamba 模型中标准水平/垂直扫描导致的拓扑碎片化问题,作者在视觉状态空间模型 (SS2D) 中引入了多边形扫描策略。
- 机制:模型不再进行线性扫描,而是从中心点开始,沿多边形路径(例如五边形、六边形)向外扩展。
- 多层反向扫描:扫描方向在层与层之间交替(例如第 M 层与第 M+1 层),产生反向扫描效果,系统地覆盖特征图。
- 目标:这种方法保留了像素级的连通性,更好地模拟了视网膜血管的弯曲、分支和纤细的拓扑特征,确保了连续的结构表示。
2. 空频协同注意力机制 (SFCAM)
该模块集成在跳跃连接中,利用了空间域和频域的互补特性。
- 三分支架构:
- 局部分支:提取多尺度特征(使用 1×1、3×3、5×5 卷积),以捕捉粗粒度和细粒度的血管细节。
- 全局分支:利用 PS-VSS 模块捕捉长程依赖关系和全局上下文。
- 小波 Transformer (WT) 分支:使用离散小波变换将特征分解为低频分量(形态、拓扑)和高频分量(边界、小分支、纹理)。
- 双向交叉注意力融合 (BCFM):该子模块对齐空间特征与频域特征之间的语义差异。它采用查询交换策略构建双向交叉注意力,使模型能够动态选择并融合来自局部/高频分支和全局/低频分支的特征。
- 目标:自适应地增强显著的血管特征,同时抑制杂乱信息,有效地恢复细小血管和边缘轮廓。
主要贡献
本文概述了四项主要贡献:
- Polygon-mamba 模型:一种专为准确检测细小视网膜血管而设计的新颖分割框架,显著提高了分割精度。
- PS-VSS 模块:一种创新扫描技术,利用多边形路径高效提取语义信息并捕捉全局特征,解决了传统 Mamba 扫描的连续性问题。
- SFCAM 模块:一种从空间和频域提取高效特征的机制,使模型能够突出目标物体并抑制噪声。
- 集成 UNet 方案:成功将 PS-VSS 和 SFCAM 集成到 UNet 架构中,生成了一种高效的分割方案,在平衡全局建模与局部细节保留方面表现出色。
实验结果
该模型在三个公共数据集上进行了评估:DRIVE、STARE和CHASE DB1。
定量性能
所提出的方法在关键指标上优于最先进模型(包括 Mamba-UNet、FSE-Mamba、Rolling-UNet 和 KM-UNet):
- DRIVE:F1 分数:0.8288,AUC:0.9808,灵敏度 (SE):0.8356。
- STARE:F1 分数:0.8282,AUC:0.9840,SE:0.8314。
- CHASE DB1:F1 分数:0.8251,AUC:0.9866,SE:0.8484。
值得注意的是,该模型在所有数据集上均取得了最高的 SE 值,表明其在检测阳性样本(血管)方面具有卓越的能力,特别是针对细小和微弱的血管。虽然在某些情况下特异性 (SP) 略低于一些竞争对手,但作者将此归因于模型对细微血管的高度敏感性,这可能会增加背景误分类,但显著提高了召回率。
消融与对比研究
- 模块有效性:消融研究证实,按顺序添加 PS-VSS 和 SFCAM 提高了所有数据集上的 IOU、F1 和 SE。例如,在 CHASE DB1 上,与基线加上 PS-VSS 相比,SFCAM 使 SE 提高了 9.45%。
- 扫描策略:比较不同多边形形状(三角形、四边形、五边形、六边形、八边形)的实验表明,五边形扫描方法在 DRIVE 和 CHASE DB1 上取得了最佳整体性能,而六边形在 STARE 上表现良好。五边形策略被选为最终模型的最佳选择。
- 复杂度:该模型拥有 68.32M 参数和 2.53G FLOPs。虽然高于某些轻量级模型,但比 MCDAU-Net 和 MDF-Net 等高复杂度方法显著更高效,在性能和计算成本之间实现了有利的权衡。
意义与主张
作者声称,Polygon-mamba 通过直接解决标准 Mamba 架构中固有的拓扑不连续性,代表了视网膜血管分割领域的重大进步。
- 拓扑完整性:通过利用多边形扫描,该模型成功保持了复杂血管结构的连续性,这是以往基于 Mamba 的方法常见的失败点。
- 双域特征提取:空频注意力的集成使模型能够捕捉全局结构上下文和细粒度的局部细节(边缘、小分支),而这些细节通常在仅基于空间的方法中丢失。
- 小血管检测:主要意义在于该模型能够以高灵敏度检测细小、低对比度的血管,在视觉检查和定量指标方面均优于现有方法。
本文结论指出,虽然该模型实现了卓越的性能,但未来的工作将专注于提高特异性(噪声抑制),并探索传统模式识别方法,以在不损害小血管检测的前提下进一步优化噪声处理。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。