在现代医院静谧的喧嚣中,计算机经常被要求执行一项既需要外科医生稳健的手法,又需要侦探敏锐目光的任务:它必须观察医学影像,并描绘出人体器官的精确轮廓。这个过程被称为图像分割,它是数字版的“在轮廓线内涂色”,但这些线条往往很模糊,形状复杂,且其中的风险极高。多年来,这项工作的标准工具是一种被称为卷积神经网络(CNN)的人工智能。可以将这种系统想象成一名擅长捕捉细微细节(如皮肤纹理或骨骼边缘)的工人,但却难以理解宏观全局,例如肝脏是如何与身体其他部分连接在一起的。近年来,一种基于名为“Transformer”技术的不同类型人工智能出现了。这位新来的工人是观察全局场景并理解长距离关联的大师,但它往往会忽略定义器官精确边界的那些微小而关键的细节。科学家们面临的挑战在于,如何构建一个同时具备这两者最佳特质的系统:既能看到森林,又能数清树木。
来自 Ciphowork GmbH 的一个研究团队通过一种他们称为 CiUNet 的新架构解决了这一难题。他们的工作在包含三十份腹部 CT 扫描图像的数据集上进行了测试,提出了一种将这两种截然不同的方法合并为一个单一、流线型系统的混合方案。他们并没有强迫一种类型的人工智能完成所有工作,而是构建了一个双引擎框架。其中一个引擎是 Transformer,它扫描图像以理解器官的整体布局和上下文;与之并行运行的是第二个引擎——卷积神经网络,它专门负责捕捉 Transformer 可能错过的、高分辨率的纹理和锐利边缘。这两股信息流并非只是简单地堆砌在一起,而是经过了精心的编织。研究人员设计了一种特定的机制,将 CNN 早期阶段的细粒度细节直接馈送到 Transformer 解码器的深层。这确保了当计算机重建最终的器官图像时,不会丢失边界的清晰度。
该方法的成果是在一个名为 Synapse 的严苛标准数据集上进行衡量的,该数据集包含了包括主动脉、胆囊和肾脏在内的八种不同腹部器官的扫描图像。团队发现,他们的混合模型达到了很高的准确度,平均 Dice 系数(mean Dice score)为 83.72%。更重要的是,该系统在定义器官边缘方面表现出色,而这正是手术规划中的关键因素。在衡量预测边界与真实边界偏差程度的测试中,新模型相比以往仅依赖 Transformer 设计的方法有了显著提升。它在处理像肾脏和胆囊这样通常难以定义的器官时表现尤为出色,这表明增加局部细节引擎成功补偿了全局上下文引擎的弱点。
为了确保系统能够有效地学习,研究人员采用了一种模仿人类学习复杂技能的教学策略。他们并没有一次性将整个数据集抛给计算机,而是从较简单的例子开始,最初专注于包含目标器官(特别是胰腺和胆囊)的切片。随着系统掌握了这些内容,训练数据逐渐变得更加复杂,引入了更多的背景噪声和更多样化的解剖结构。这种循序渐进的过程让模型在应对最困难的情况之前,先建立起坚实的基础。此外,研究人员还添加了一层内部监督,在处理过程的中间阶段向系统提供反馈。这起到了引导作用,帮助网络的深层理解其所见内容,并确保最终输出与早期的详细观察保持一致。
这项工作的意义超越了图表上的数字。研究人员强调,他们的设计在实际部署方面具有实用优势,特别是在患者隐私保护方面。由于该系统可以将图像的初始处理与繁重的计算工作分离,医院可以潜在地在小型、安全的设备上本地处理敏感的患者数据,仅将抽象的、不可识别的特征发送到云端服务器进行最终分析。这种解耦实现了一种安全、高效的工作流,在不暴露原始医学图像的情况下保持了高准确度。虽然该模型在处理某些复杂器官(如胃部)时仍面临挑战,其表现尚未完全达到最先进的三维模型的水平,但它代表了向前迈出的重要一步。它证明了通过结合两种不同人工智能哲学的优势,可以创造出一种不仅准确、高效,而且足以应对临床医学严苛环境的、具有可解释性且安全的工具。
CiUNet 技术摘要:一种用于医学图像分割的混合 Swin-CNN UNet
问题陈述
医学图像分割需要在高准确性、鲁棒性和计算效率之间取得平衡,特别是对于对隐私保护要求极高的商业化部署而言。虽然 U-Net 架构长期以来一直是标准架构,但纯卷积神经网络(CNN)由于卷积固有的局部性,在捕捉长程全局依赖关系方面表现乏力。相反,基于 Transformer 的纯架构(如 Swin-UNet)擅长通过自注意力机制建模长程依赖,但存在三个具体局限:由于缺乏卷积归纳偏置,导致局部纹理细节保存不足;由于跨跳跃连接(skip connections)的特征传播不充分,导致空间重建不准确;以及在深度解码器架构中存在可解释性有限和训练不稳定的问题。
方法论
作者提出了 CiUNet,这是一种轻量级的混合 U 型架构,旨在减轻纯 Transformer 设计的缺陷,同时保持 U-Net 范式的效率。其核心方法论包含以下组件:
非对称双编码器框架: 不同于单一的 Swin 编码器,CiUNet 采用了并行架构。
- Swin 分支: 利用 Swin Transformer 编码器(使用 Swin-Tiny 预训练权重初始化)作为全局语义推理的主要骨干。
- CNN 分支: 集成了一个并行的轻量级 ResNet 编码器,用以显式捕捉局部空间细节和高分辨率纹理。
- 冻结策略: 为了利用预训练的视觉先验,两个分支初始层的特征提取模块被冻结,将可训练参数限制在随后的下采样层。
- 动态融合: 一个专门的融合模块整合来自两个分支的特征。它以动态方式运行:如果两个分支都提供特征,则将它们拼接并通过一个轻量级网络进行处理;如果只有一个分支存在,则通过恒等映射进行传播。值得注意的是,瓶颈层(bottleneck layer)完全由 Swin 分支导出,而最浅层(Layer0)则仅由 CNN 分支提供。
XSkip 机制(交叉跳跃): 为了解决语义鸿沟并恢复丢失的空间分辨率,作者使用 XSkip 模块取代了标准的跳跃连接。该机制通过空间注意力将浅层 CNN 特征对齐并传播到深层解码器层。它涉及双线性插值和 1×1 卷积来压缩通道,然后再与深层解码器特征融合,从而确保更清晰的边界描绘。
增强型解码器与注意力: 解码器采用非对称设计以适应双编码器设计。它结合了使用双线性插值的精细上采样操作和一个轻量级的动态权重机制。此外,注意力机制采用了来自 Swin Transformer V2 的 LogSpacedCPB(对数间隔连续位置偏置),用连续回归方法取代了离散坐标索引,以提高在不同输入尺度下的泛化能力。
多级辅助监督: 为了提高训练稳定性和深层特征的可解释性,辅助监督头(Aux-Head) 被附加在中间解码器输出(具体为 Layer1 和 Layer2)上。这些头利用轻量级残差块生成中间层级的分割预测,提供多级梯度引导。由于并行 CNN 分支增强了深层特征的可解释性,这一设计得以实现。
训练策略:
- 课程学习: 采用多阶段策略,逐渐增加训练集的复杂度。早期阶段侧重于包含目标器官(胰腺、胆囊)的切片,后期阶段则纳入背景占主导地位的切片及全数据集分布。
- 损失函数: 优化目标结合了三种几何约束:像素级分类(Focal Loss)、区域级重叠(带有动态边界权重的加权 Dice Loss)以及边界对齐(HausdorffER Loss)。
核心贡献
论文概述了三项主要贡献:
- 非对称双编码器框架: 引入了并行的 ResNet 编码器来补充 Swin Transformer,在处理全局上下文的同时,显式捕捉局部空间细节。
- XSkip 机制: 一种新型的解码器增强方案,通过空间注意力选择性地对齐并传播浅层 CNN 特征,以恢复高分辨率细节并提高边界精度。
- 多级辅助监督: 通过集成辅助头来加速收敛并增强深度 Transformer 解码器的可解释性,充分利用了 CNN 分支提供的语义清晰度。
实验结果
模型在 Synapse 多器官 CT 数据集上进行了评估,该基准数据集包含 30 份具有八个腹部器官标注的增强对比 CT 扫描。
- 性能: CiUNet 实现了 83.72% 的平均 Dice 相似系数 (DSC) 和 12.13 mm 的 95% Hausdorff 距离 (HD95)。
- 对比: 该模型的表现优于原始的 Swin-UNet (79.13% DSC)、TransUNet (77.48%) 和 MISSformer (81.96%)。尽管使用了显著更少的参数(31.68M 可训练参数),它仍能与 Swin-UNETR (83.48%) 等强基准模型相媲美。然而,论文指出,与 nnFormer (86.57% DSC) 和 UNETR++ (87.22% DSC) 等最先进(SOTA)方法相比,CiUNet 的性能仍有提升空间。
- 器官特定性能: CiUNet 在胆囊 (79.47%) 和双肾(左肾: 91.39%, 右肾: 91.27%)上表现出卓越的性能。在胰腺 (59.31%) 和胃 (76.00%) 上的表现被认为在与 3D 模型相比时处于次优水平。
- 消融实验: 实验证实,仅框架升级就将 DSC 提升至 81.40%,XSkip 机制进一步提升了边界精度(HD95 降至 11.26 mm),而辅助监督则将收敛速度加速至最终的峰值性能。
意义与主张
论文将 CiUNet 定位为一种适用于临床部署的准确、高效且具可解释性的解决方案。关于其商业可行性的一个重要主张是,由其固有的编码器-解码器分离所实现的隐私保护 SaaS 模型。作者认为,敏感的患者 CT 图像可以在轻量级编码器层进行本地处理,仅向云端传输高层语义特征向量进行繁重的解码器计算,从而促进安全的医-云协作。
作者承认了其局限性,包括对假阳性的指标偏差、由于缺乏 2D 处理中的层间上下文导致在处理小器官时与 3D 模型相比存在的性能差距,以及使用自然图像预训练骨干(Swin-Tiny 和 ResNet)而非领域特定医学预训练的次优性。论文总结道,尽管 CiUNet 在准确性和效率之间提供了良好的平衡,但未来的工作应解决层间感知和专门的医学预训练策略。
注:出于商业考虑,作者声明仅公开在 Synapse 数据集上训练的权重和轻量级演示预测器,而非完整的实现代码。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。