想象一下,你正在试图识别一块复杂三维织物上的特定污渍。为了清晰地看到污渍,你可能需要从上方(轴位视图)和侧面(矢状位视图)进行观察。有时,污渍从上方看很明显,但从侧面看却隐藏不见,反之亦然。
在医学领域,医生利用磁共振成像(MRI)扫描来寻找脑出血(出血)。然而,这些扫描颇具挑战性。它们具有不同的“方位”(例如从上方或侧面观察大脑),有时,针对特定患者,医生可能只有上方视图或只有侧面视图。
旧方法:将方钉强行塞入圆孔
传统上,分析这些图像的计算机程序(人工智能)非常挑剔。它们通常要求每张图片都被展平并调整大小,使其看起来完全一致,就像将一个三维物体挤压成一张扁平的二维照片一样。
- 问题所在: 如果你将侧面视图的 MRI 强行调整为看起来像顶部视图的 MRI,你就必须拉伸或挤压像素。论文将这种操作称为“重采样”。这就像试图通过将高而细的花瓶砸扁来将其塞进一个矮而宽的盒子里。你会丢失重要的细节,而人工智能可能会因为图像失真而错过出血点。
新方案:MP-ViT(多平面视觉 Transformer)
本文的作者构建了一个名为MP-ViT的新人工智能模型。可以将该模型想象成两名专家侦探组成的团队,而不是由一名侦探独自完成所有工作。
两只专门的“眼睛”: 不是强行改变图像的形状,MP-ViT 拥有两个独立的“大脑”(编码器)。
- 一个大脑是观察轴位(自上而下)切片的专家。
- 另一个大脑是观察矢状位(侧面视图)切片的专家。
- 它们按照图像原本的样子进行观察,不进行挤压或拉伸。没有任何信息丢失。
“握手”(交叉注意力): 在每位侦探完成自己的分析后,他们不会只是大声喊出结论。他们会召开一个名为“交叉注意力”的特别会议。
- 轴位专家说:“我在这里看到了一些可疑之处。”
- 矢状位专家说:“哦,从侧面看同一个位置,我可以确认这一点。”
- 他们结合各自的笔记,做出比单独行动时更明智、更自信的决定。
“缺失部分”线索(模态向量): 有时,患者的扫描是不完整的。也许他们有顶部视图但忘记了侧面视图,或者缺少某种特定类型的造影剂。
- 为了处理这种情况,该模型使用一种特殊的“身份证”(模态指示向量)。这就像模型手中持有的一份清单:“我们有顶部视图(已勾选),但没有侧面视图(空白)。”
- 这告诉人工智能:“嘿,你缺少拼图的一块,所以别惊慌。只需利用你现有的部分,并相应地调整你的思路。”这使得模型即使在数据混乱或不完整的情况下也非常稳健。
结果:谁赢得了比赛?
研究人员使用超过 12,000 名患者的庞大数据集,将这支新团队(MP-ViT)与旧的单脑模型(如标准视觉 Transformer 和 CNN)进行了测试。
- 得分: MP-ViT 赢得了比赛。在发现出血方面,它显著优于其他模型。
- 数据: 与标准视觉 Transformer 相比,其准确率(以称为 AUC 的分数衡量)提高了约5.5%;与最佳传统人工智能模型相比,提高了1.8%。
- 证明: 即使研究人员移除了“缺失部分线索”(模态向量),该模型的表现仍然不错,但添加该线索使其表现更好。这证明了该模型足够聪明,能够处理现实世界的混乱情况。
为何这很重要(根据论文)
论文强调,这种方法至关重要,因为现实世界医院中的数据很少是完美的。不同制造商的扫描仪会产生不同形状和大小的图像,医生也常以不同的方位扫描患者。
通过让人工智能以其自然的“形状”(顶部或侧面)观察图像,并让这些视图相互交流,MP-ViT 避免了“砸碎花瓶”的问题。它保留了所有关键细节,从而成为一种更可靠的脑出血检测工具,特别是在数据以各种形式出现或缺少部分信息时。
简而言之:
本文介绍了一种更聪明的人工智能,它不强迫医学图像改变形状。相反,它利用两只专门的“眼睛”同时观察不同角度,并利用特殊的“清单”来处理缺失数据,从而提供了一种更准确的方法来发现脑出血。
技术摘要:用于出血分类的多平面 Vision Transformer
问题陈述
通过磁共振成像(MRI)识别颅内出血(ICH)对于诊断至关重要,特别是对于区分急性和慢性状况,以及避免与 CT 相关的电离辐射暴露。然而,临床 MRI 采集通常给深度学习模型带来重大挑战:
- 各向异性与多平面数据:为了加快成像速度,扫描通常以厚层采集,导致各向异性体积数据。临床医生经常利用多个平面(轴位、矢状位、冠状位)来全面可视化解剖结构,因为某些出血在特定取向上更为明显。
- 重采样中的信息丢失:传统的深度学习方法(CNN 和标准 Vision Transformer)通常需要将输入图像重采样为固定的各向同性平面(例如,将矢状位转换为轴位)。此过程涉及大量的下采样或上采样,导致显著的信息丢失和潜在的插值伪影。
- 模态不一致性:现实世界的临床数据集往往存在对比信息缺失的问题(例如,患者可能有轴位 T2 FLAIR 但缺乏矢状位 T1),标准模型在处理此类情况时往往会导致性能下降。
方法论
作者提出了多平面 Vision Transformer(MP-ViT),这是一种新颖的架构,旨在同时处理轴位和矢状位 MRI 数据,而无需重采样或改变图像方向。该架构基于 Vision Transformer(ViT)框架,由四个主要模块组成:
双分支编码器:模型采用两个独立的 Transformer 编码器:一个专用于轴位输入,另一个专用于矢状位输入。
- 输入图像被调整为固定的各向异性尺寸(例如,轴位为 256×256×32,矢状位为 256×32×256),而不是被强制转换为共同的各向同性网格。
- 图像被划分为不重叠的 3D 补丁(16×16×16),进行标记化,并由各自的编码器处理。
- 该设计将轴位和矢状位图像视为不同的模态,保留了每个平面的原生分辨率和空间关系。
交叉注意力融合:为了整合两个分支之间的信息,模型利用交叉注意力机制。具体而言,来自轴位编码器的分类(CLS)令牌会关注矢状位编码器的补丁令牌(反之亦然)。这使得模型能够比标准的全注意力融合更高效地在平面之间交换抽象信息。
模态指示向量:为了解决对比缺失的问题(例如,缺失的矢状位 T1 或特定的轴位序列),作者引入了模态指示向量。
- 这是一个二进制向量,表示每个分支可用的特定对比的存在(1)或不存在(0)。
- 多层感知机(MLP)将该向量嵌入为查询向量,随后与 Transformer 输出执行交叉注意力。这引导模型补偿缺失数据,增强其在异质临床环境中的鲁棒性。
分类头:最终输出源自两个分类头的平均值,每个分支一个,提供最终的出血分类。
主要贡献
- 方向无关的处理:MP-ViT 消除了将各向异性图像重采样到固定平面的需求,从而避免了与传统插值方法相关的信息丢失和失真。
- 跨平面整合:通过在独立的轴位和矢状位编码器之间利用交叉注意力,该模型有效地融合了多平面信息,而无需强制单一方向的架构约束。
- 对缺失数据的鲁棒性:引入模态指示向量使模型能够适应不完整的输入数据(缺失对比),而无需进行插补或数据增强,这是回顾性临床数据集中常见的挑战。
实验结果
该模型在一个现实世界的临床数据集上进行了评估,该数据集包含来自三家扫描仪制造商(GE、飞利浦、西门子)的 10,084 名训练受试者、1,289 名验证受试者和 1,496 名测试受试者。数据集包含多种对比(FLAIR、ADC、Trace、GRE、SWI、T2w 和矢状位 T1w)。
- 性能:MP-ViT-base 变体实现了 0.854 的曲线下面积(AUC)。
- 比较:该结果优于:
- 标准 Vision Transformer(ViT-base)5.5%(AUC 0.799)。
- ResNet152 3.7%(AUC 0.817)。
- DenseNet201 1.8%(AUC 0.836)。
- 其他基于 Transformer 的方法(多阶段 Transformer 和 Adel 等人的 ICH 分类器)分别为 4.6% 和 3.2%。
- 统计显著性:McNemar 检验证实,MP-ViT 相对于 ViT、ResNet、DenseNet 和其他 Transformer 基线的改进具有统计显著性(p<0.05)。
- 消融研究:移除模态指示向量导致性能下降(AUC 从 0.854 降至 0.842),证实了该向量在处理缺失对比方面的作用。
- 效率:值得注意的是,参数少于 ViT-base 的 MP-ViT-small 比 ViT-base 高出 1.5%,表明多平面架构比单纯增加模型深度或宽度更有效。
意义与主张
该论文声称,MP-ViT 在处理现实世界临床 MRI 数据的变异性方面取得了显著进展。通过避免对各向异性图像进行重采样,该模型保留了原本可能丢失的关键诊断信息。作者强调,虽然 MRI 并非紧急 ICH 检测的首选(由于扫描时间),但它对于卒中鉴别诊断以及在非紧急诊断检查中发现偶发出血至关重要。
所提出的方法被提出作为一种机制,用于提高需要不同方向对比的场景中的分类性能。作者指出,该方法在数据完整性各异的临床环境中尤为相关,因为模态向量确保了模型即使在输入不完整的情况下也能保持鲁棒性。研究结论认为,这些机制应被考虑用于处理临床数据固有变异性的系统设计,尽管作者承认存在局限性,包括排除了冠状位平面(由于数据集不可用)以及侧重于分类而非分割。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。