✨ 要点🔬 技术摘要
想象一下,你是一名正试图在一个巨大的三维拼图盒中破解谜题的侦探。这个盒子装的不是玩具,而是一张由成千上万个被称为 CT 切片的微小切片组成的数字化人体胸部地图。多年来,医生一直利用这些扫描图像来发现问题,比如隐藏在肺部的病毒。但手动查看每一个切片是一项极其耗费精力的工作,尤其是当这种“谜题”是那种会让医院不堪重负的快速传播病毒时。为了提供帮助,科学家们构建了被称为“人工智能”(AI)的“计算机侦探”。这些 AI 侦探通常使用两种主要工具:一种擅长发现细小的局部线索(就像放大镜);另一种擅长同时观察全局(就像从高空飞行的无人机)。大的疑问在于:我们能否教会计算机同时使用这两种工具,从而比以前更快、更准确地发现病毒?
这篇论文介绍了一种专门为破解胸部 CT 扫描中新冠肺炎(COVID-19)之谜而设计的全新类型计算机侦探。作者们——来自日本的研究团队——构建了一个“混合”模型——这是两种不同类型 AI 大脑的联手协作。第一部分是一个 3D CNN (卷积神经网络),它充当一个超聚焦的显微镜。它扫描肺部的 3D 体积,以寻找细小的局部细节,例如在病毒攻击时经常出现的微小云雾状区域或“磨玻璃影”。第二部分是一个 3D MLP-Mixer ,这是一种新型 AI,它扮演着“全能拼图解谜者”的角色。它不仅仅观察某一个点,而是将显微镜发现的所有线索进行整合与混合,从而理解整个肺部的“大局”。
研究人员在收集自日本各医院的 1,205 个胸部 CT 体积数据集上测试了这个新的混合团队。他们对数据进行了划分,使用 80% 的数据来训练 AI,并使用 20% 的数据来测试其技能。当这个混合模型接受测试时,它以 79.5% 的准确率正确识别了患者患有高风险或低风险新冠肺炎的可能性。为了验证这种新的联手协作是否真的比旧方法更好,作者将其与一个仅使用“显微镜”(3D CNN)后接简单层的标准模型进行了对比。那个旧模型仅达到了 74.8% 的准确率。结果表明,添加“拼图解谜者”(3D MLP-Mixer)确实有助于计算机比仅使用显微镜更好地理解病毒性肺炎的复杂模式。然而,作者指出,虽然这是一个稳步的进步,但准确率尚未达到完美,在将此工具常规用于现实世界的诊所之前,还需要更多的工作——例如使用更多的数据和不同的训练技巧。
技术摘要:基于 3D CNN 与 3D MLP-Mixer 混合模型的胸部 CT 容积 COVID-19 病例分类
问题陈述 新型冠状病毒肺炎(COVID-19)在全球范围内的快速传播导致医疗机构出现了严重的劳动力短缺,因此需要高效的诊断工作流。虽然反转录聚合酶链式反应(RT-PCR)是标准诊断工具,但据报道其敏感性仅在 42% 到 71% 之间。相比之下,基于胸部 CT 的诊断显示出高达 97% 的报告敏感性,使其成为识别病毒性肺炎的关键手段。然而,人工解读 CT 容积非常耗时。现有的自动化计算机辅助诊断(CAD)系统通常依赖卷积神经网络(CNN),但这些系统受限于其感受野,且主要利用局部图像特征。相反,视觉 Transformer(ViT)虽然考虑了全局特征,但需要大量的训练数据才能实现高性能,而这在医学成像背景下往往难以获得。挑战在于开发一种能够有效利用 3D CT 容积中的局部和全局特征,同时在有限训练数据下保持鲁棒性的自动化分类方法。
方法论 作者提出了一种结合 3D 卷积神经网络(3D CNN)和 3D 版本 MLP-Mixer 的混合模型,用于胸部 CT 容积的自动化分类。
预处理: 输入的胸部 CT 容积经过肺部分割以隔离肺部区域。剔除缺乏肺组织的轴向切片,并将剩余的子容积缩放至 192 × 192 × 128 192 \times 192 \times 128 192 × 192 × 128 体素的固定分辨率。
3D CNN 特征提取: 缩放后的子容积由 3D CNN 处理以提取局部图像特征。该部分采用密集池化连接,利用最大池化和平均池化的组合(混合池化)来减少信息丢失,并捕捉多尺度的空间信息。输出为一个 3D 特征容积。
3D Patch 生成: 从 3D 特征容积中提取大小为 4 × 4 × 4 4 \times 4 \times 4 4 × 4 × 4 体素的非重叠 3D Patch(块)。每个 Patch 被重塑为具有 C = 64 C=64 C = 64 个组件的 1D 向量。
3D MLP-Mixer 分类: 作者将最初为 2D 图像设计的 MLP-Mixer 架构扩展到处理 3D 容积。这组 3D Patch 作为 3D MLP-Mixer 的输入(X ∈ R S × C X \in \mathbb{R}^{S \times C} X ∈ R S × C )。模型通过 L L L 层处理这些输入,每层包含两个多层感知器(MLP)模块:
Token 混合(Token-mixing): 执行跨 Patch 特征混合以整合全局上下文。
通道混合(Channel-mixing): 执行 Patch 内特征混合。 最后,输出通过全局平均池化和全连接层,生成二元分类结果(高 vs 低 COVID-19 可能性)。
核心贡献
混合架构: 本文引入了一种新型混合模型,它集成了用于局部特征提取的 3D CNN 和用于全局特征整合的 3D MLP-Mixer。这解决了纯 CNN(侧重局部)和纯 Transformer/MLP-Mixer(对数据饥渴)的局限性。
3D MLP-Mixer 适配: 作者成功地修改了最初为 2D 图像设计的 MLP-Mixer,通过将 Patching 和 Mixing 机制适配到 3D 空间,使其能够处理 3D 容积数据。
有限数据下的效率: 该混合方法旨在即使在训练样本有限的情况下(这是医学成像中的常见约束)也能实现高分类性能,因为它利用 3D CNN 在进行全局混合之前预先提取鲁棒的局部特征。
实验结果 所提方法在包含 1,205 个胸部 CT 容积(COVID-19 和非 COVID-19 病例)的数据集上进行了评估,该数据集获取自日本多家医疗机构。数据集按 80% 用于训练和 20% 用于测试进行划分。
性能: 所提出的混合模型实现了 79.5% 的分类准确率。
对比: 在相同数据集上训练的基准 3D CNN 模型(由 3D CNN 层和简单 MLP 层组成)实现了 74.8% 的准确率。
结论: 4.7% 的准确率提升表明,3D MLP-Mixer 组件通过利用全局图像特征,有效地促进了分类性能。
意义与主张 本文声称,将 3D CNN 与 3D MLP-Mixer 混合使用对于 3D 容积分类是有效的,特别是对于病毒性肺炎,因为磨玻璃样混浊和实变发生在较大区域,需要同时进行局部和全局特征分析。作者强调,这种混合结构允许在无需纯 MLP-Mixer 或 ViT 模型所需的大规模训练数据集的情况下实现高准确率。
然而,作者在临床部署方面保持了谦逊的态度。他们指出,在将该模型应用于临床环境之前,仍需进一步提高分类准确率。作者确定的未来工作包括使用数据增强来增强解剖学和强度的变化、纳入国际数据集,以及持续开发完整的 COVID-19 CAD 系统。本文并未声称当前模型已准备好立即投入临床使用,而是将其呈现为实现这一目标过程中极具前景的一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。