← 最新论文
🤖 machine learning

Bridging visual saliency and large language models for explainable deep learning in medical imaging

本文提出了一种多模态可解释性框架,该框架将基于卷积神经网络的肿瘤分类与分割、视觉显著性映射以及大型语言模型相结合,以生成用于脑肿瘤磁共振成像分析的人类可解释、放射学风格的诊断报告,从而提升人工智能在医学影像中的透明度和临床采纳度。

原作者: Paul Valery Nguezet, Elie Tagne Fute, Yusuf Brima, Benoit Martin Azanguezet, Marcellin Atemkeng

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Paul Valery Nguezet, Elie Tagne Fute, Yusuf Brima, Benoit Martin Azanguezet, Marcellin Atemkeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一位才华横溢却沉默不语的放射科医生。这位医生可以查看脑部扫描图像,并以惊人的准确性瞬间识别出肿瘤。然而,如果你问:“你为什么认为那是肿瘤?”或“大脑的哪一部分受到了影响?”,这位医生只是指着屏幕说:“我很确定,相信我。”他们无法用语言解释自己的推理过程。这正是当前许多医疗人工智能模型面临的问题:它们是“黑盒”,只给出答案而不提供解释。

本文介绍了一种新系统,旨在赋予这种沉默的 AI 以声音和地图。它弥合了计算机原始计算与人类医生理解之间的鸿沟。以下是该系统的工作原理,分步说明,并辅以简单的类比:

1. “双脑”训练(基础)

首先,研究人员训练了九种不同的人工智能模型(称为 CNNs),让它们同时完成两项任务。想象一名学生一边备考,一边学习绘制教室的地图。

  • 任务 A:识别肿瘤类型(如胶质瘤、脑膜瘤或垂体瘤)。
  • 任务 B:勾勒出肿瘤所在的大致轮廓。

通过迫使 AI 在学习“是什么”的同时学习“在哪里”,该模型变得更加智能和精确。在这个“班级”中表现最好的学生是一个名为InceptionResNetV2的模型。

2. “聚光灯”(视觉显著性)

一旦 AI 完成训练,它仍然无法说话。因此,研究人员使用了一种“聚光灯”技术。他们询问 AI:“图像中的哪些像素让你决定那是肿瘤?”

  • AI 会在图像上投射出一层发热的热力图,突出显示它最关注的区域。
  • 研究人员测试了三种不同类型的“聚光灯”(Grad-CAM、Grad-CAM++ 和 ScoreCAM)。
  • 获胜者Grad-CAM++“聚光灯”最为锐利。它不仅模糊地发光,而是紧密聚焦于实际的肿瘤组织,忽略周围健康的脑组织。

3. 将光转化为形状(分割)

发光的heatmap仍然有些模糊。这就像在墙上看到影子;你知道那里有东西,但不知道确切形状。

  • 系统利用智能滤波器将这种模糊的光晕裁剪出来,将“光晕”转化为肿瘤清晰的黑白轮廓(掩膜)。
  • 这一步至关重要,因为它将模糊的概念转化为可测量的具体形状。

4. “解剖翻译器”(图谱映射)

现在系统拥有了形状,但它不知道这个形状接触到了什么。它靠近记忆中心吗?还是语言中心?

  • 研究人员将肿瘤形状叠加到一张巨大、详细的人脑三维图谱上(称为哈佛 - 牛津图谱)。
  • 这就像将一张肿瘤贴纸贴在城市地图上。系统现在可以说:“这个肿瘤正好位于‘岛叶皮层’和‘前扣带回’之上。”
  • 它精确计算出这些脑区有多少百分比被肿瘤覆盖。

5. “医疗报告员”(大型语言模型)

最后,系统需要开口说话。它将所有数据——肿瘤类型、置信度评分、涉及的确切脑区以及肿瘤大小——输入到一个“翻译器”(大型语言模型或 LLM)中。

  • 研究人员测试了三种不同的“翻译器”:Grok3、Mistral 和 LLaMA
  • 这些模型充当专业的医疗文书。它们将原始数据转化为连贯、易读的报告,听起来就像医生在与另一位医生交谈。
  • 结果
    • Grok3 最为“啰嗦”且多样化,词汇丰富。
    • LLaMA 最易读,使用简单清晰的句子。
    • 两者都能生成听起来专业且合乎逻辑的报告。

最终成果

结果是一个完整的方案。医生不再仅仅收到一个写着“脑膜瘤”的标签,而是收到一份报告,内容如下:

"AI 已识别出脑膜瘤。它主要位于岛叶皮层和前扣带回,覆盖了后者约 64% 的区域。基于此位置,该肿瘤可能会影响情绪调节和决策能力。”

为何重要(根据论文所述)

论文声称,该系统使 AI 变得“可解释”。它不仅仅是猜测,而是展示其推理过程。它将计算机的数学运算与人类解剖学联系起来,然后将其转化为人类语言。这有助于医生信任 AI,因为他们可以看到 AI 做出决定的原因以及问题所在,而不仅仅是盲目猜测。

重要提示:本文完全专注于构建这一解释框架并测试模型的执行效果。它并未声称该系统目前正被医院用于患者治疗,也未预测未来的临床结果。这是一个概念验证,展示了如何使 AI 变得透明且可读。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →