MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter
MIRROR 原型机提出了一种多模态放射学报告系统,该系统通过链接分类器、定位器和文本生成器,以确保发现结果具有基于模型概率的可审计性,同时强调尽管该模型在 ChestMNIST 上实现了优于随机水平的判别能力,但由于类别不平衡导致其无法对大多数情况做出阳性预测,其实际应用效用受到了严重限制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,一个能够观察人类胸部图像并识别疾病的计算机程序不再是幻想,而是一个已经到来的现实。这些基于深度学习构建的程序可以扫描成千上万张X光片,并识别出通常能与人类专家技能相匹配的疾病模式。然而,为了让医生信任这样一台机器,计算机不能仅仅是低声报出一个数字。它必须解释自己。它需要指向图像中它认为有问题的地方,并描述为什么它认为那个地方有病。危险在于当计算机试图为医生撰写一份报告时。如果允许计算机在写作时看着图像,它可能会编造一些听起来非常专业、但实际上并未被诊断系统所看到的细节。这在机器所知道的内容与其声称知道的内容之间创造了一个无形的鸿沟,这个鸿沟可能会导致医生做出危险的错误判断。
一个研究团队构建了一个名为 MIROR 的原型系统,旨在解决这个特定的信任问题。该系统设计有一个严格的规则:负责撰写报告的软件部分绝不允许看到X光图像。相反,图像首先由一个分类器进行分析,该分类器仅列出存在哪些疾病以及发生的可能性有多大。随后,第二个工具会突出显示图像中这些疾病出现的概括区域。只有这些发现的列表和位置信息会被传递给写作引擎。因为书写者看不到图片,所以它在物理上不可能发明一种新的疾病,或描述一个它并未接收到的细节。研究人员在胸部X光片上测试了这个系统,发现虽然计算机在对疾病可能性的排序方面表现出色,但在对大多数疾病做出最终决定时却显得力不从心。更重要的是,他们发现,即使计算机写出了流畅、专业的报告,它也经常包含一些系统从未实际计算过的特定医学测量值。
该团队通过三个截然不同的步骤构建了这个流水线,以确保最终报告保持诚实。首先,一个神经网络(一种模仿人类大脑的计算机程序)扫描X光片,并为十四种不同类型的胸部状况分配概率得分。其次,一个定位工具查看同一张图像,并绘制一张粗略的地图,显示计算机认为疾病所在的位置,并将该位置转化为简单的名称,如“左上肺”。第三,一个语言模型仅根据疾病列表、得分及其命名的位置来编写最终的医学报告。这里的关键设计选择是,语言模型永远不会看到X光片本身。这就像一位秘书被递交给一份关于事实的打字列表,并被要求写一个故事,但被禁止查看原始文件。这确保了报告中的疾病列表与计算机发现的列表完全一致,防止了系统幻觉出从未检测到的病情。
当研究人员在大量的胸部X光片上测试该系统时,结果揭示了一个关于机器能做什么和不能做什么的复杂图景。计算机对图像结构的理解非常出色。它能够区分健康的胸部和患病的胸部,并且它对疾病可能性的排序远好于随机猜测。对于某些情况,例如肺部积液或心脏肥大,该系统相当准确。然而,当被问及是否确定某种疾病存在或不存在时,该系统对它所训练寻找的十四种情况中的十一种保持沉默。它只是没有足够的信心对大多数情况说“是”或“不”。这种沉默并非设计使然,而是训练数据和测试中所用图像分辨率较低的结果。系统学会了识别模式,但尚未学会做出临床诊断所需的果断决策。
或许最令人深思的发现来自于观察系统生成的报告。由于系统的写作部分非常流畅,它产生的文本听起来完全像是由人类医生撰写的报告。然而,研究人员发现,这种流畅性伴随着隐藏的代价。在一个例子中,报告指出心脏大小正常,且肺部底部的角度清晰。但系统从未测量过心脏大小,也从未检查过那些角度。它只是填充了这些句子,因为它们是医学报告中的常用短语。系统对于它检测到的疾病是正确的,但它在围绕这些疾病的细节上是在编造。这展示了一个关键的界限:系统可以保证疾病列表是真实且可审计的,但它无法保证描述这些疾病的句子是真实的。报告虽然基于它发现的疾病证据,但在它为了使故事完整而发明的细节上却是缺乏依据的。
研究人员还展示了这种架构可以通过简单地更改名称和术语列表,而不是重写整个计算机代码,来适配其他类型的医学扫描,如脑部核磁共振成像(MRI)或头部CT。这表明,将检测与写作分离的方法是一种灵活的工具,可以跨越不同的医学领域。然而,团队谨慎地声明,这是一个研究原型,而非准备投入医院使用的医疗设备。该系统尚未在真实患者身上进行测试,研究人员也尚未衡量拥有这些报告是否能帮助医生做出更好的决策。这项工作是一项概念验证,证明了建立一个即便在文字描述上无法保证事实,也能锁定事实内容的系统是可能的。
最终,这项工作的价值在于其边界的清晰性。该系统证明了你可以构建一台不会对所发现的事实撒谎的机器,因为撰写报告的部分与图像是隔绝的。但它同时也证明了,一台机器仍然可以对它并不了解的事情表现得非常有信心。研究人员总结道,对于医学领域的高风险决策,我们需要非常谨慎地对待信任。如果系统是以这种方式构建的,我们可以信任发现的列表,但我们不能信任周围的文本,除非经过人类的检查。该系统并不是要取代医生;相反,它提供了一种新的方式,让我们看到机器在何处是确定的,在何处仅仅是在猜测,从而将一个“黑箱”变成一个可以由人类审计的透明过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。