RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding
RadPRM 是一种新颖的视觉-语言预训练框架,它通过模式分层监督,将胸部 X 光图像与临床医生定义的专用视觉子空间中的概念进行对齐,与传统的共享空间模型相比,显著提升了零样本分类、视觉定位以及概念解耦检索的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图通过向计算机展示图片并阅读关于这些图片的文字,来教它理解这个世界。这就是“视觉-语言”学习的核心——这是人工智能的一个分支,旨在让机器尝试将它们所看到的与它们所读到的内容联系起来。长期以来,科学家们一直使用一种“一刀切”的方法来教授这些计算机:他们向计算机展示一张胸部 X 光片,并给出医生的整篇报告文本,要求计算机学习如何将这两者作为一个整体的、巨大的信息块进行匹配。这就像是通过同时听完一整部小说并看一张单一场景的照片来学习一门新语言,并寄希望于计算机能神奇地搞清楚哪个词对应图像的哪一部分。虽然这种方法在处理通用任务时表现尚可,但在需要寻找特定细节时却显得非常混乱。如果医生写道:“心脏肥大,但肺部清晰”,计算机可能会对图像中哪部分对应心脏、哪部分对应肺部感到困惑。这种精确度的缺失使得医生很难信任 AI,因为他们无法轻易看到计算机为何做出特定的决策,也无法让计算机精准地指向它发现问题的位置。
这就是新的论文 RadPRISM 诞生的原因。研究人员想要构建一种更聪明的方法,让计算机能够阅读医学报告并观察 X 光片。他们不再将整个报告视为一个巨大的信息团,而是决定将其拆解成微小的、具体的碎片,就像把一个杂乱的工具箱分类整理到存放锤子、螺丝刀和扳手的独立抽屉中一样。他们创建了一个系统,该系统可以获取医生的自由文本报告,利用强大的 AI 语言工具找出描述特定事物(如“骨折”或“肺部积液”)的具体句子,然后教计算机去寻找图像中仅属于该特定事物的部分。你可以把它想象成给计算机每种特定的医学概念都配上了一把放大镜,而不是用一个广角镜头去看整张照片。结果是,这台计算机不仅能说出“哪里出了问题”,还能精准地指出问题所在,并使用与人类医生相同的描述性语言进行解释,而且这一切都不需要人类在训练期间为每一个问题画框。
核心理念:整理工具箱
由来自慕尼黑工业大学的 Fabian Drexel 及其同事领导的团队意识到,之前的 AI 模型就像是在试图一次性背诵整个图书馆的学生。它们会学习到“肺炎”和“积液”都是肺部的坏事,但它们难以理清其中的细节。如果一份报告说“左侧有积液,但右侧没有”,标准的模型可能只会学习到“积液 = 坏事”,而忘记了它是在哪一侧。
为了解决这个问题,研究人员发明了 RadPRISM。他们从慕尼黑一家医院的超过 323,562 张胸部 X 光片及其对应的自由文本报告的大型档案库中开始工作。他们没有将整个报告喂给计算机,而是使用了一种特殊的 AI 工具(大型语言模型)充当一名超快速的图书管理员。这位“图书管理员”阅读了每一份报告,并为 19 种不同的医学概念提取了特定的句子,例如“肺炎”、“骨折”或“心脏大小”。
想象一下,计算机的大脑是一个拥有 19 个不同“分室”的巨大房间。当图书管理员发现一句关于“肺炎”的句子时,它会将该句子发送到“肺炎室”;当它发现一句关于“骨折”的句子时,它会将该句子发送到“骨折室”。随后,计算机学习观察 X 光片,并寻找仅与“肺炎室”或仅与“骨折室”相匹配的视觉线索。这被称为“概念分层”(concept-stratified)学习。这迫使计算机保持其想法的独立与有序,而不是将它们全部混杂在一个混乱的大堆里。
研究发现:更锐利的眼睛与更好的记忆力
这种新方法的测试结果令人印象深刻。当研究人员在从未见过的 X 光片上测试计算机时(这项任务被称为“零样本分类”),RadPRM 模型的正确率达到了 0.868(以宏观 AUROC 指标衡量)。相比之下,旧的“一刀切”方法仅达到了 0.717 的正确率。这是一个巨大的飞跃,表明将信息组织到独立的“房间”中确实有助于计算机理解细节。
但真正的魔力发生在要求计算机在 X 光片上指出问题所在时,这项任务被称为“视觉定位”(visual grounding)。这就像是要求计算机在肺炎的具体位置点一个点。在利用名为 CheXlocalize 的公共数据集进行的测试中,RadPRISM 比之前的最佳模型 CARZero 有了巨大的提升:
- 对于 肺不张(Atelectasis,肺部塌陷),RadPRISM 在找准位置方面的表现提升了 4.3 倍。
- 对于 胸腔积液(Pleural Effusion),提升了 2.8 倍。
- 对于 肺部病变(Lung Lesions),提升了 1.5 倍。
更令人兴奋的是,计算机在没有任何医生画圈示例的情况下完成了这一切。它仅仅通过阅读文本描述并观察图片,就学会了如何指向目标。
人类测试:医生会信任它吗?
为了确保这不仅仅是计算机的一种技巧,研究人员邀请了人类医生参与。他们让六名放射科住院医师查看了 200 张 X 光片,并对计算机的工作进行了评判。他们提出了三个问题:
- 计算机是否正确判断了疾病是否存在?(正确率为 0.83)。
- 计算机的“注意力图”(即它高亮显示的区域)是否与疾病实际所在的位置相符?(正确率为 0.85)。
- 计算机能否从其数据库中检索出描述该图像中疾病的句子?(正确率为 0.78)。
医生们对第三点印象尤为深刻。由于计算机已经学会了分离各种概念,它可以检索出与图像完美匹配的、具有高度描述性的句子,例如“右肺上叶性质稳定的巨大肿块(约 6 厘米)”。这是旧模型无法做到的,因为它们是基于固定的标签列表(例如仅有“是/否”)进行训练的,并不具备提取丰富描述性语言的能力。
为什么这很重要
论文指出,通过将医生杂乱、流动的语言分解为有组织的、具体的概念,我们可以构建出不仅更聪明,而且更透明的 AI。医生可以观察计算机的工作,看到它使用了哪个“房间”来做出决策,并阅读与图像相匹配的具体句子。这使得 AI 不再是一个“黑盒”,而是一个能使用与医疗团队相同语言的得力助手。
然而,作者也谨慎地指出,这目前仍是一个概念验证。虽然结果很强,但它们主要是在一家医院的胸部 X 光片和一个公共数据集上进行的测试。他们还发现,该系统目前尚不完美;对于像极细微骨折或肺部薄薄的气体线(气胸)这类难以观察的事物,计算机有时难以精准指向位置,这可能是因为图像的分辨率不够高。但其核心思想——即通过按概念组织信息来提高 AI 的智能度和可信度——似乎是迈向医疗技术领域的一个坚实的进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。