Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation
本文介绍了 RadFound,这是一个大规模开源视觉-语言基础模型,在涵盖 19 个器官系统的 810 多万张放射学图像和 25 万个图文对上进行了训练,通过一种新颖的架构以及在全新的 RadVLBench 基准测试上的全面评估,证明了其在多模态感知和生成任务方面相比现有模型具有卓越的专家级性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医院中,放射科医生的办公室是一个高度专注的场所,人类的眼睛在这里扫描成千上万幅图像,以寻找疾病的隐形征兆。这些图像从胸部平片 X 光到甲状腺的三维切片,不仅仅是图片;它们是复杂的数据集,需要对解剖学和病理学有深刻的理解才能进行正确解读。几十年来,计算机一直被训练用于识别这些图像中的特定模式,充当能够识别骨折或肺结节的专业工具。然而,这些工具传统上局限于单一任务,无法与医生对话,也无法用自然语言解释其推理过程。最近,新一代人工智能出现了,它结合了视觉能力与理解及生成语言的能力。这些被称为“视觉-语言模型”的系统,旨在弥合医学影像的视觉世界与临床报告的文本世界之间的鸿沟,承诺提供一种不仅能看到医生所见,还能以人类专家般的细微差别进行描述的助手。
一组研究人员现在推出了一套名为 RadFound 的新系统,专门旨在精通放射学的复杂语言。不同于以往依赖通用知识或对现有工具进行简单改编的尝试,这个新模型基于 BLIP-2 架构构建,但通过海量的医学数据进行了精炼。研究人员收集了超过 810 万幅医学图像以及 25 万对图像及其对应的文本描述。该数据集涵盖了 19 个主要器官系统和 10 种成像模态,确保模型是从广泛的现实案例而非狭窄的选择中学习。为了教导系统如何像专家一样观察,团队开发了一种独特的训练方法,强制模型观察图像、遮盖部分内容,然后重建缺失的细节,同时将其与其他相关图像进行比较。这一过程帮助计算机不仅学习单次扫描的精细细节,还学习了不同图像之间如何相互关联的更广泛背景,模拟了放射科医生将当前扫描结果与患者过往记录进行对比的方式。
该系统还通过专门的对齐过程学习将这些视觉洞察与语言联系起来。模型并非仅仅将单词与图片匹配,而是通过在特定顺序中交织图像与文本的数据进行训练,从而学习理解医学报告的流向。它学会了处理可能涉及同时查看多幅图像的指令,例如比较两个不同角度的乳腺摄影图像,或分析甲状腺的三维 CT 扫描。这种能力使模型能够处理复杂的临床问题,例如要求对当前扫描与之前的扫描进行比较,或者请求对不同身体部位的发现进行详细描述。研究人员在一个他们创建的新挑战集上测试了这个系统,这些挑战包括回答有关医学图像的问题、编写短篇说明以及为胸部 X 光、乳腺摄影和甲状腺扫描生成完整的诊断报告。
这些测试结果表明,这款新模型显著优于那些并非专门为放射学设计的现有系统。当被要求回答有关医学图像的问题时,即使问题很复杂或需要比较多个视图,该模型提供正确答案的频率也远高于其竞争对手。在模型必须生成文本的任务中,它生成的报告不仅语法正确,而且在临床上也具有准确性。研究人员使用标准的计算机指标来衡量这种成功,但他们更进一步,让医生对报告进行人工评估。在这些评估中,模型的输出在可读性、医学推理能力以及捕捉重要异常情况的能力方面得到了评分。结果显示,该模型的表现达到了与拥有十年以上经验的高级放射科医生相当的水平,在某些情况下甚至超过了初级放射科医生。这表明该系统已达到了一定的专业水平,能够作为临床工作流中可靠的伙伴,处理现代放射学中多样且高要求的任务。
尽管取得了这些令人印象深刻的成果,研究人员谨慎地指出,这项工作是一个重要的进步,而非最终解决方案。他们承认,虽然模型在受控测试中表现良好,但将此类技术整合到日常医院实践中仍需要进一步研究。目前的评估在很大程度上依赖于人类专家来判断报告质量,这一过程虽然准确,但既耗时又难以规模化。团队建议,未来的工作必须致力于开发更好的方法,在不完全依赖人工评分的情况下,自动衡量这些报告的临床价值。此外,在繁忙的医院环境中,使用该系统与人类医生协作的实际影响仍有待观察。尽管如此,RadFound 的开发证明了创造出一种能够理解医学影像独特复杂性的人工智能是可能的,它提供了一个强大的新工具,有朝一日能帮助医生为患者提供更快、更准确的护理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。