← 最新论文
🤖 machine learning

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

MedPMC 引入了一个自动化框架,从 610 万篇 PubMed Central 文章中策划了 1100 万个高保真医学图文对,与现有基准相比,显著提升了医学多模态基础模型在零样本分类、视觉问答和临床检索基准测试中的性能。

原作者: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gu
发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,如何教一台计算机成为一名医生。为了实现这一目标,计算机需要“看到”医学图像(如 X 光片或皮肤照片)并“阅读”解释这些图像的文本。但这里有一个巨大的难题:由于隐私法律的限制,真实的患者数据被锁在医院里,很难获取足够的数据来训练一个聪明的 AI。

这项研究背后的研究人员开发了 MedPMC,他们找到了一个巧妙的变通方法。他们意识到,世界上最大的医学知识库——PubMed Central (PMC),包含了数百万篇由专家撰写的文章。这些文章包含数以千计的医学图像以及描述它们的文本。然而,仅仅下载这个库里的所有内容就像是试图通过倾倒一整座废料场来盖房子——里面充满了有用的材料,但也充满了垃圾(比如图表、流程图和分子结构图,这些并不是真正的患者照片)以及混乱的组合(例如一张图片里挤在一起了四张不同的图片,却只配有一个冗长且令人困惑的说明文字)。

以下是他们如何清理这些数据以及他们的发现,通过简单的语言进行解释:

1. “智能图书管理员”系统(框架)

他们并没有只是盲目地抓取所有内容,而是构建了一个自动化的五步“智能图书管理员”系统,来筛选 610 万篇文章。你可以把它想象成一条高科技流水线:

  • 第一步:守门员。 它在下载图像之前先阅读文本。如果文本听起来像是关于某种真实的医学状况,它就会保留该文件;如果只是数学图表或化学结构图,它就会将其丢弃。这避免了他们下载数个 TB 的无用垃圾。
  • 第二步:拆解者。 许多医学图像是“复合图”——即一个大框内包含四五个小图(例如显微镜切片的网格图)。系统会检测到这些图像,并将它们仔细地切割成独立的个体。
  • 第三步:裁剪师。 一旦图片被切开,冗长且混乱的说明文字也需要被切分。系统会将每一张微小的图片与其特定的短句进行匹配。以前,计算机经常会把这些搞混,但这个系统能以极高的精度完成这项工作。
  • 第四步:质量控制。 它会再次检查每一张微小的图片,确保它确实是医学图像,而不是残留的图表或示意图。
  • 第五步:结果。 从杂乱无章的图书馆中,他们精选出了 1100 万对高质量、干净的“医学图像-文本”对

2. “新鲜度”因素

大多数数据集就像是 2020 年拍摄的图书馆快照;随着新书的出版,它们很快就会过时。MedPMC 则不同,它是被设计为可以持续更新的。随着新的医学文章发表,该系统可以自动处理它们。自 2020 年以来,它每年都能发现超过一百万个新的、有用的图像-文本对。

3. “实习医生”(模型)

研究人员使用这些干净、新鲜的数据训练了一个名为 MedPMC-CLIP 的新 AI 模型。为了测试它的效果,他们对其进行了一系列测试:

  • “盲测”(零样本学习/Zero-Shot): 他们要求 AI 在没有任何额外训练的情况下,识别从未见过的图像中的疾病。
    • 结果: 尽管它接受训练的数据量比之前的最佳模型更少,但它仍以显著的优势超越了它们(平均高出约 7%)。这就像是一个学生虽然读的书比别人少,但因为书的质量更高,所以对知识理解得更好。
  • “问答”测试: 他们将这个 AI 接入到一个更大的医疗问答系统中。
    • 结果: 当该系统使用经过 MedPMC 训练的“眼睛”时,它在回答有关图像所见内容的医疗问题方面表现得更出色。
  • “现实世界”测试: 他们在纽黑文一家医院的 10,000 张真实皮肤照片上进行了测试。目标是看 AI 能否根据一段皮肤红肿的描述,在医院的数据库中找到匹配的照片。
    • 结果: 与之前的最佳模型相比,它在寻找正确照片方面的表现显著提升。

4. 为什么这很重要

论文指出,医学 AI 的问题不仅仅是我们是否需要更多的数据,而是我们需要更好的数据。以往利用医学文献的尝试往往包含了太多“噪声”(非医学图像),并且未能将图片与它们的描述进行正确匹配。

通过将数据清洗视为一个严谨的工程过程——即进行精确的清理、分离和对齐——他们证明了你可以在不需要违反隐私法去获取真实患者记录的情况下,构建出一个更聪明、更具泛化能力的医学 AI。

简而言之: 他们将一个杂乱无章、组织混乱的医学文章库,变成了一本精美、有序的完美训练手册。当他们用这本手册来教导 AI 时,这个 AI 变成了一个比那些使用旧的、混乱的手册训练出来的 AI 更好的“医生”。他们已经将这个系统、数据以及训练好的 AI 向所有人开放使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →