Selective data curation enables efficient pretraining of chest radiograph foundation models
该论文介绍了 CheXficient,这是一个胸部 X 线基础模型,它利用表征引导的选择性数据策展,仅需传统大规模预训练方法所需的一小部分数据和计算资源,即可在多种临床任务中实现具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,计算机正在学习如何像医生一样观察。多年来,一种普遍的观点认为,要让这些人工智能系统变得更聪明,只需向它们喂入更多的数据即可。其逻辑看似合理:计算机阅读的胸部 X 光片和放射科报告越多,它在识别疾病方面的能力就应该越强。这种通常被称为“不计代价追求规模”的方法,导致研究人员在全球范围内的医院中收集了数百万张图像。然而,这一策略也带来了沉重的代价。训练这些庞大的系统需要消耗大量的电力和时间,通常需要在强大的超级计算机上运行数周之久。此外,医学数据很少是完美的;它们往往充满了重复、向常见疾病倾斜,并且缺失了医生最迫切需要识别的那些罕见但关键的病症。该领域面临的问题是,是否存在一种更聪明的方法,可以在不耗尽资源或迷失在冗余信息海洋中的情况下,教导这些机器。
斯坦福大学的一个研究小组提出了另一条路径,即专注于质量而非数量。他们推出了一种名为 CheXefficient 的新方法,它就像是用于训练医学人工智能的数据的“精明编辑”。该系统不再盲目地将每一张 X 光片和报告都喂给计算机,而是使用一个“数据策展人”(data curator)来挑选最有用的样本。想象一下,在一座图书馆里,图书管理员根据书籍能提供多少新信息来决定保留哪些书,而不是仅仅把到来的每本书都堆在书架上。在这种情况下,计算机会观察它已经见过的图像和报告,并识别出哪些新样本与它已知的知识最为不同。它会优先考虑显示罕见或异常情况的图像,并降低那些常见且重复性高的图像的权重。通过这样做,系统可以用更少的样本学习到更完整的生命健康图景。
研究人员使用超过 120 万对胸部 X 光片及其对应的放射科报告组成的庞大集合测试了这个想法。他们训练了三个不同版本的 AI 模型以进行比较。第一个版本被称为 CheXfull,是在整个 120 万张图像的数据集上进行训练的。第二个版本是 CheXrandom,是在 28 万张图像的随机选择样本上进行训练的,这代表了典型的数据缩减规模。第三个版本是 CheXefficient,是在经过精心策划的 28 万张图像集上进行训练的,这些图像是专门因其提供了最多的新信息并覆盖了最广泛的医学状况而被选出的。结果令人震惊。CheXefficient 仅使用了大约 23% 的数据和不到全量模型所需 28% 的计算能力,其表现就与使用全部 120 万张图像训练的庞大模型一样出色。在许多测试中,它的表现甚至超过了使用随机选择数据的模型,证明了数据的特定选择比单纯的体积更为重要。
这种方法不仅节省了时间和能源,还提高了 AI 识别罕见疾病的能力,而这些疾病往往容易被忽视。在完整数据集中,常见的状况(如正常的肺部或轻微的积液)占据主导地位,而罕见的病症(如特定类型的骨折或异常感染)出现的次数则非常少。由于数据策展人积极寻找这些代表性不足的样本,CheXefficient 模型学会了更有效地识别它们。当针对训练数据中较为罕见的疾病进行测试时,该策划模型展现出了显著的泛化能力,这意味着它能以更高的准确度将所学知识应用于新的、未见过的患者。这表明,通过有意识地平衡 AI 所摄取的信息“食谱”,研究人员可以构建出不仅训练成本更低,而且在处理医院中最关键的疑难病例时更加可靠的系统。
这些益处不仅限于识别疾病。研究人员还测试了这些模型执行其他复杂任务的能力,例如描述图像中的解剖结构、分割特定器官,甚至从头开始撰写放射科报告。在每一个类别中,基于策划数据训练的模型都能与基于大规模全量数据的模型并驾齐驱。它只需要更少的标注样本就能学习这些新任务,这意味着医生需要花费更少的时间去手动纠正 AI 的工作。研究还发现,策划后的数据自然包含了来自不同年龄组和背景的更好混合比例,特别是捕捉到了更多儿童和老年人的图像,而这些群体在标准医学数据集中往往采样不足。这表明,筛选过程在无需手动强制执行严格配额的情况下,自然提升了 AI 知识的公平性和多样性。
这些发现挑战了医学人工智能领域长期以来“越大越好”的假设。研究人员证明,采用战略性的数据选择方法,可以用极小比例的资源实现同样的高性能。这是医学 AI 领域的一个关键进展,因为它表明,预算有限的医院和研究中心仍然可以构建强大且处于领先水平的诊断工具。通过专注于最具信息量的样本并避开冗余数据的噪音,更智能的医学 AI 之路变得更加高效且易于获取。这项研究的结论是,这些基础模型的未来不在于囤积每一张可用的图像,而在于策划一个更聪明、更具代表性的集合,从而教会计算机观察人类健康的完整光谱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。