← 最新论文
🤖 machine learning

FoMoH: A clinically meaningful foundation model evaluation for structured electronic health records

本文介绍了 FoMoH,这是一个包含 14 个具有临床意义的任务和超过 600 万名患者的全面基准测试,用于评估最先进的结构化电子健康记录(EHR)基础模型,并揭示了尽管这些模型在数据有限的情况下在判别能力和公平性方面优于传统基准模型,但它们在校准、低患病率设置以及跨机构可迁移性方面仍面临重大挑战。

原作者: Vincent Jeanselme, Zilin Jing, Aparajita Kashyap, Chao Pang, Florent Pollet, Young Sang Choi, Xinzhuo Jiang, Yuta Kobayashi, Yanwei Li, Sara Matijevic, Karthik Natarajan, Shalmali Joshi

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent Jeanselme, Zilin Jing, Aparajita Kashyap, Chao Pang, Florent Pollet, Young Sang Choi, Xinzhuo Jiang, Yuta Kobayashi, Yanwei Li, Sara Matijevic, Karthik Natarajan, Shalmali Joshi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一台电脑如何成为一名医生。长期以来,实现这一目标的唯一方法是向电脑展示成千上万个针对每种特定工作的具体案例:“这是骨折的样子”、“这是发烧的样子”、“这是心脏病发作的样子”。这就像训练一只狗去捡特定的球;如果你想让它去捡木棍,你就必须从头开始训练。这种方法既缓慢又昂贵,而且如果电脑遇到它从未练习过的患者,它往往会感到困惑。

最近,科学家们开始使用一种被称为“基础模型”(Foundation Models)的新技巧。把这些模型想象成超级聪明的学生,他们在见到第一位患者之前,已经读完了图书馆里所有的医学教科书。他们还没有被专门教过如何诊断骨折,但因为他们理解医学的通用语言,所以只需通过几个例子就能非常快速地学会这项特定技能。现在大家都在问的一个大问题是:这些“超级学生”真的比旧方法更有效吗?它们能应对医院中混乱且真实的现实世界吗?它们对各类患者都公平吗?这篇论文旨在通过一项严格的、现实生活的测试来寻找答案。


伟大的医院大考:测试“超级学生”

论文的作者决定不再凭空猜测,而是开始测试。他们为六个最先进的医学基础模型构建了一场大规模的“考试”。他们不仅仅是在问:“你得到正确答案了吗?”他们还提出了更深层的一系列问题:“你得到正确答案了吗,并且你知道你有多确定吗?”以及“你对待富人和穷人,或者不同种族的人群是否公平?”

他们利用来自两个主要来源(哥伦比亚大学艾尔南·科尔特医学中心和名为 MIMIC-IV 的公共数据集)的超过 600 万名患者数据对这些模型进行了测试。这场考试包含 14 种不同的临床任务,范围从预测患者是否会在住院期间死亡,到诊断糖尿病或精神分裂症等慢性疾病。

以下是研究结果的揭示,分为好消息、坏消息和棘手部分。

好消息:“少样本”超能力

最令人兴奋的发现是,这些基础模型在数据匮乏时确实拥有“魔力”。想象一下,你是一名在小诊所工作的医生,你只见过 100 例罕见病例。传统的计算机模型可能会失败,因为它看到的例子不够多,无法进行学习。但基础模型由于在预训练阶段“阅读”了数百万条记录,仍然可以做出令人惊讶的准确预测。

在这些“低数据”情况下,表现最好的模型在区分患者健康与否方面击败了传统方法。它们似乎也更加公平。因为它们是从如此庞大且多样化的人群中学习的,所以不像旧的专业化模型那样容易被不同群体(如不同种族或就医频率)所误导。这就像那位在图书馆见过所有人的“超级学生”,比起那个只跟自己朋友圈里的同学一起学习的学生,更不容易对陌生人产生偏见。

坏消息:“信心”问题

然而,这里有一个陷阱。虽然这些模型擅长说“这个患者病了”,但它们有时却很难说出“我确定这个患者病了”。

在医学领域,知道某件事发生的“可能性有多大”与知道“会发生什么”同样重要。如果一个模型说患者有 90% 的死亡概率,医生需要知道这个数字是否准确。研究发现,在数据有限的情况下,这些基础模型的**校准度(calibration)**往往很差。它们可能猜对了,但其置信度数值却不准确。这就像一位天气预报员总是预测会有雨;他们可能有一半的时间是对的,但如果明明是晴天,他们却说“降水概率 100%”,那么他们就是不可信的。研究表明,虽然这些模型擅长发现模式,但它们尚未完全学会如何准确衡量自己的确定性。

棘手的部分:“罕见病”盲区

这些模型在面对非常罕见的疾病时也表现挣扎。如果一种疾病发生在不到 1% 的患者身上,基础模型往往会失灵。作者认为,在进行大规模训练期间,模型可能会“忽略”这些罕见事件,因为它们太忙于学习那些常见的知识了。这就像一个通过阅读百万页历史资料来备考的学生,却跳过了那页虽然极其微小、甚至有些晦涩但确实出现在考试中的历史事件。当研究人员尝试通过更多数据来“微调”(fine-tune)这些模型(即教它们特定的答案)时,模型并不总能变得更好;有时,它们反而变差了,这可能是因为它们被极少数的例子搞混了。

最后的障碍:“新城市”问题

最后,论文测试了这些模型是否具有“迁移能力”。如果一个模型是在纽约(哥伦比亚大学)的患者身上训练的,它能在加利福尼亚(斯坦福大学)的患者身上工作吗?答案是令人失望的:不能

当他们把一个在斯坦福大学训练的模型拿到哥伦比亚大学进行测试时,它的表现比在本地训练的模型要差。作者解释说,医院就像不同的城市,有着不同的“方言”。一家医院记录数据的方式可能不同,或者其患者的行为习惯也不同。在某一城市接受训练的“超级学生”听不懂另一座城市的“俚语”。这意味着,目前你不能直接下载一个医疗 AI 就指望它在任何地方都能通用;它仍然需要针对每个特定的医院进行重新训练。

总结

这篇论文并没有说基础模型已经是医学的未来,但它证明了这些模型具有巨大的潜力。它们在数据难以获取时学习速度极快,并且对不同群体表现得相当公平。然而,它们在处理罕见疾病方面仍有困难,并不总是能诚实地表达自己的确定程度,而且无法轻易地在不同医院之间切换。

作者得出结论:在我们让这些模型主导局面之前,我们需要修复它们的“信心计”、“教它们关注罕见状况”,并弄清楚如何让它们理解每家医院独特的“方言”。在此之前,它们是强大的工具,但仍需要人类医生来复核它们的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →