Breast cancer risk prediction from longitudinal mammography reports in a real-world health system
本研究展示了一个经过验证、具有可解释性且无需图像的乳腺癌风险模型,该模型基于巴西 180 万名患者的纵向乳腺摄影报告进行训练,证明了个性化的风险分层可以有效识别高风险个体以实现早期检测,同时使低风险患者能够安全地延长筛查间隔。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
乳腺摄影的“水晶球”
想象一下,你正走在一座巨大的图书馆里,每一本书都在讲述着一个人的健康故事。几十年来,医生们一直试图通过只看故事中的一页——通常是最近的一页——来预测谁可能会生病。在乳腺癌筛查的世界里,这一页就是乳腺摄影报告。目前,这个系统有点像一位严格的图书管理员,给每个人都制定了同样的日程表:“无论你是谁,每年都要检查一次你的书。”这虽然还算凑合,但效率不高。这意味着一些极有可能生病的人可能会因为检查不够频繁而漏掉,而另一些非常安全的人则可能检查得过于频繁,从而浪费时间并引起不必要的担忧。
科学家们一直试图建造一个更好的“水晶球”来预测风险。他们知道,一个人的风险不仅仅取决于年龄或一张乳房的照片,而是关于整个故事。把风险预测想象成尝试预测天气:你不会只看五秒钟的天空,你会观察风力、湿度、气压以及过去几天的天气情况。这项新研究深入探讨了这一理念,利用海量的健康记录,旨在观察阅读患者乳腺摄影的“整个故事”——而非仅仅是最近的一个快照——是否能更准确地告诉我们谁需要密切观察,以及谁可以放松下来。
伟大的健康系统侦探故事
现在,让我们来谈谈研究人员实际做了什么。他们与巴西最大的私立医疗系统 Hapvida 合作,利用极其庞大的数据扮演侦探角色。他们不仅仅观察了几百个人,而是扫描了 180 万名患者的医疗史,分析了惊人的 460 万份乳腺摄影报告。这就像是在阅读一座小型城市规模图书馆里的每一本书!
这里是聪明之处:通常情况下,为了利用高科技人工智能预测癌症风险,你需要实际的 X 光图像(即照片本身)。但这个团队决定尝试一种不同的方法。他们构建了一个根本不看图片的模型。相反,它阅读的是放射科医生撰写的文本报告。想象一个阅读医生笔记的机器人,它寻找特定的词汇和短语,然后将这些词汇与患者的其他事实(如年龄、家族史以及之前的检查频率)结合起来。这个机器人还会关注这些报告发生的时间,从而构建出患者健康旅程的时间线。
结果令人惊讶地强大。该模型能够以极高的准确度预测谁会在未来 一到五年内 患上乳腺癌。事实上,对于五年的展望,它得到了 0.86 的评分(在 1.0 为完美、0.5 相当于抛硬币的比例尺中)。这是一个大新闻,因为这意味着该模型非常擅长区分谁是安全的,谁是不安全的。
研究发现了一些非常有趣的模式。如果模型将排名前 3.4% 的检查标记为“高风险”,它能成功捕捉到 50.1% 的未来癌症病例。这意味着通过将额外注意力集中在极小部分的群体上,医生有可能发现原本会被漏掉的一半癌症。另一方面,模型显示,对于底部 47% 的患者(即风险最低的人群),在五年内仅有 10.0% 患上了癌症。这表明,对于近一半的患者来说,延长两次检查之间的间隔可能是安全的——也许是每两年检查一次而不是每年一次——从而减轻患者和医疗系统的负担。
其中一个最令人兴奋的发现是,该模型并不只是依赖当前的报告,它利用了历史记录。报告的文本是最重要的线索,远比单纯的结构化数字重要得多。人工智能学到了,医生笔记中的某些词汇组合——比如提到“钙化”或“手术史”——是强烈的风险信号。有趣的是,模型还学到了“令人安心”的词汇,比如“双侧对称”(意味着两侧看起来一样),是患者安全的强信号。
研究人员仔细检查了他们的工作。他们在不同年龄段以及巴西的所有五个地区测试了该模型,它在各地都表现良好。他们甚至检查了模型是否通过寻找“乳房切除术”等术语来“作弊”(这是一种明显但不公平的捷径)。他们发现,即使没有这些特定术语,模型仍然表现出色,证明它确实理解了风险的复杂模式。
那么,这意味着什么?这表明我们并不总是需要原始的 X 光图像来构建强大的风险预测器。通过简单地阅读医生已经写下的故事,并结合患者的历史记录,我们可以制定个性化的筛查计划。这可以帮助医生在风险较高的人群中及早发现癌症,同时让低风险人群能够稍微放松,减少检查频率。这是迈向未来的重要一步——未来的筛查不再是“一刀切”的规则,而是基于每个人的独特健康故事所制定的定制化计划。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。