← 最新论文
📄 medicine

Breast cancer risk prediction from longitudinal mammography reports in a real-world health system

本研究展示了一个经过验证、具有可解释性且无需图像的乳腺癌风险模型,该模型基于巴西 180 万名患者的纵向乳腺摄影报告进行训练,证明了个性化的风险分层可以有效识别高风险个体以实现早期检测,同时使低风险患者能够安全地延长筛查间隔。

原作者: Higor S. Monteiro, José A. Shiomi da Cruz, César L. C. Mattos, Iago C. Chaves, Javam C. Machado, Hérnan A. Makse, Lucas C. Parra, José S. Andrade

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Higor S. Monteiro, José A. Shiomi da Cruz, César L. C. Mattos, Iago C. Chaves, Javam C. Machado, Hérnan A. Makse, Lucas C. Parra, José S. Andrade

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

乳腺摄影的“水晶球”

想象一下,你正走在一座巨大的图书馆里,每一本书都在讲述着一个人的健康故事。几十年来,医生们一直试图通过只看故事中的一页——通常是最近的一页——来预测谁可能会生病。在乳腺癌筛查的世界里,这一页就是乳腺摄影报告。目前,这个系统有点像一位严格的图书管理员,给每个人都制定了同样的日程表:“无论你是谁,每年都要检查一次你的书。”这虽然还算凑合,但效率不高。这意味着一些极有可能生病的人可能会因为检查不够频繁而漏掉,而另一些非常安全的人则可能检查得过于频繁,从而浪费时间并引起不必要的担忧。

科学家们一直试图建造一个更好的“水晶球”来预测风险。他们知道,一个人的风险不仅仅取决于年龄或一张乳房的照片,而是关于整个故事。把风险预测想象成尝试预测天气:你不会只看五秒钟的天空,你会观察风力、湿度、气压以及过去几天的天气情况。这项新研究深入探讨了这一理念,利用海量的健康记录,旨在观察阅读患者乳腺摄影的“整个故事”——而非仅仅是最近的一个快照——是否能更准确地告诉我们谁需要密切观察,以及谁可以放松下来。

伟大的健康系统侦探故事

现在,让我们来谈谈研究人员实际做了什么。他们与巴西最大的私立医疗系统 Hapvida 合作,利用极其庞大的数据扮演侦探角色。他们不仅仅观察了几百个人,而是扫描了 180 万名患者的医疗史,分析了惊人的 460 万份乳腺摄影报告。这就像是在阅读一座小型城市规模图书馆里的每一本书!

这里是聪明之处:通常情况下,为了利用高科技人工智能预测癌症风险,你需要实际的 X 光图像(即照片本身)。但这个团队决定尝试一种不同的方法。他们构建了一个根本不看图片的模型。相反,它阅读的是放射科医生撰写的文本报告。想象一个阅读医生笔记的机器人,它寻找特定的词汇和短语,然后将这些词汇与患者的其他事实(如年龄、家族史以及之前的检查频率)结合起来。这个机器人还会关注这些报告发生的时间,从而构建出患者健康旅程的时间线。

结果令人惊讶地强大。该模型能够以极高的准确度预测谁会在未来 一到五年内 患上乳腺癌。事实上,对于五年的展望,它得到了 0.86 的评分(在 1.0 为完美、0.5 相当于抛硬币的比例尺中)。这是一个大新闻,因为这意味着该模型非常擅长区分谁是安全的,谁是不安全的。

研究发现了一些非常有趣的模式。如果模型将排名前 3.4% 的检查标记为“高风险”,它能成功捕捉到 50.1% 的未来癌症病例。这意味着通过将额外注意力集中在极小部分的群体上,医生有可能发现原本会被漏掉的一半癌症。另一方面,模型显示,对于底部 47% 的患者(即风险最低的人群),在五年内仅有 10.0% 患上了癌症。这表明,对于近一半的患者来说,延长两次检查之间的间隔可能是安全的——也许是每两年检查一次而不是每年一次——从而减轻患者和医疗系统的负担。

其中一个最令人兴奋的发现是,该模型并不只是依赖当前的报告,它利用了历史记录。报告的文本是最重要的线索,远比单纯的结构化数字重要得多。人工智能学到了,医生笔记中的某些词汇组合——比如提到“钙化”或“手术史”——是强烈的风险信号。有趣的是,模型还学到了“令人安心”的词汇,比如“双侧对称”(意味着两侧看起来一样),是患者安全的强信号。

研究人员仔细检查了他们的工作。他们在不同年龄段以及巴西的所有五个地区测试了该模型,它在各地都表现良好。他们甚至检查了模型是否通过寻找“乳房切除术”等术语来“作弊”(这是一种明显但不公平的捷径)。他们发现,即使没有这些特定术语,模型仍然表现出色,证明它确实理解了风险的复杂模式。

那么,这意味着什么?这表明我们并不总是需要原始的 X 光图像来构建强大的风险预测器。通过简单地阅读医生已经写下的故事,并结合患者的历史记录,我们可以制定个性化的筛查计划。这可以帮助医生在风险较高的人群中及早发现癌症,同时让低风险人群能够稍微放松,减少检查频率。这是迈向未来的重要一步——未来的筛查不再是“一刀切”的规则,而是基于每个人的独特健康故事所制定的定制化计划。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →