External validation and comparison of PREVENT and SCORE2 atherosclerotic cardiovascular risk scores in the MASHAD cohort study
本研究在伊朗 MASHAD 队列中对 PREVENT 和 SCORE2 心血管风险模型进行了外部验证,结果发现虽然两种模型都表现出可接受的区分度,但它们显著低估了绝对风险,并且需要进行局部重新校准,以提供针对这一中东人群的准确预测。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有两位非常受欢迎的气象预报员:PREVENT 和 SCORE2。这些预报员在欧洲和美国都非常有名,专门预测一个人在未来 10 年内遭遇“风暴”(即心脏病发作或中风)的概率。它们使用一套标准的配方:通过观察你的年龄、血压、胆固醇以及是否吸烟,来给出你发生风险的百分比。
这项研究的研究人员想要看看这些著名的气象预报员是否能在**伊朗马什哈德(Mashhad)**正常工作。他们将当地人口视为一个新的、未经测试的气象区。
以下是他们的发现,用简单的语言解释如下:
1. 问题所在:“外来”预报员过于乐观了
当研究人员将原本用于欧洲和美国的公式应用于伊朗人群时,这些预报员犯了一个大错误:它们过于乐观了。
- 类比: 想象一位伦敦的气象员告诉一位沙漠里的农民:“今天降雨概率为 1%。”但在沙漠里,实际降雨频率其实是 30%。由于预报不符合他所在的位置,这位农民会被淋透。
- 现实情况: PREVENT 和 SCORE2 都告诉伊朗人他们的心脏事件风险非常低。然而,当研究人员观察 10 年间的实际数据时,发生心脏事件的人数远多于模型预测的人数。这些模型“低估”了危险。
2. 解决方案:“局部微调”(重新校准)
研究人员并没有丢弃这些模型。相反,他们进行了一次“局部微调”。
- 类比: 把这些模型想象成一个广播电台。音乐(即它们对高风险与低风险人群进行排序的方式)很好,但音量太小了。它们不需要更换歌曲,只需要把音量旋钮调大,以匹配当地的听众。
- 行动: 他们稍微调整了数学计算,以匹配马什哈德实际发生的心脏事件数量。他们保持了相同的“排序”系统,但移动了数值,使百分比反映出真实情况。
3. 结果:谁的表现更好?
经过“微调”后,两个模型都表现得好多了,但其中一个略有优势。
- 排序能力(区分度): 两个模型在对人群进行分类方面都做得很好。它们能够分辨出谁比其他人更有可能发生事件。PREVENT 在这种分类能力上略优于 SCORE2,就像一副更清晰的眼镜。
- 准确性(校准度): 在微调之前,模型对风险“量级”的预测是错误的。微调之后,预测的风险几乎与实际风险完美契合。
- PREVENT 的整体准确性更高。这可能是因为 PREVENT 查看了更多细节,比如肾功能和糖尿病,而这些在这一特定人群中非常普遍。
- SCORE2 是一个更简单的模型(它不考虑糖尿病),但一旦针对当地的“音量”进行了调整,它依然表现良好。
4. 为什么这很重要(“净获益”)
研究人员使用了“净获益”这一概念,来观察经过微调的模型是否能帮助医生做出更好的决策。
- 类比: 想象一名正在检查行李的安全人员。
- 原始模型: 这名保安过于放松,让许多危险的包通过了(漏掉了高风险人群)。
- 微调后的模型: 这名保安变得更加警觉。他拦截了更多危险的包(捕捉到了更多高风险人群),但也误拦了一些无害的包(降低了“特异性”)。
- 发现: 研究人员发现,使用“微调”后的模型是值得的。尽管他们多标记了一些实际上安全的人,但他们成功地捕捉到了更多真正处于风险中的人。在健康领域,及早发现潜在的心脏病风险比错过它要好。
总结
研究结论是:你不能简单地将风险计算器从欧洲或美国“复制粘贴”过来,并期望它在伊朗完美运行。风险的“配方”在不同地方是不同的。
然而,好消息是,这些工具可以发挥作用,只要你针对当地人口进行“校准”。一旦研究人员调整了数字以适应马什哈德的现实情况,PREVENT 和 SCORE2 都成为了预测心脏风险的可靠工具,其中 PREVENT 由于考虑了更多的健康因素,具有轻微的优势。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。