Alzheimer disease risk estimates lose clinical calibration across study phases despite useful patient ranking
尽管阿尔茨海默病风险模型在不同研究阶段仍能保持有效的患者排序,但其绝对概率估计存在显著的校准漂移,因此当招募或测量实践发生变化时,必须对概率尺度进行重新验证。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位医生正试图预测一名患有轻度记忆障碍患者的未来。其目标是估算此人在未来两年内发展为阿尔茨海默病的概率。这一预测有两个截然不同的用途。首先,它有助于对患者进行排序,将风险最高的患者排在最前列,以便医生知道谁需要最紧急的关注。其次,它提供了一个具体的数字,一个代表疾病实际发生可能性的百分比。这个数字引导着关键决策,例如是否订购昂贵的脑部扫描、是否让患者加入临床试验,或者是否要进行一场关于未来的严肃谈话。为了使这个系统发挥作用,列表必须准确,但这个数字也必须真实地反映所治疗的特定人群。如果数字是错误的,患者可能会被告知患病风险很高,而实际上他们是安全的,反之亦然,这会导致不必要的担忧或错失治疗机会。
莫里斯·安东尼·尤因(Maurice Antony Ewing)的一项新研究调查了当患者群体随时间变化时,这些概率数字是否仍然可靠。该研究聚焦于“阿尔茨海默病神经影像学倡议”(Alzheimer's Disease Neuroimaging Initiative),这是一个自2004年以来一直在追踪数千人的大规模、长期运行的项目。多年来,该项目经历了不同的阶段,招募了不同类型的患者,并使用了略微不同的方法来测量记忆和思维能力。研究人员提出了一个简单但至关重要的问题:如果一个计算机模型是利用该项目早期阶段的数据进行训练来预测风险,那么当它应用于后期阶段的患者时,是否仍能给出准确的百分比估计,即使它仍能正确地对谁比谁更严重进行排序?
为了寻找答案,研究人员利用该项目的第一个阶段的数据构建了十一个不同的计算机模型。这些模型学习了如何利用患者的年龄、遗传标记和记忆测试得分来预测在两年内发展为阿尔茨海默病的概率。一旦完成训练,这些模型就会被送到项目的第二个阶段,为一组新的患者进行预测。研究人员随后进行了反向操作,即在第二阶段进行训练并将模型测试在第一阶段。在这两个方向上,模型都与专门为目标组构建的新模型进行了比较,后者作为局部标准。该研究涉及一千多名患有轻度认知障碍的参与者,追踪他们在两年窗口期内是否进展为阿尔茨海默病。
结果显示了排序能力与风险估算之间明显的、令人不安的分歧。当在其中一个阶段训练的模型在另一个阶段接受测试时,它们在对患者进行排序方面表现得相当出色。它们仍能识别哪些个体比同龄人更有可能发展出疾病,其表现往往甚至略优于为该特定组别构建的局部模型。然而,它们分配给这些风险的具体数字却出现了巨大的偏差。在第二阶段,一个基于第一阶段训练的模型所预测的风险与实际情况平均偏差了15个百分点,而为该阶段构建的模型偏差仅为约4个百分点。这意味着,一名患者可能会被告知患病的概率为40%,而其实际概率仅为25%,或者反之亦然。这种误差足以让患者跨越医疗阈值,从而可能导致其走上一条不必要的检测之路,或被剥夺参加某项临床试验的机会。
研究进一步探讨了发生这种情况的原因。研究人员测试了误差是否是由缺失数据引起的(例如,在后期阶段未记录某些记忆测试得分),或者是由于包含了特定的极轻微症状患者群体。通过从分析中剔除这些变量和特定的患者组,研究人员发现问题依然存在。即使模型仅使用最完整的数据并排除了最轻微的病例,数字仍然是不准确的。这种误差并非源于数学上的小故障或单一测试的缺陷,而是由于数值含义发生了根本性的转变。后期阶段的人群发生了变化:他们更年轻,初始症状较轻,且与早期组相比,在两年内发展为疾病的可能性较低。一个基于年龄较大、病情较重人群训练的模型,只是将旧的规则应用于新的现实,导致了概率的漂移。
为了修复这个问题,研究人员测试了模型在转移到新组别后是否可以进行调整。他们发现,仅仅通过修正新组别的平均风险水平就能产生显著帮助,将误差从15个百分点降低到了约3或4个百分点。然而,这还不足以完全解决问题。患者特定症状与风险之间的关系也发生了变化。只有当模型经过调整,既考虑了组别的平均风险,又考虑了个体症状如何映射到风险时,预测才重新变得准确。这种两步校正法恢复了数字的可靠性,证明了模型本身并未损坏,而是需要针对新环境进行重新校准。
这些发现为医学预测的未来提供了清晰的教训。一个能够成功对患者进行风险排序的计算机模型,并不自动意味着它已经准备好给出具体的患病百分比概率。随着医学计划的演进——无论是招募了不同的人群,还是使用了新的测量工具——风险百分比的含义也会发生变化。十年前对某组患者准确的数字,对于今天的另一组患者来说可能是误导性的,即使他们的症状看起来相似。研究结论指出,每当预测模型被移动到新的环境或新的时间点时,医生和研究人员必须重新检查概率数字的准确性。他们不能假设规模保持不变。虽然将患者从高风险到低风险进行排序的能力可以很好地延续,但对危险程度的具体估算则需要全新的审视,以确保其反映了当前诊室中患者的真实情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。