← 最新论文
📄 health informatics

Chart review and genetic validation of electronic medical record dementia diagnoses in VA: The impact of CMS data

本研究评估了在退伍军人事务部(VA)系统的阿尔茨海默病及相关痴呆症电子病历算法中引入 CMS 数据所产生的影响,发现虽然 CMS 数据增加了病例检测量和敏感性,但对于流行病学而言,不含 CMS 数据的宽泛算法是最优的,而含有 CMS 数据的严格算法则能产生最强的晚发型阿尔茨海默病遗传关联。

原作者: Logue, M., Lee, S. O., Gillis, M., Zhang, R., Lee, M., Marra, D., Lopez, F. V., Lynch, J., Panizzon, M. S., Tsuang, D. W., Hauger, R. L., The MVP Cognitive Decline and Dementia During Aging Working Gr
发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Logue, M., Lee, S. O., Gillis, M., Zhang, R., Lee, M., Marra, D., Lopez, F. V., Lynch, J., Panizzon, M. S., Tsuang, D. W., Hauger, R. L., The MVP Cognitive Decline and Dementia During Aging Working Group,, Program, V. M. V., Merritt, V. C.

原始论文根据 CC0 1.0(https://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

技术摘要:电子病历中痴呆症诊断的图表审查与遗传学验证:CMS 数据的影响

问题陈述
关于阿尔茨海默病 (AD) 及相关痴呆症 (ADRD) 的流行病学研究和遗传学研究经常依赖于电子病历 (EMR) 中的国际疾病分类 (ICD) 代码来识别病例。然而,在退伍军人事务部 (VA) 医疗系统中识别 ADRD 面临特定挑战,包括非特异性痴呆症代码的广泛使用,以及初始诊断倾向于发生在初级保健而非专科门诊。此外,退伍军人可能会在 VA 系统之外接受护理,这可能导致数据缺口和选择性偏差(针对仅使用 VA-EMR 的研究)。虽然疾病管理与医疗保险数据 (CMS) 为捕捉这些外部就诊情况提供了潜在解决方案,但整合 CMS 数据对诊断算法性能(特别是敏感性、特异性和遗传有效性)的影响仍是一个悬而未决的问题。

方法论
作者利用来自 VA 百万退伍军人计划 (MVP) 数据(一个拥有超过一百万名登记退伍军人的大型生物样本库)的多维度评估进行了研究。

  • 算法评估: 研究基准测试了九种不同的 AD/ADRD 算法:四种 MVP 衍生算法(从严格的 AD 到广泛的痴呆症)、两种慢性疾病仓库 (CCW) 算法、两种 PheCode 算法以及一种基于药物的算法。这些算法分别在仅使用 VA EMR 数据和使用 VA EMR 结合 CMS 数据(包括 Medicare/Medicaid 索赔和就诊记录)的情况下进行了测试。
  • 图表审查验证: 对 203 名参与者的合并队列(100 名新审查对象加 103 名来自先前研究的对象)进行了图表审查。医疗记录经过脱敏处理,由两名独立审查员使用“银标准”分类系统(针对 AD 和全因痴呆症进行“疑似”、“可能”或“极不可能”的分类)进行审查。通过讨论达成共识。根据这些人工分类计算性能指标(敏感性、特异性、阳性预测值 [PPV]、阴性预测值 [NPV])。
  • 遗传学验证: 为了评估病例定义的生物学有效性,作者检查了在大规模 MVP 队列(限制为欧洲血统,n ≈ 396,000)中,算法衍生的病例集与两种遗传标记之间的关联:APOE ε4 等位基因(晚发型 AD 最强的遗传风险因子)和排除 APOE 区域的 AD 多基因风险评分 (PRS)。使用逻辑回归模型计算优势比 (OR) 和 Z 分数。

核心贡献

  1. CMS 数据整合: 本研究严谨地评估了添加 CMS 数据如何改变 VA EMR 痴呆症算法的性能。
  2. 算法优化: 作者更新了其 MVP 衍生算法,以反映 ICD 代码使用的变化,并将其与既有的 CCW 和 PheCode 标准进行了比较。
  3. 遗传学基准测试: 通过将算法性能与 APOE ε4 和 PRS 的关联性进行关联,本研究提供了一种评估病例集关于晚发型 AD “纯度”的方法,从而区分了哪些算法捕捉的是真正的 AD 病例,哪些捕捉的是更广泛、特异性较低的痴呆表型。

结果

  • 病例产量与敏感性: 添加 CMS 数据显著增加了所有算法检测到的病例数,对于严格的 AD 算法,这种增加往往使计数翻倍(例如,MVP-AD 从约 11,345 增加到约 22,537)。因此,敏感性和阴性预测值 (NPV) 得到了提升。
  • 特异性与预测值: 病例产量的增加也带来了权衡。添加 CMS 数据后,特异性和阳性预测值 (PPV) 下降。
  • 遗传关联:
    • 严格 AD 算法: 当仅使用 VA 数据时,严格的 AD 算法(MVP-AD, Phe-AD)产生了最高的 APOE ε4 优势比 (OR ≈ 2.40–2.41),表明其包含高比例的真实晚发型 AD 病例。然而,在这些严格算法中加入 CMS 数据后,OR 值降低(至 ≈ 1.95–1.97),这表明新增病例中包含的真实 AD 比例较低。
    • 广泛 ADRD 算法: 较广泛的算法(MVP-ADRD, Phe-Dementia)显示出较强的遗传关联,但整体 OR 值较低。有趣的是,仅使用 VA 数据的广泛算法与使用 VA 加 CMS 数据的严格算法的表现相当。
    • 药物数据: 纳入 AD 药物数据通常增加了样本量,但与 CMS 数据类似,对于严格的 AD 算法,这类数据往往会降低 OR 值。
    • 年龄切点: 应用年龄切点(65+)统一提高了所有算法的遗传关联显著性和 OR 值估计。

意义与主张
论文得出结论,算法和数据源的选择很大程度上取决于研究的具体目标:

  • 对于遗传学发现研究: 为了最大化真实晚发型 AD 病例的比例(如较高的 OR 值所示),作者建议使用仅基于 VA EMR 数据的严格 AD 算法。如果 CMS 数据可用且必要,作者建议使用补充了 CMS 和药物数据的严格 AD 算法(MVP-AD, CCW-AD 或 Phe-AD),尽管这会导致 OR 值略低于仅使用 VA 的严格算法。
  • 对于流行病学研究: 对于优先考虑敏感性和病例捕获(例如监测疾病率)的研究,作者建议使用基于 VA EMR 数据本身的广泛 ADRD 算法(MVP-ADRD 或 Phe-Dementia)。他们指出,在广泛算法中添加 CMS 数据并不会显著提高性能,反而可能稀释表型。
  • 通用最佳实践: 研究强调需要要求使用多个 ICD 代码来界定一个病例,并在适当处整合药物数据,以及应用年龄切点(≥60 或 ≥65)以聚焦于晚发型疾病。

作者强调,ICD 编码实践在不同机构和数据源(VA 与 CMS)之间存在差异。因此,包含 CMS 数据从根本上改变了病例集的构成,使其变得更像“ADRD 型”而非纯粹的“AD 型”。因此,研究人员必须在各自特定的 EMR 系统内评估算法性能,而不是假设其具有统一的适用性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →