Quantifying the Optimism of Naive Cross-Validation for Binary Outcome Prediction with Repeated-Measures Predictors: A Simulation Study and Clinical Illustration
本研究表明,将观测层面的交叉验证应用于具有二元结果的重复测量数据会显著高估预测性能,而受试者层面的划分则能有效消除这种乐观偏差的主要来源,并与严格的留一集群验证保持高度一致。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在医学研究领域,科学家们经常构建模型来预测患者是否会发展出某种特定的疾病,例如早产儿是否会患上严重的眼部疾病。为了了解这些模型的优劣,研究人员使用一种被称为“交叉验证”的标准测试方法。想象你有一副代表患者数据的扑克牌,你想看看你的模型是否能猜中它从未见过的牌。通常的做法是将牌洗匀,分出一部分作为“训练集”来教导模型,并留出一部分作为单独的“测试集”来检查它的工作成果。这个过程会重复多次,每次都以不同的方式洗牌,以获得模型表现能力的可靠平均值。当这副牌中的每一张牌都是独特且独立的(就像不同人的单一快照)时,这种方法运作得非常完美。
然而,许多现代医学研究处理的并非单一快照。相反,它们收集来自同一个人在一段时间内的连续数据流,例如医院记录的数周内每日氧饱和度水平。在这种情况下,数据点并不是独立的;一个婴儿在周二的氧饱和度水平与他在周一的水平密切相关。当研究人员对这种类型的数据应用标准的洗牌方法时,他们往往会犯一个微妙但至关重要的错误。他们可能会将同一个婴儿周二的部分数据放入训练集,而将该婴儿周三的数据放入测试集。因为模型已经见过周二的数据,它可以轻易地猜出周三的数据,这并不是因为它学习到了关于疾病的一般规律,而仅仅是因为它记住了那个特定婴儿的模式。这产生了一种虚假的信心,使模型看起来比实际表现要好得多。
贝勒医学院的研究员约瑟夫·哈根(Joseph Hagan)致力于精确测量这种错误会在多大程度上夸大医学预测模型的评分。他专注于一个常见的新生儿护理场景:利用每日氧气测量值来预测早产儿是否会患上早产儿视网膜病变(一种严重的眼部疾病)。为此,他首先研究了来自101名婴儿的真实数据,追踪他们的每日氧气水平以及是否患病。接着,他构建了一个计算机模拟系统,生成了数千个虚拟数据集,并仔细控制了变量,例如研究中的婴儿数量、每日测量值之间的关联强度以及疾病的发生率。通过这种方式,他可以将“标准”方法(即对单个每日记录进行洗牌)与“正确”的方法(即保留每个婴儿的所有数据在一起,确保模型仅在从未见过的婴儿身上进行测试)进行对比。
结果是触目惊心的。当研究人员对这101名婴儿的真实数据使用标准方法时,模型表现出极高的区分病患与健康婴儿的能力,得分在0.5(代表仅比抛硬币好)到1.0的量表上达到了0.686。然而,当他们使用尊重患者分组的正确方法时,得分降至0.608。这0.078分的差距看似微小,但在医学预测领域,这正是“模型看起来有用”与“模型几乎没有实际价值”之间的区别。在模拟实验中,问题更加严重。平均而言,标准方法高估了模型表现0.213分。在最坏的情况下——即研究中的患者极少且每日数据具有高度可预测性时——标准方法声称得分为0.932,暗示接近完美的准确度,而其对新患者的真实预测能力仅为0.569,仅比随机猜测好一点点。
研究还揭示,这种高估伴随着一种欺骗性的“增益”:标准方法会让结果看起来极其精确。因为模型本质上是在训练阶段和测试阶段使用了同一个患者的部分数据,所以不同测试运行之间的得分几乎完全相同,从而创造出一个非常窄且紧凑的结果范围,看起来非常稳定。然而,这种稳定性是一种幻觉。当研究人员切换到正确的方法时,得分的变化幅度要大得多,反映了模型表现的真实不确定性。这种“精确度幻觉”是危险的,因为它会让研究人员误以为他们的模型很稳健,而实际上它却很脆弱且存在偏差。
哈根的工作识别了造成这种误差的两个截然不同的来源。第一个是“泄漏”成分,它直接由模型在训练集和测试集中看到了同一个患者的部分数据所导致。当患者之间更加相似且每日测量值高度相关时,这种泄漏会变得更大。第二个成分是一个较小的、不可避免的差距,即使在进行正确测试时也会存在,原因仅仅在于研究中的患者样本量不足以完美捕捉疾病的复杂性。虽然正确的测试方法完全消除了泄漏,但它无法消除由样本量过小导致的差距。不过,研究证实,正确的测试方法(即将一名患者的所有数据保留在一起)能使估计的表现非常接近真实表现,尤其是在患者数量增加的情况下。
论文总结道,对于任何涉及同一个体重复测量数据的研究,标准的拆分数据方法在根本上是有缺陷的。解决方案并非发明一种新的、复杂的算法,而仅仅是改变划分数据的方式。研究人员必须将每位患者视为一个单一单元,确保如果一名患者某一天的记录被用于训练,那么该患者的其他任何日期的记录都绝不能出现在测试集中。这种被称为“受试者层面划分”(subject-level partitioning)的方法对于获得诚实的结果至关重要。如果不这样做,基于连续监测数据构建的医学模型可能会看起来像是突破,而实际上它们只是在记忆过去,这可能会导致关于它们能否帮助未来患者的错误结论。这项研究发出了一个明确的警告:在连续健康监测时代,我们测试预测结果的方式必须随之进化,以匹配我们收集数据的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。