Nested cross-validation reduces optimism in metabolomics-based prediction of immune checkpoint inhibitor outcomes
本研究表明,在开发基于代谢组学的免疫检查点抑制剂疗效预测模型时,嵌套交叉验证显著降低了乐观偏差,并比单次拆分留出法或非嵌套交叉验证提供了更可靠的性能评估。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解谜团的侦探:为什么有些癌症患者对一种被称为免疫检查点抑制剂(ICI)的新型药物反应极好,而另一些人却不行?这些药物就像是为人体自身的警察部队(免疫系统)进行超级充电,让它们去猎杀癌细胞。但警察部队并不总是能准时到岗,我们需要一种方法来预测谁能得到这种帮助。科学家们开始观察在我们血液中漂浮的微小化学信使——代谢物,它们可以作为线索。这个领域被称为代谢组学。这就像是通过观察蚂蚁在风暴前的行为来预测天气一样。问题在于,这些化学线索非常杂乱,数量多达数千种,而且我们能够研究的患者数量通常很少。当你试图在这一小堆杂乱的线索中寻找规律时,非常容易误导自己,让你以为发现了一个完美的模式,而实际上你发现的只是一个巧合。这就是“过度乐观”在科学中的危险所在。
这篇论文本质上是一个关于我们如何检验侦探工作的警示故事。研究人员想要看看我们测试预测模型的方式是否让我们误以为模型比实际表现得更好。他们比较了三种不同的测试方法:一种简单的“留出法”(holdout test,即将数据一次性分为练习组和测试组)、一种“非嵌套”交叉验证(non-nested cross-validation,即通过打乱数据进行测试,但无意中让测试组的线索影响了如何挑选线索),以及一种“嵌套”交叉验证(nested cross-validation,一种更严格、更谨慎的方法,直到最后才完全隐藏测试用的线索)。
这项研究分析了六组在患者开始治疗前采集的血样,以及十组在治疗开始后采集的血样,并使用高科技机器测量了化学物质。他们将预测模型通过了这三种不同的测试方法。结果是一个警钟。当使用“非嵌套”方法时,模型看起来像个摇滚明星,对于治疗前样本的平均得分(称为 ROC-AUC)达到了 0.882。但当他们使用更严格的“嵌套”方法时,得分降到了更为平庸的 0.705。这是一个巨大的差异!这就像一个学生因为偷看了答案而在模拟考试中拿了 A+,但在答案被隐藏后的正式考试中只拿了 C。非嵌套方法平均高估了模型的表现近 0.18 分。
研究人员发现,这种虚假成功的罪魁祸首在于计算机挑选最重要化学线索的那一步。如果让计算机使用与它用来评分的相同数据来挑选最佳线索,它就会产生混乱,把随机噪声误认为是真实的信号。“嵌套”方法通过强制要求计算机在看到测试数据之前,先在另一组独立的数据集上挑选线索,从而解决了这个问题。有趣的是,“留出法”(简单的拆分法)对得分的过高估计程度不如非嵌套方法那么严重,但它非常不稳定,给出的答案范围很宽,就像一把摇晃的尺子。而嵌套方法则给出了一个更紧凑、更可靠的范围。
研究团队还观察了在治疗前还是治疗后进行测试是否重要。答案是:这取决于特定的患者群体。在某些癌症类型中,治疗前的血样是最好的预测指标;而在另一些癌症中,治疗开始后的血样则表现更好。并没有一个适用于所有人的“神奇时间点”。
最后,团队在另一种类型的机器(NMR 而不是通常使用的质谱仪)上对黑色素瘤患者进行了测试,同样的模式依然成立:严格的嵌套方法给出了一个更现实、更低的得分,而不是那些较宽松的方法。作者总结道,对于这类旨在寻找癌症治疗生物标志物的微型研究,我们必须使用严格的“嵌套”方法。如果我们不这样做,我们可能会对一个“完美”的预测器感到兴奋,而那个预测器其实只是由我们自身的测试错误所制造出来的海市蜃楼。虽然这目前还没有提供一个现成的医疗检测手段,但它为这场游戏制定了正确的规则,这样当我们真正发现一个生物标志物时,我们可以信任它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。