← 最新论文
💻 computer science

A Comprehensive Evaluation of Distributional Shift and Concept Drift Across Preprocessing Configurations, Domain Adaptation, and Representation Learning in GDM Prediction

本研究表明,尽管对多种预处理策略、经典机器学习模型、领域自适应技术以及对比深度学习框架进行了广泛的实验,但在基于单一群体队列训练的妊娠期糖尿病(GDM)预测模型,由于条件关系 P(YX)P(Y \mid X) 存在严重的概念漂移,在跨临床场景应用时普遍失效,且仅当训练数据同时包含源群体和目标群体时,其性能才能得以恢复。

原作者: Sinda Besrour, Ghazal Rouhafzay, Latifa Saidi

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Sinda Besrour, Ghazal Rouhafzay, Latifa Saidi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

怀孕是生物学剧烈变化的时期,对于许多女性来说,这也带来了妊娠期糖尿病的风险,这是一种血糖水平升至危险高度的疾病。如果任其发展,这可能导致母亲和胎儿出现严重的并发症。为了及早发现这一情况,医生通常依赖一种特定的血液检测,即口服葡萄糖耐量试验,该试验涉及饮用一种含糖溶液并观察身体的反应。然而,这种测试既耗时又需要专门的设备,使得在每个诊所或资源有限的地区使用变得十分困难。因此,研究人员多年来一直试图构建能够仅利用年龄、体重和血压等简单、常规信息来预测谁会患上这种疾病的计算机程序。人们希望这些数字工具可以作为一种快速的早期预警系统,在患者需要进行复杂的糖类测试之前,就标记出高风险患者。

然而,挑战在于,这些计算机程序在它们构建时的医院表现得近乎完美,但一旦转移到不同的诊所,就会表现得一败涂地。这是因为不同医院的人群并不完全相同;他们有不同的年龄、体型和健康史。当一个针对某组人群训练的模型应用于另一组人群时,它所学习到的潜在模式就会崩溃。这不仅仅是模型偏差了一点点的问题,而是数据行为发生的根本性转变。研究人员称之为“概念漂移”(concept drift),即风险因素与疾病之间的关系在不同地点发生了变化。例如,在某个城市能强烈预测糖尿病的一个因素,在另一个城市可能完全没有预测能力,甚至可能产生相反的效果。

蒙克顿大学(Université de Moncton)的一个研究小组着手调查了为什么这些模型在跨越不同人群时会失效。他们想知道问题究竟是模型不够先进,还是问题根植于数据本身。为了找到答案,他们收集了两组大规模的患者记录:一组来自拥有超过3,500名女性的原始来源,另一组则是来自完全不同地区的、由1,200多名女性组成的独立群体。随后,他们进行了一场大规模实验,测试了几十种不同的数据准备方法和五种不同类型的机器学习模型。他们还尝试了旨在迫使模型适应新人群的高级技术,甚至测试了一种现代深度学习方法,该方法试图以更抽象的方式学习数据的“形状”。

结果是显著且一致的。当模型在训练数据上进行测试时,表现近乎完美,几乎正确识别了所有的妊娠期糖尿病病例。但一旦将它们应用于这组新的、独立的女性群体时,它们的性能便彻底崩塌。模型表现出的准确率极低,几乎仅仅比随机猜测好一点点。无论模型的复杂度如何,无论数据清洗得多么精细,或者研究人员是否尝试使用特殊的数学技巧来对齐两个群体,这种失败都会发生。即使是通常擅长寻找隐藏模式的最先进深度学习系统,也遭遇了同样的全面失败。模型唯一在第二组人群中表现良好的情况,是研究人员在训练前将两组数据混合在一起。这证明了模型并非因为过于简单而无法完成任务,而是由于它们在没有看到目标群体样本之前,根本无法学会这项任务。

研究人员发现,主要罪魁祸首是数据中的一个特定特征:口服葡萄糖耐量试验的结果。在第一组女性中,这项测试是预测该疾病最强大的单一指标。计算机模型学会了过度依赖它。然而,在第二组女性中,这项测试与疾病之间的关系发生了剧烈的变化,以至于该测试在预测方面几乎变得毫无用处。由于模型如此依赖这一项信息,它们的整个逻辑体系在遇到新群体时便瓦解了。当研究人员将这项测试从数据中完全移除后,模型在新环境下的表现略有提升,尽管仍然面临困难。这表明,如果一个模型想要在不同医院之间通用,它必须在训练时不依赖于那个在不同人群之间差异巨大的特定诊断测试。

关于处理缺失信息的另一个关键发现也值得关注。在医疗记录中,数据往往是不完整的;例如,一名患者可能有血压记录,但没有体重记录。研究团队测试了三种不同的填补缺失值的方法。他们发现,那种利用不同变量之间的关系来推测缺失值的最复杂方法,在跨组移动时表现最为稳健。而那些仅仅填入平均值的简单方法,则会破坏数据点之间脆弱的联系,使模型变得不再可靠。这凸显了数据准备方式与模型本身同样重要。

研究还揭示了关于修复这些问题的先进技术的意外转折。有一种流行的方法试图在数学上对齐两个群体的统计特性,但它实际上对大多数模型产生了负面影响。它提升了一个特定类型模型的性能,却降低了其他模型的性能。这表明,仅仅试图通过数学手段强行让两个不同的群体在统计上看起来相似,并不是一个万能的解决方案。事实上,对于那些依赖特定阈值做出决策的模型来说,这种对齐以一种让模型更加困惑的方式扭曲了数据。

最终,这项工作指向了一个明确的结论:阻碍这些预测工具在不同诊所之间使用的障碍,并不是缺乏计算能力或巧妙的算法。障碍在于数据本身。风险因素与疾病之间的关系并非固定不变,它会随着研究对象的改变而发生偏移。研究人员发现,如果你希望一个模型在新的地方发挥作用,你不能仅仅依靠旧数据并寄希望于它能自动适应。你必须在训练过程中包含新人群的数据,或者至少利用少量的新数据对模型进行重新校准。在此之前,作为一种筛查工具,最可靠的方法是避免使用那个会导致最大程度混乱的特定诊断测试,转而依赖那些在不同群体间保持一致的、更稳定的基础健康指标。这项研究提醒我们,在医疗人工智能的世界里,一个在某个房间里表现完美的模型,在下一个房间里可能会完全失明;而唯一的看清真相的方法,就是向你试图帮助的人群学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →