Auditing missingness and input-outcome circularity in unsupervised clinical phenotyping: an empirical case study in hospitalized traumatic brain injury
这项关于住院创伤性脑损伤的实证案例研究表明,使用常规量表数据进行的无监督临床表型分析对缺失值处理高度敏感,且容易出现输入与结局之间的循环论证问题,这敦促研究人员在为衍生亚型赋予临床意义之前,应对这些方法论选择进行严格审计。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正试图将一堆乱七八糟的神秘盒子根据内部物品进行整齐的分组。在医学领域,科学家们经常对患者数据进行这样的操作,这个过程被称为“无监督表型分析”(unsupervised phenotyping)。与其靠猜测哪些患者相似,不如利用计算机去发现隐藏在常规检查评分中的模式,比如患者的记忆力、情绪状态或行动能力的强弱。其目标是发现自然的“亚群组”,以便医生能够提供更精准、更个性化的护理。
然而,有两个阴险的陷阱可能会毁掉这项侦探工作。首先,数据很少是完美的;有些盒子缺少标签或内容物(这被称为“缺失数据”)。如果你只是盲目猜测缺失的部分,你可能会无意中创造出一些仅因你的猜测而存在的群体,而非因为患者本身存在差异。其次,有一个被称为“循环论证”(circularity)的陷阱。如果使用某个特定的线索来对盒子进行分类,然后又对“同一个线索正是导致这些盒子产生差异的主要原因”感到惊讶,这就发生了循环论证。这就像是按颜色给一副扑克牌分类,然后声称你发现了一个神奇的新规则,即“红色的牌是红色的”。
一组研究人员决定测试这些侦探方法在应用于现实世界医院记录(针对创伤性脑损伤患者)时表现如何。他们想看看计算机发现的患者群体是真实的、稳定的且有用的,还是仅仅由缺失数字和循环逻辑构建起来的空中楼阁。
伟大的患者分类实验
研究人员调查了 582 名因脑损伤住院的患者。他们为每位患者准备了五份不同的“成绩单”:记忆力和思维测试(MMSE 和 MoCA)、抑郁测试(GDS 和 Hamilton)以及日常生活能力测试(Barthel ADL,用于评估进食、穿衣等日常任务的能力)。
在一个理想的世界里,每位患者都应该拥有所有五项测试的得分。但在繁忙医院的残酷现实中,数据会丢失。在这项研究中,只有 17.7% 的患者(582 人中的 103 人)拥有完整的五项评分。抑郁测试和日常生活能力测试是最容易缺失的,缺失率分别接近 40% 和 30%。
团队运行了一个标准的计算机程序来对这些患者进行分组。该程序使用了一种名为“中位数填补法”(median imputation,即用现有数据的中间值来填补空白)的方法,并判定对所有人进行分类的最佳方式是将他们分为五个不同的组。其中一个组看起来特别引人注目:一个具有极高汉密尔顿抑郁评分的“汉密尔顿极端”组。
但随后,研究人员开始了他们的“压力测试”,以观察这些群体是否真实存在。
稳定性测试:这些群体能保持稳定吗?
他们尝试通过反复随机抽取患者来“摇晃”数据(这种技术称为自助法/bootstrapping)。如果这些群体是真实的,那么每次抽样时,相同的患者应该始终落在相同的组别中。然而,这些群体却像沙堡一样崩塌了。稳定性得分非常低(在 0.211 到 0.454 之间),远低于判定“是的,这是一个稳固群体”所需的 0.75 阈值。当他们尝试不同的分类算法时,结果也几乎无法达成一致。
缺失数据测试:填补空白的方法重要吗?
接下来,他们尝试使用一种更复杂的名为“多重填补法”(MICE)的方法来填充缺失的评分——该方法会创建 20 个带有不同猜测数值的数据集版本。当他们在 20 个版本上运行分类程序时,生成的组别与原始的五个组别几乎完全不同。一致性得分仅为微小的 0.157。这表明,最初的五个组别并非是对患者本质特征的发现,而是反映了研究人员选择填补空白的方式。
“完整病例”测试:如果我们只看完美的数据会怎样?
他们尝试仅对那 103 名拥有全部评分的患者进行分类。这样做时,计算机不再想要五个组,而是更倾向于三个组。原始数据集中看起来非常重要的“汉密尔顿极端”组消失了,或者发生了彻底改变。事实上,在这一较小的群体中,抑郁程度高的患者反而拥有更好的记忆评分,这与原始分析的结论截然相反。研究人员得出结论,这个特定的“抑郁”组很可能是一个人工制品(artifact)——即一个由处理缺失数据的方式所制造出来的虚假模式。
循环论证陷阱:我们是否把结果当作了输入?
最后,他们测试了“循环论证”问题。在原始分析中,他们使用了“日常生活能力”评分(Barthel ADL)来辅助对患者进行分类,然后检查这些组别在预测“日常生活能力”评分方面的表现。不出所料,这些组别的表现非常出色!统计学上的联系非常紧密。
但是,当他们将“日常生活能力”评分从分类过程中完全移除,仅使用思维和情绪测试进行分类时,情况发生了变化。当他们再次尝试利用这些新组别来预测“日常生活能力”评分时,这种联系消失了。统计得分从强劲的 0.395 骤降至微小的 0.005。这证明了他们原本认为发现的“强有力联系”并非因为这些群体在功能上天然不同,而仅仅是因为他们曾使用功能评分来构建这些组别。这是一个典型的案例:对着镜子看,却以为自己发现了一张新面孔。
总结
研究结论指出,虽然无监督表型分析听起来是寻找患者新亚型的强大工具,但它其实极其脆弱。在这次针对创伤性脑损伤的具体案例中,计算机发现的“组别”对缺失数据的处理方式高度敏感,并且在很大程度上是由于将结果作为输入而产生的幻觉。
研究人员建议,在医生开始利用这些计算机生成的组别进行临床决策之前,科学家必须进行严格的审计。他们需要检查:当进行数据重采样时,这些组别是否保持稳定;它们在面对不同的缺失数据填补方式时是否依然存在;最重要的是,他们必须确保自己没有在无意中利用“结果”来定义“组别”。在完成这些检查之前,从常规医院数据中发现的所谓“亚型”应当被视为有待研究的有趣假设,而非既定的事实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。