Weighted k-Sample Kolmogorov-Smirnov, Cramer-von Mises, and Anderson-Darling Tests for Assessing Covariate Balance
本文将加权 Kolmogorov-Smirnov、Cramer-von Mises 和 Anderson-Darling 检验扩展到评估任意数量组别(k ≥ 2)之间的协变量平衡,证明了虽然综合检验效能会随着组别增加而降低,但随后的事后两两比较程序仍然是检测特定不平衡的灵敏工具,且所有方法均已在 Stata 中实现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜题的侦探,试图找出真正的凶手是谁。在科学世界中,特别是当研究人员试图弄清楚一种新药或一项新政策是否真的有效时,他们也在玩类似的比赛。他们将接受治疗的一组人与未接受治疗的一组人进行比较。但问题在于,为了让这种比较公平,这两组人必须在所有重要的方面都像双胞胎一样——年龄相同、健康史相同、习惯相同。如果他们不是双胞胎,那么结果就会变成一团混乱。这被称为检查“协变量平衡”(covariate balance)。
通常,科学家只会检查平均年龄或平均收入是否相同。但平均值可能会具有欺骗性。想象一下两个组,两者的平均年龄都是30岁。在一组中,每个人都正好是30岁;而在另一组中,一半是10岁,一半是50岁。虽然平均值匹配,但这两组完全不同!为了捕捉这些狡猾的差异,科学家们使用特殊的“分布检验”(distributional tests)。你可以把它们想象成高科技扫描仪,它们不仅观察人群的平均身高,还会扫描整个人群的形状,以查看这些组是否真的是完全相同的。长期以来,这些扫描仪只能在同时比较两组数据时发挥作用。但如果你有三组、四组或更多组需要比较呢?这正是这篇论文要解决的谜题。
这篇由 Ariel Linden 撰写的论文介绍了一种新方法,利用三种著名的统计扫描仪——Kolmogorov–Smirnov、Anderson–Darling 和 Cramér–von Mises 检验——来同时比较任意数量(两组或更多)的组,即使是在数据经过加权(例如给予某些人更高的重要性)的情况下也是如此。作者还添加了一个聪明的“事后”(post-hoc)工具,它就像一个放大镜,如果大扫描显示有问题,它能帮助你精准定位到底是哪一组出现了差异。
以下是他们发现的故事。首先,作者构建了这些新的多组扫描仪,并在一个虚拟世界中通过计算机模拟测试了它们。他们创建了数千个包含三组数据的虚构场景,以观察这些扫描仪是否会犯错。好消息是:这些扫描仪非常诚实。当各组实际上是完全一致时,扫描仪很少发出“误报”,其错误率保持在应有的水平(约5%)。
然而,模拟实验揭示了一个令人惊讶的转折。当科学家比较三组而不是两组时,那个大型“综合”(omnibus)扫描仪(即同时检查所有组的扫描仪)的灵敏度会略微下降。要在两个正常的组中发现一个隐藏其中的奇怪组,变得更加困难了。作者解释说,这并不是因为那个奇怪的组变得更奇怪了,而是因为扫描仪必须观察更多的组,这使得它所预期的“正常”范围变得更宽了。这就像是在安静的房间里听耳语,与在嘈ùng的体育场里听耳语的区别:耳语本身是一样的,但体育场的背景噪音使得它更难被检测到。
正因如此,论文建议了一种聪明的策略:如果你怀疑某一个特定的组有所不同,不要仅仅依赖于那个大组扫描,而是使用新的“事后”工具进行两两比较。这个成对比较(pairwise)工具不会受到额外组别带来的“噪音”影响,并且在捕捉特定嫌疑人方面表现得更好。
论文还证实了这三种不同的扫描仪仍然拥有各自的“超能力”,就像它们在比较两组数据时一样。Kolmogorov–KS 检验最擅长发现数据中间部分的差异(比如如果一组人的身高都比其他人稍高一点)。Anderson–Darling 检验是捕捉边缘或“尾部”差异的冠军(比如如果其中一组人包含了一些极其病重的患者,而其他组则没有)。Cramér–von Mises 检验则是一个全能选手,在差异分布在各处时,其表现与 Anderson–Darling 相似。
为了展示这在现实世界中是如何运作的,作者将这些方法应用于一项心力衰竭疾病管理计划的数据。他们共有三组:未加入的人、接受电话随访的人以及接受远程监测的人。在进行数据调整之前,扫描仪发出警报,显示这些组之间存在巨大差异。但在应用了特殊的加权方法使之平衡后,扫描仪表示:“一切正常!”这些组现在在统计学上成了“双胞胎”。
简而言之,这篇论文为科学家提供了一个全新的工具包,用于公平地比较多个组。它警告说,同时检查所有组可能会漏掉单个异类,但它同时也提供了一个特定的后续工具来寻找那个异类。它证实了不同的检验在处理不同类型的差异时各有优势,并证明了即使在数据复杂且经过加权的情况下,这些方法依然行之有效。作者基于其模拟实验对这些发现充满信心,尽管他也指出,未来的工作可以探索更加复杂的组别设置。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。