← 最新论文
📊 statistics

Weighted Extensions of the Kolmogorov-Smirnov, Cramer-von Mises, and Anderson-Darling Tests for Assessing Covariate Balance

本文将 Kolmogorov-Smirnov、Cramer-von Mises 和 Anderson-Darling 检验扩展到适用于因果推断中协变量平衡评估的加权数据,并通过模拟实验证明这些加权版本能够维持有效的第一类错误控制,并保持其各自针对不同差异类型的统计功效优势,同时推荐将 Anderson-Darling 检验作为一种稳健的通用默认方法。

原作者: Ariel Linden

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ariel Linden

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探:一种新药到底真的起作用了,还是仅仅因为患者原本就比较健康?在科学领域,这被称为“因果推断”。为了确保万无一失,你需要比较两组人群:接受治疗的人和未接受治疗的人。如果这两组人完美匹配——就像身高、体重和年龄都相同的双胞胎一样——那么之后健康的任何差异都可以归功于药物。但在现实生活中,我们并不总能进行那种可以随机分配人员的完美实验。相反,科学家经常使用一种聪明的技巧,叫做“加权”。把它想象成杂货店里的电子秤。如果“治疗组”里有太多重的人,而“对照组”里有太多轻的人,科学家就会给每个人分配一个“权重”。一个在重组里很轻的人会获得一个很大的权重(就像一个沉重的配重块)来平衡天平,而一个在轻组里很重的人则会获得一个极小的权重。这种做法在数学上强制让两组看起来是平衡的。

但这里有一个棘手之处:仅仅因为“平均”重量看起来相同,并不意味着两组是真正完全一致的。想象两个装满弹珠的袋子。一个袋子里有十个1磅重的弹珠。另一个袋子里有五个1磅重的弹珠和五个2磅重的弹珠。如果你只看平均值,它们看起来可能很相似,但重量的“分布”是完全不同的。科学家需要检查整个数据的形状是否匹配,而不只是平均值。多年来,他们一直拥有检查这些工具的方法,但当你尝试将这些工具用于这些“加权”后的弹珠袋时,这些工具就失效了。它们无法处理这些数字化的计数器权重。这篇论文正是关于修复这些工具,使它们即使在数据经过权重调整后也能完美运行。

本文介绍了三个经典的“平衡性检验”的升级版本,它们可以处理这些加权数据。由 Ariel Linden 领导的作者们采用了三种著名的统计方法——柯尔莫哥洛夫-斯米尔诺夫检验 (KS)、安德森-达林检验 (AD) 和 克拉默-冯·米塞斯检验 (CVM) ——并教会了它们如何读取权重。他们不仅仅是在靠猜测,而是构建了一种全新的、通用的“洗牌”方法。想象你有一副扑克牌,其中一些牌上面贴着沉重的贴纸。与其试图弄清楚为什么会有这些贴纸,不如直接通过重新洗牌标签(谁属于哪一组)的方法,同时保持卡牌本身及其贴纸的位置不变。通过进行成千上万次的这种操作,他们可以观察到所看到的差异是真实的,还是仅仅是偶然的巧合。

研究人员通过大规模计算机模拟测试了这些新工具。他们创建了四种不同的场景来观察工具的表现。首先,他们检查了当两组实际上完全一致时,工具是否会产生误报(第一类错误)。结果非常出色:所有三种工具都非常接近 5% 的正确误差率,这意味着当没有狼出现时,它们不会虚报狼来了。

然后,他们针对两组之间三种不同类型的“不匹配”情况测试了工具:

  1. 中心不匹配: 想象两组在各处都完全相同,唯独在正中间不同,就像两群人,其中一群人的中间部分都穿着红衬衫,而另一群人穿着蓝衬衫。在这种情况下,柯尔莫哥洛夫-斯米尔诺夫 (KS) 检验是明显的赢家。它就像一个只寻找单一最大差距的侦探;它比其他任何人都更快地发现了中间的不匹配。
  2. 尾部不匹配: 想象两组在中间部分是相同的,但“极端”的人(非常高或非常矮的人)是不同的。这就像一组里有几个巨人,而另一组里有几个侏儒。在这种情况下,安德森-达林 (AD) 检验表现得极其出色。它就像一个特别关注房间边缘的侦探。KS 检验几乎察觉不到这个问题。
  3. 弥散性不匹配: 想象两组在各处都有轻微的不同,比如一组整体上比另一组稍微高一点。在这种情况下,AD 和 CVM 检验都表现得非常好,且表现几乎持平,而 KS 检验则显得落后。

论文还研究了当“权重”本身非常混乱且变化很大(模拟现实世界中某些人获得巨大权重而其他人获得极小权重的真实数据)时会发生什么。即便在这种混乱状态下,这些工具依然能够应对。AD 检验仍然是识别尾部问题的最佳工具,而 KS 检验仍然是识别中心问题的最佳工具。

那么,对于科学家来说,结论是什么呢?如果你怀疑组间差异出现在正中间,请使用 KS 检验。如果你担心极端情况(尾部),AD 检验是你最好的帮手。如果你不确定差异可能出现在哪里,或者你认为差异是遍布各处的,那么 AD 检验是一个安全、可靠的“默认”选择,它在几乎所有情况下都表现良好,且往往优于其他工具。作者甚至将这些工具内置到了软件命令中(用于程序 Stata),以便其他研究人员可以立即使用。

简而言之,这篇论文不仅发明了新工具,还修复了那些无法处理现实科学产生的混乱加权数据的旧工具。它证实了虽然没有任何一种工具能完美胜任所有工作,但安德森-达林检验是检查两组是否真正平衡的最全能“全才”,尤其是当你担心极端情况时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →