Examining the Efficacy of Coarsened Exact Matching as an Alternative to Propensity Score Matching
本文认为,粗糙精确匹配(CEM)并非倾向评分匹配(PSM)的优越替代方案,因为 CEM 因其非精确性而存在残余混杂问题,在考虑随机变异时未能表现出优于 PSM 的降失衡效果,且在高维设定下会变得不稳定且低效,而 PSM 则对模型设定错误保持更强的稳健性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图弄清楚一种新药是否有效。衡量标准是随机临床试验(RCT),即通过抛硬币来决定谁服用药物,谁服用安慰剂。因为是随机的,两组人群是完美平衡的:服用药物的人在平均水平上与未服药的人一样健康、年长且富有。
但在现实世界中,我们通常无法抛硬币(因为成本太高或不符合伦理)。因此,我们会观察观测数据(如医院记录)。在这里,“药物组”最初可能比“对照组”更重症或更年长。这被称为混杂因素(Confounding)。为了解决这个问题,统计学家使用“匹配”技术,将药物组中的病患与对照组中相似的病患进行配对,试图重现那种完美的硬币投掷般的平衡。
长期以来,标准的工具一直是倾向评分匹配(PSM)。近年来,一种被称为**粗糙精确匹配(CEM)**的新工具变得非常流行。许多研究人员声称 CEM 是 PSM 的“升级版”。
费伊·万(Fei Wan)撰写的这篇论文指出,CEM 其实并没有大家想象中那么神。 事实上,在许多情况下,PSM 才是更好、更可靠的工具。
以下是原因的详细拆解,使用了简单的类比:
1. “模糊照片” vs. “模糊快照”
观点: CEM 常被称为“精确匹配”,但它其实是“模糊匹配”。
- 类比: 想象你正在根据身高来匹配人。
- PSM 就像是为每个人的身高拍一张高分辨率的照片,然后找到与目标身高最接近的人。即使他们并不完全一样高,但数学确保了如果你观察整个群体,平均身高是完美平衡的。任何微小的差异都只是随机噪声(就像照片中轻微的模糊),当样本量足够大时,这些差异会相互抵消。
- CEM 就像是将所有人放入不同的桶中:“矮”、“中”、“高”。然后你匹配那些处于同一个桶里的人。
- 问题所在: 在“中等”这个桶里,你可能会有一个 5 英尺 6 英寸的人和一个 5 英尺 10 英寸的人。他们在同一个桶里,但他们其实差别很大。这产生了一种系统性误差(残余混杂),这种误差无论你增加多少研究样本都无法消除。这就像仅仅因为他们都在“水果篮”里,就试图比较苹果和橘子一样。
2. 复杂性的“钢丝绳”
观点: 当变量过多时(即“维度诅咒”),CEM 会崩溃。
- 类比: 想象你正试图根据 10 种不同的特征(身高、体重、眼睛颜色、鞋码、最喜欢的披萨等)为一个人寻找完美的双胞胎。
- CEM 试图基于所有
10 个特征同时将每个人放入盒子中。随着你增加特征,这些盒子会变得极其具体,以至于大多数盒子最后都是空的。你会丢失大量数据(那些不符合任何盒子里的人),导致你的结果变得不稳定且不可靠。这就像是在干草堆里找针,但干草堆一直在缩小,直到最后什么都不剩。
* PSM 则不会直接在所有 10 个特征上进行匹配。相反,它计算出一个单一的“评分”(所有 10 个特征的汇总),并根据这个评分来匹配人群。这避免了“空盒子”问题,并保持了数据的稳定性,即使在处理许多变量时也是如此。
3. “猜谜游戏”(模型依赖性)
观点: CEM 迫使你在后期对数据做出完美的猜测,而 PSM 则更为宽容。
- 类比:
- CEM 就像一个拼图游戏,你通过打磨(粗糙化)拼图块使其能够契合。因为你打磨过,这些碎片不再能完美契合了。为了得到正确的图像,你现在必须使用一个非常复杂且完美的公式来“修复”这些缝隙。如果你的公式哪怕只有一点点错误,整个图像就会毁于一旦。
- PSM 就像是一个拼图,碎片自然地契合在一起。即使你使用一个简单、略有瑕疵的公式来看待结果,图像看起来仍然大致正确,因为碎片本身就是平衡的。PSM 是“稳健的(Robust)”,这意味着即使你在数学上犯了小错,它也不会轻易崩溃。
4. “尺子”问题
观点: 之前的研究认为 PSM 在平衡群体方面表现不佳,是因为它们使用了错误的测量工具。
- 类比: 一些研究人员声称 PSM 失败是因为他们使用的尺子只测量了人与人之间的“距离”,而忽略了“方向”。
- 作者认为,在 PSM 中,如果一个人稍微高一点,而另一个人稍微矮一点,这些随机差异会相互抵消。
- 旧的测量工具(如马哈拉诺比斯距离)将这些随机的起伏视为不断扩大的“误差”。
- 作者提出了一个新的测量方法(标准化均值差异),它考虑了这些随机的起伏。当使用这个新尺子时,PSM 在平衡群体方面的表现看起来比 CEM 要好得多。
核心结论
论文得出结论:CEM 并不是灵丹妙药。
- 如果你只有少量变量,CEM 或许可以应付,但它仍有隐藏的缺陷。
- 如果你有许多变量(这在现实世界的数据中很常见),CEM 会导致你丢失过多数据,并引入难以修复的系统性误差。
- PSM 仍然是更稳健、更可靠的选择,因为它能更好地处理随机性,不需要完美的数学逻辑就能获得良好的结果,而且不会丢弃过多的数据。
作者警告说,许多医生和研究人员一直以为 CEM 是那个“精确”的解决方案,但它实际上是一个“不精确”的捷径,如果不极其谨慎地处理,可能会导致偏差的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。