Real-world performance of large-scale propensity score adjustment strategies: Matching, weighting, and stratification
本研究评估了跨四个国家级医疗数据库的大规模倾向评分调整策略,并得出结论:采用 Crump 修剪的逆概率加权法与 1:1 匹配通常表现最佳,尽管没有哪种单一策略是普遍优越的,因此有必要使用诊断工具和经验校准来指导选择。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图弄清楚一种新药(我们称之为“药物 A”)是否比一种旧药(“药物 B”)在治疗高血压方面效果更好的侦探。在一个理想的世界里,你会进行一项随机临床试验,通过抛硬币来决定谁服用哪种药物。这能确保两组人在除了服用的药物之外,在所有方面都是完全相同的。
但在现实世界中,我们并不总是能抛硬币。我们必须查看现有的医疗记录。问题在于,选择药物 A 的人可能与选择药物 B 的人截然不同。也许服用药物 A 的人年龄更大、病情更重,或者拥有不同的保险。如果你只是直接比较结果,你可能会误以为是药物起到了作用(或失效了),而实际上是患者本身的差异导致了结果。这被称为混杂因素(Confounding)。
为了解决这个问题,研究人员使用了一种叫做**倾向评分(Propensity Score, PS)**的统计工具。你可以把倾向评分看作是一个“相似度得分”。它计算了一个特定患者基于其数百种特征(年龄、病史、其他药物等)选择药物 A 而非药物 B 的概率。
核心问题:我们如何使用这个分数?
一旦我们有了这些分数,我们需要决定如何进行比较。论文测试了三种主要的方法,就像三种不同的整理凌乱房间的方式:
- 匹配法(寻找双胞胎): 你找出一个服用了药物 A 的患者,然后在药物 B 组中找到一个具有完全相同相似度得分的“双胞胎”。你将他们配对。论文测试了 1 对 1、1 对 5 甚至 1 对 25 的配对方式。
- 分层法(分类箱): 与其配对个人,不如根据他们的得分将所有人放入 5 个(或 25 个)“箱子”中。处于“箱子 1”中的人选择药物 A 的概率很低,而处于“箱子 5”中的人选择药物 A 的概率很高。然后你在每个箱子内部比较药物的效果。
- 加权法(天平调重): 保留所有人,但给他们不同的“权重”。如果一个患者非常罕见(例如,一个在几乎所有人都服用药物 B 的情况下却选择了药物 A 的年轻人),你会给他们很重的权重,使他们的资料更有分量。如果一个人很常见,他们的权重就会较轻。论文测试了处理那些会“压坏天平”的极端权重的不同方法。
实验:“SPARTA”计划
作者们(来自加州大学洛杉矶分校、强生公司等)并没有仅仅靠猜测哪种方法最好。他们建立了一个庞大的测试场,名为 SPARTA。
- 规模: 他们查看了分布在四个国家级医疗数据库中的 1100 万名患者。
- 测试: 他们针对 24 种不同的药物组合进行了 3,840 次不同的比较。
- “虚假”结果: 为了知道这些方法是否真的有效,他们使用了 160 个“负对照”结果。这些是药物不应该影响的事物(例如骨折或某种特定类型的过敏)。如果某种方法显示药物 A 会导致骨折,那么这种方法就是有问题的(存在偏差)。如果它显示药物 A 对骨折没有影响,那么这种方法就是有效的。
他们的发现
在进行了数千次测试后,以下是简单易懂的“底线”结论:
1. 没有单一的“万能灵药”
并不存在一种在所有情况下都胜出的完美方法。这取决于具体的数据和所比较的特定药物。
2. 顶尖竞争者
两种策略脱颖而出,成为了最可靠的“默认”选择:
- 1 对 1 匹配: 为每位患者寻找一个完美的双胞胎。这种方法非常精确,并且很好地平衡了两组数据。
- 带有“Crump 修剪”的 IPTW: 这是一种特定类型的加权法,他们在加权之前会切掉那些最极端的、奇怪的案例(即那些与其他人完全不同的人)。它的表现几乎与匹配法一样好。
3. “不要这样做”清单
- Stürmer 修剪: 这种特定的切除极端案例的方法表现很差。它移除了太多实际上是可以进行比较的人,导致两组之间失去了平衡。
- 分层法(分类箱): 虽然它保留了所有数据,但由于同一个箱子里的人并不真的是“双胞胎”,所以往往会在箱子内部留下一些“残余偏差”(不公平性)。
4. “校准”秘诀
最令人惊讶的发现是关于**经验校准(Empirical Calibration)**的。
想象一下,你正在使用一把稍微弯曲的尺子。你可以尝试修复这把尺子,或者你也可以仅仅测量它弯曲了多少,然后调整你的最终数值来进行补偿。
论文发现,如果你使用一个统计“校准”步骤(利用那些虚假的结果来观察你的方法产生了多少漂移),所有不同的方法表现都会变得几乎相同。 它们之间的差异会缩小,结果也会变得更加可靠。
给研究人员的启示
如果你是一名试图在现实世界中比较治疗方法的研究人员:
- 不要只依赖一种方法。 如果你认为 1 对 1 匹配是最好的,也要尝试使用 Crump 修剪法作为“敏感性检查”,看看你的结果是否依然成立。
- 检查你的平衡性。 确保在你应用方法之后,你正在比较的两组看起来确实是相似的。
- 使用校准。 它就像一个安全网。它有助于修复错误,并使你的结果不太受你选择的具体方法的影响。
简而言之,虽然 1 对 1 匹配 和 Crump 修剪加权法 是强大的起点,但确保你的研究值得信赖的最佳方法是使用多种策略,并根据已知事实来“校准”你的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。