Sample size and power calculations for causal inference of observational studies
本文通过分解方差为三个组成部分并引入两个关键参数——用于协变量重叠的 Bhattacharyya 系数和基于 R 平方值的混杂敏感性参数——建立了一个理论框架,提供了观察性因果推断中样本量与功效计算的解析公式,并辅以一个新的 R 语言包和在线计算器予以支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图弄清楚一种新药是否真的有效。在科学的理想世界里,你会进行一项随机对照试验(RCT)。这就像为每位患者抛一枚硬币:正面,他们服用药物;反面,他们服用糖丸。由于抛硬币是随机的,两组患者在治疗开始前在所有方面都是相同的。如果服药组病情好转,你就知道是药物的作用,而非其他因素。
但如果无法抛硬币呢?也许这样做不道德、成本太高,或者在后勤上不可行。这时你就必须使用观察性数据。这就像查看医院的记录,其中一些患者碰巧服用了药物,而另一些则没有。问题在于:那些服用药物的人,起初可能病情更重、更富有或年龄更大。这些差异被称为混杂因素。它们搅浑了水,使得难以判断药物是否有效,还是患者原本的起点就不同。
本文是为那些必须处理这些混乱、现实世界记录的侦探们编写的一本指南。它回答了一个关键问题:“我需要查看多少份患者记录,才能确信自己没有自欺欺人?”
以下是他们解决方案的分解,使用了简单的类比:
1. 旧地图的问题
此前,研究人员试图通过假装混乱的观察性数据是完美的抛硬币实验,来计算他们需要的记录数量。他们使用了专为随机试验设计的标准公式。
- 缺陷:这就像试图用为高速公路设计的地图来穿越沼泽。这会导致灾难。你最终可能认为只需要 100 条记录,但由于数据如此“嘈杂”(存在混杂),你实际上需要 1,000 条。你开展研究,一无所获,然后意识到你观察的人数不够。
2. 新公式:三种要素
作者开发了一个更准确的新公式。他们意识到,要弄清楚观察性数据中的“噪音”,你并不需要(在研究开始前)掌握每位患者的每一个细节。你只需要理解三个特定的方面:
倾向得分分布(“可能性”地图):
- 是什么:基于个人特征,一个人接受治疗的概率有多大?
- 类比:想象一张地图,显示房间中“治疗”一侧相对于“对照”一侧的拥挤程度。如果两组截然不同(例如,只有年轻人接受治疗,只有老年人不接受),这张地图就会非常不均衡。这被称为重叠度差。
- 本文的技巧:他们使用一个特殊的数字,称为Bhattacharyya 系数(我们称之为**“重叠得分”**),来衡量两组有多相似。如果得分高,说明两组相似(好);如果得分低,说明两组差异很大(差)。
潜在结果分布(“自然变异”):
- 是什么:患者结果的自然变异程度有多大?
- 类比:即使没有药物,有些患者康复得快,有些则慢。这只是自然的随机性。
相关性(“混杂强度”):
- 是什么:患者的特征在多大程度上能同时预测接受治疗和治疗结果?
- 类比:这是“秘密链接”。如果生病让你更有可能接受药物,同时又让你更不可能康复,这种链接就会产生巨大的噪音。作者提出了一个“敏感性参数”(我们称之为**“混杂系数”)来衡量这种链接的强度。他们建议你可以使用一个名为R 平方**的标准统计量(衡量数据对结果的预测能力)来估算这一点。
3. “神奇”的结果
本文最大的突破表明,你不需要水晶球来预测未来的数据。在随机试验使用的标准数字基础上,你只需要两个额外的数字(重叠得分和混杂系数)。
- 如果重叠度好(组别看起来相似)且混杂弱,你需要的记录就更少。
- 如果重叠度差(组别完全不同)或混杂强,为了获得同等程度的确定性,你需要多得多的记录。
4. “安全网”方法
作者围绕一种特定的统计工具——Hájek 逆概率加权估计量——构建了他们的公式。
- 类比:把这看作一种“保守”策略。就像打包一个比必要稍重的降落伞。它可能不是最轻、最快的飞行方式,但它能保证你不会坠落。
- 他们选择这种方法是因为它不需要你事先猜测数据分布的确切形状。如果你猜错了数据形状,其他方法可能会失败,但这种“重型降落伞”方法仍会给你一个安全、保守的答案(意味着你计算出的所需人数可能略多于严格必要的数量,但不会导致人数过少)。
5. 现实世界测试
作者使用以下数据测试了他们的公式:
- 伪造数据:他们创建了数百万名具有不同“混乱”程度(重叠)和“混杂”程度的虚拟患者。他们的公式一致地预测出了发现真实效应所需的正确人数。
- 真实数据:他们使用了一个关于心脏导管插入术(一种医疗程序)的著名数据集。他们表明,如果使用旧的“随机试验”方法,你会认为需要约 1,500 名患者。但他们的新方法正确计算出需要约 3,600 名。使用旧方法会导致研究严重缺乏效力(很可能错过真相)。
总结
本文提供了一台观察性研究的计算器。它告诉研究人员:“不要只是猜测你需要多少记录。测量你的组别有多相似(重叠),以及隐藏链接有多强(混杂)。将这两个数字输入我们的新公式,你就会确切知道你的研究需要多大规模,以避免浪费时间和金钱。”
他们甚至构建了一个免费的软件工具(一个 R 包和一个在线计算器),以便任何人都可以使用这种新方法,而无需自己进行复杂的数学运算。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。