← 最新论文
📈 economics

Don't Drop the Singletons: Efficient Inference for Pairwise Experiments with Independent Attrition

本文表明,通过利用一种特定的置换检验以及一种能有效结合组内与组间比较的最优加权估计量,研究人员可以在具有独立流失情况的双人随机实验中保持统计功效并避免丢弃数据,且所有这些都可以通过标准的加权固定效应回归来实现。

原作者: Simon Heß, Patrick W. Schmidt

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Simon Heß, Patrick W. Schmidt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在科学实验的世界里,研究人员经常面临着精准度与实用性之间的艰难抉择。为了探究一种新疗法是否有效,科学家们经常使用一种叫做“随机化”的方法,即通过随机分配的方式将参与者分为治疗组或对照组。其中一个流行且强大的版本涉及将非常相似的参与者配对——例如收入相近的邻居或考试成绩相似的学生——然后随机将治疗分配给其中的一人,另一人则作为对照。这种“成对”方法就像是为每一个受试者都建立了一个内置的对照,这通常比仅仅比较两个大型混合组的结果更加精准且可靠。然而,现实世界研究中一个持久的问题是“流失率”:即参与者在实验结束前退出。当这种情况发生时,一对参与者可能会失去其中一员,导致另一人变成孤立的个体。多年来,标准的建议是丢弃这些“孤儿”单数个体,只分析那些完整的配对。其逻辑在于,如果没有了搭档,数据就太杂乱而无法使用。然而,这种做法意味着研究人员正在丢弃宝贵的信息,实际上缩小了他们的研究规模,并增加了检测真实效应的难度。

两位研究人员,西蒙·赫斯(Simon Heß)和帕特里克·W·施密特(Patrick W. Schmidt),对这一长期存在的规则提出了挑战。他们认为,只要人们退出的原因与他们接受的治疗无关,那么担心使用不完整的配对数据就是多虑的。在他们的新工作中,他们证明了保留每一个观测值(即使是孤独的个体)仍然可以获得高度准确的结果是可行的。他们开发了一种新的数据分析方法,既尊重原始的配对结构,又能智能地结合完整配对与不完整配对的信息。该方法不再丢弃单数个体,而是将它们视为拼图中有用的碎片,并根据它们提供的信息量进行适当的加权。通过这种方式,他们展示了研究人员可以在不承受因数据流失导致的统计惩罚的情况下,保持配对设计的极高精准度。

他们发现的核心是一个类似于“智能过滤器”的具体检验程序。当一项研究失去一名参与者时,传统方法会直接从分析中删除整个配对,实际上是假装那个人从未存在过。作者指出,这样做会浪费大量的证据。他们的新方法使用了名为“随机推断”的技术,该技术依赖于在每个配对内部通过“抛硬币”决定治疗分配的事实。他们创建了一个检验统计量,该统计量观察完整配对之间的结果差异,以及单数个体之间的结果差异,然后将这两个信息源融合在一起。这种融合是经过数学精密计算的:完整的配对提供了两个相似人之间的直接比较,因此被赋予更高的权重;而单数个体提供了整个群体的广泛比较,因此被赋予较小但仍具有显著意义的权重。这种结合使得研究能够利用所有剩余的数据点,从而实现检测真实效应的能力最大化。

为了证明其有效性,研究人员进行了广泛的模拟和理论计算。他们将自己的新方法与目前科学家处理该问题的两种标准方法进行了对比。第一种标准方法是“配对t检验”,它遵循丢弃不完整配对的旧规则。第二种是“双样本t检验”,它忽略了配对关系,仅仅是将所有治疗组的人的平均值与所有对照组的人的平均值进行比较。作者发现,他们的新方法始终优于两者。在匹配质量较高(即配对非常紧密)的情景下,一旦出现人员流失,旧的配对方法会损失大量的效能。而完全忽略配对的方法则往往过于保守,无法发现实际存在的效应。然而,他们的新方法在各种流失水平和匹配质量下都表现卓越,实现了对两者的全面超越。

研究人员还回应了一个常见的担忧,即这种新方法在实践中是否过于复杂。他们展示了复杂的加权和检验可以通过一种名为“加权回归”的标准统计工具来完成,这种工具在几乎所有的常用软件程序中都有提供。研究人员只需告诉软件包含所有数据,为单数个体分配特定的权重,并包含完整配对的固定效应即可。这使得这种强大的新方法变得触手可及,任何人只要能进行基础分析就能使用它,消除了对专门定制代码的需求。作者强调,当流失是由于与治疗无关的原因(如搬迁或失去兴趣)而非因为治疗导致感觉不适时,该方案效果最佳。如果流失与治疗本身相关,问题会变得更加困难,但在绝大多数流失是随机发生的案例中,这种新方法提供了一条清晰的前进路径。

在最后的检查中,作者将他们优化的配对设计与另一种在预期会有流失时常被推荐的策略进行了对比:即使用更大的组别而非配对,例如四人一组。其理念是,在四人组中,如果一人离开,仍有三人留下,从而保留了更多的群体结构。研究人员模拟了这种情景,并发现即使使用更大的组别,他们针对配对进行的优化方法依然表现出色。在许多情况下,紧密配对所带来的效率提升,结合他们使用所有可用数据的分析方法,足以战胜更大的组别。这表明,研究人员不需要仅仅因为担心流失而放弃配对设计。相反,他们可以坚持使用更精准的配对策略,并仅仅应用这种新的分析技术,以确保不浪费他们辛勤收集到的任何数据。

这项工作对任何开展研究的人来说,其意义都是显而易见的。它消除了在保持紧凑高效的设计与应对数据流失之间的权衡。通过拒绝丢弃单数个体,并将其以适当的权重编织进分析中,研究人员可以保持研究的强大效能和结论的稳健性。该论文提供了一个实用的工具包,将一个潜在的弱点——失去参与者——转化为一个可控的过程,确保最终结果反映的是实验的完整范畴,而非仅仅是幸存者的情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →