Identification of complier and noncomplier average causal effects in the presence of latent missing-at-random (LMAR) outcomes: a unifying view and choices of assumptions
本文通过证明在存在潜在随机缺失结果的情况下,除了处理分配无关性和潜在缺失性外,通常还需要关于缺失机制和主成分识别的两个额外假设,提供了一个用于识别顺从者和非顺从者平均因果效应的统一框架,同时也提出了对现有假设的修正,并利用真实世界数据阐明了该方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图弄清楚一个新的志愿服务项目是否真的让人们感到更加充实。你有一组报名参加的人(实验组)和一组没有参加的人(对照组)。
但你的实验面临两个大问题:
- “懒汉”问题(不依从性): 实验组中并不是所有人真的去做了志愿服务。有些人出现了并努力工作(“顺从者”),而有些人虽然报名了但几乎没怎么做(“不依从者”)。在对照组中,没有人被要求去从事志愿服务,所以你无法得知如果他们被要求去做,谁会是一个努力的工作者。
- “幽灵”问题(数据缺失): 一些人退出了研究,或者忘记填写最后的幸福感调查问卷。他们的结果丢失了。
这篇论文是关于如何解决这个数学谜题,即在同时面对“懒汉”和“幽灵”时,如何计算出项目的真实效应。
两种类型的人(潜在分层)
作者根据人们在被要求时会如何表现,将人分为两个隐形的群体:
- 顺从者(Compliers): 被要求时会去做工作的人。
- 不依从者(Noncompliers): 即使被要求了也不会去做工作的人。
我们可以通过观察实验组来识别谁是谁(因为他们实际做了或没做);但在对照组中,由于没有人被要求去做,所有人看起来都一样。这使得计算针对“顺从者”的特定效应(CACE)和针对“不依从者”的效应(NACE)变得非常困难。
“幽灵”问题:为什么缺失数据如此棘手
通常,统计学家假设缺失数据是随机的(就像抛硬币一样)。但在这里,作者假设了一种更复杂的情况,称为 LMAR(潜在随机缺失)。
可以这样理解:
- 在实验组中,缺失数据可能是随机的。
- 在对照组中,缺失数据可能取决于你原本会是顺从者还是不依从者。
- 例子: 也许“顺从者”(天生更有责任感的人)更有可能填写调查问卷,而“不依从者”(参与度较低的人)则更有可能弄丢调查问卷。
因为我们在对照组中看不出谁是顺从者,所以我们无法判断这些缺失的问卷是否扭曲了我们的结果。
重大突破:“两套配方”的谜题
作者意识到,试图解决这个问题就像是在不知道两种关键原料的情况下尝试烤蛋糕。他们证明了数学问题可以归结为两个相互关联的方程(或配方),它们紧紧粘在一起:
- “响应配方”: 这试图找出对照组中谁缺失了调查问卷。(缺失的人主要是顺从者还是不依从者?)
- “结果配方”: 这试图找出那些缺失的人原本会得到多少分。
问题在于,你必须先解开“响应配方”,才能解开“结果配方”,但两者是纠缠在一起的。
解决方案:一个灵活的模板
论文提出了一个统一的模板(一个灵活的工具包)来解开这些配方。作者说,你需要做出两个独立的抉择来解开这个谜题:
抉择 1:“潜在识别”假设
这是你关于程序对“懒汉”(不依从者)如何起作用的猜测。
- 选项 A(排他性约束): “该项目对那些不做工作的人没有任何影响。”(如果你不去从事志愿服务,那么该项目对你不起作用)。
- 选项 B(潜在可忽略性): “如果我们观察背景相似的人,‘懒汉’和‘努力工作者’在对照组中的幸福感得分将会是相同的。”
抉择 2:“缺失性”假设
这是你对调查问卷为何缺失的猜测。
- 选项 A(稳定响应): “对照组中人员流失的比例与实验组相同。”(例如,如果在实验组中 20% 的努力工作者退出了,我们假设对照组中也是 20% 的人退出)。
- 选项 B(响应可忽略性): “在对照组中,‘懒汉’和‘努力工作者’填写调查问卷的可能性是相等的。”
神奇之处:
作者发现,如果你在两个抉择中都选择 选项 B(潜在可忽略性 + 响应可忽略性),那么“幽灵”问题就会完全消失。缺失的数据变得简单且随机,你不再需要对缺失的人进行额外的猜测!
对旧规则的警告
论文还发现了一些旧有的数学规则(称为“稳定响应”)存在缺陷。有时,这些旧规则会导致不可能的数学答案,比如得出“20% 的人缺失了”这样的结论,但数学上其实暗示着“-5% 的人缺失了”(这是不可能的)。
为了修复这个问题,作者提出了一个 “近稳定”(Near-Stable) 版本。它就像一个安全护栏:如果数学计算试图给出不可能的答案,这个规则会温柔地将其推回最近的可能数值(比如 0% 或 100%),而不是让整个计算崩溃。
现实世界测试
作者利用 巴尔的摩经验团(Baltimore Experience Corps,一个真实的资深志愿者在学校开展的项目)的数据测试了他们的新模板。他们使用不同的“抉择 1”和“抉择 2”组合运行了数据。
他们的发现是:
- 结果会根据他们选择了哪些假设而改变(这是预料之中的)。
- 然而,当他们使用“潜在可忽略性”假设时,结果非常稳定,且不需要对缺失数据进行额外猜测。
- 他们证实了新的“近稳定”规则确实防止了旧方法中出现的那些不可能的数学错误。
总结
这篇论文为研究人员提供了一张在缺失数据和不依从性的混乱世界中航行的灵活地图。研究人员不再受限于单一的僵化规则,而是可以混合搭配不同的假设,以观察其结果的稳健性。最重要的是,他们发现了一种特殊的假设组合,可以让缺失数据的难题消失,并且他们修复了旧数学工具中的安全隐患。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。