技术摘要:学习在治疗数据缺失时的治疗对象
问题定义
本文研究了在存在预算约束(κ)且部分人群的治疗分配数据(A)缺失的情况下,如何学习最优治疗分配策略(d:X→{0,1})。其目标是通过识别具有最高条件平均治疗效应(CATE)的个体,即 τ(X)=E[Y(1)−Y(0)∣X],来最大化期望效用 V(d)=E[Y(d(X))]。
标准的策略学习方法假设数据是完整的。然而,在观测性研究中(例如医疗保健、社会服务),由于记录不完整、测量误差或数据集成问题,治疗分配数据经常缺失。本文区分了两种缺失机制:
- 完全随机缺失 (MCCAR): 缺失情况(R=0)仅取决于观测到的协变量 X。形式化地,满足 R⊥⊥(A,Y)∣X。
- *随机缺失 (MAR): 缺失情况取决于观测到的协变量 X 和观测到的结果 Y。形式化地,满足 R⊥⊥A∣(X,Y)。
在 MCCAR 下,标准的完全病例分析(丢弃治疗数据缺失的样本)是有效的,但可能效率低下。在 MAR 下,完全病例分析会产生偏差,因为缺失机制与结果相关,这违反了“给定协变量时缺失情况与潜在结果独立”的假设。本文将讨论范围限制在这两种情形中,排除了缺失取决于未观测因素的非随机缺失(MNAR)场景。
方法论
作者扩展了最初为 MAR 条件下平均治疗效应(ATE)估计而开发的有效影响函数(IF)方法,将其应用于策略价值估计和 CATE 估计问题。
1. 识别策略
本文提出了两种基于缺失性假设的识别策略:
- 策略一(基于 MAR): 在 MCCAR 和 MAR 下均有效。它通过对观测到的结果进行重加权来利用所有可用数据(包括部分观测的样本)。策略价值识别为:
V(d)=E[γd(X)βd(X)]
其中 βd(X)=E[Yλd(X,Y)∣X] 且 γd(X)=E[λd(X,Y)∣X]。这里 λd(X,Y)=P(A=d(X)∣X,Y,R=1) 是以结果为条件的倾向得分,而 π(X,Y)=P(R=1∣X,Y) 是观测到治疗的概率。
- 策略二(基于 MCCAR): 仅在 MCCAR 下有效。它是一个使用仅包含观测到治疗的样本的完全病例估计量:
V(d)=E[νd(X)]
其中 νd(X)=E[Y∣X,A=d(X),R=1]。
2. 有效估计量
作者利用影响函数(IF)推导出了偏差修正的双重稳健(doubly robust)估计量,以达到半参数有效性界限。
- MCCAR 估计量 (Φ^MCCAR): 基于影响函数 ϕMCCAR,它依赖于扰动函数 ηd(X)=P(A=d(X),R=1∣X) 和 νd(X)。如果 η^d 或 ν^d 被正确设定,则该估计量是一致的。
- MAR 估计量 (Ψ^MAR): 基于影响函数 ϕMAR,它利用了全样本。它需要对扰动函数 π(X,Y)、λd(X,Y)、βd(X) 以及 γd(X) 进行一致估计。至关重要的是,它除了需要 λd 或 π 的一致估计外,还需要一致估计 γd(即不以结果为条件的倾向得分)。
3. 策略学习 (CATE 估计)
为了学习最优策略,作者采用了 DR-Learner 框架。他们构建了基于治疗(A=1)与对照(A=0)的 MAR 或 MCCAR 价值函数估计器之间的差异的伪结果(pseudo-outcomes):
- ϕ~MAR=ϕ^MAR(1)−ϕ^MAR(0)
- ϕ~MCCAR=ϕ^MCCAR(1)−ϕ^MCCAR(0)
这些伪结果通过通用的机器学习方法(如随机森林)对协变量 X 进行回归,以估计 τ(X)。随后,最优策略定义为:在满足预算约束确定的阈值之上,对个体进行治疗。
主要贡献
- 有效估计器的扩展: 作者将有效影响函数方法从 ATE 估计扩展到了两种假设(MAR 和 MCCAR)下的策略价值估计和 CATE 估计。
- 理论效率证明: 本文证明了只要两者都有效(即在 MCCAR 假设下),MAR 估计量在渐近意义上比 MCCAR(完全病例)估计量更有效。这为优先选择 MAR 方法提供了正式的理论依据,因为 MAR 估计量通过利用部分观测的单位来降低方差。
- 对误设定的鲁棒性: 所提出的估计量具有双重稳健特性。在 λd(结果模型)或 π(缺失模型)其中之一被正确设定且 γd(倾向得分)被一致估计的前提下,MAR 估计量保持一致。
- 实证验证: 在合成及半合成数据集(Voting 和 STAR)上的全面实验表明,正确设定缺失机制至关重要。无论样本量多大,误设定的估计量都会产生偏差,而所提出的 MAR 估计量在假设满足时能达到接近 Oracle 的性能。
结果
- 合成实验:
- 收敛性: 在 MAR 设置中,即使样本量很大,MCCAR 估计量也会表现出持续的偏差,而 MAR 估计量则收敛于 Oracle。在 MCCAR 设置中,两种估计量都是无偏的,但 MAR 估计量实现了更快的收敛速率。
- 鲁棒性: MAR 估计量对倾向得分或缺失机制的误设定具有鲁棒性,但不能同时误设两者。
- 效率增益: 理论分析和模拟确认,当增强倾向得分、缺失率以及两者之间的相关性增加时,MAR 估计量相对于 MCCAR 估计量的渐近相对效率(ARE)也会随之增加。
- 半合成实验:
- 使用带有人工诱导缺失的真实世界数据(Voting 和 STAR),在 MAR 设置下,MAR 估计器(DR-MAR)的表现一致优于完全病例法和其他基准方法(IPW、Outcome Regression、MTRNET),特别是在治疗数据严重受限(仅观测到 10-30%)的情况下。
- 在 MCCAR 设置下,大多数方法表现相似,但 MAR 方法仍保持竞争力。
- 结果强调,当缺失情况取决于结果时,丢弃不完整观测(完全病例分析)会导致次优策略。
意义与主张
本文认为,即使在完全病例假设(MCCAR)成立时,完全病例分析也不是效率最高的选择。 作者声称,MAR 估计器在理论上更优,因为它们:
- 通过利用部分观测的单位,实现了更低的渐近方差。
- 需要更少的识别假设(因为 MCCAR 是 MAR 的一个特例)。
- 提供了一个稳健的非参数化策略学习框架,避免了在缺失情况依赖于结果时产生的偏差。
作者得出结论,在实践中,由于缺失机制往往具有不确定性,默认采用基于 MAR 的估计是一种审慎的策略。在 MAR 假设下使用 MCCAR 估计器会导致持续偏差,而在 MCCAR 假设下使用 MAR 估计器则会获得更高的效率。这种不对称性强化了采用基于 MAR 的方法进行稳健策略学习的建议。