技术摘要:面向非单调缺失下通用插补的高效推断
1. 问题陈述
本文解决了在非单调缺失 (也称为块状缺失)存在下的参数估计与推断挑战。在这种设定下,不同的观测单元会观察到变量(模态)的任意非嵌套子集,这在现代多组学研究、电子健康记录和大型调查中十分常见。
标准方法面临两个主要局限:
完全病例分析(Complete-case analysis) 会丢弃数据不全的单元,这可能浪费大量信息并降低效率。
直接插补 (用替代值填充缺失值)通常难以保持有效的统计不确定性量化或效率,特别是在插补模型存在误设或偏差时。
目标是在保持对通用插补函数 (可能存在误设)以及 随机缺失(MCAR) 机制下的有效性的同时,结合所有观测模式的信息,以实现半参数高效性。本文还探讨了向 随机缺失(MAR) 的扩展。
2. 方法论
2.1 理论框架
作者在半参数理论框架下定义该问题。令 Z Z Z 为全数据向量,θ ∗ \theta^* θ ∗ 为由全数据估计方程 E P [ ψ F ( Z , θ ∗ ) ] = 0 E_P[\psi_F(Z, \theta^*)] = 0 E P [ ψ F ( Z , θ ∗ )] = 0 定义的目标参数。在 MCAR 假设下,半参数高效估计函数由 ψ o p t = L { M − 1 [ ψ F ] } \psi_{opt} = L\{M^{-1}[\psi_F]\} ψ o pt = L { M − 1 [ ψ F ]} 给出,其中 M M M 和 L L L 是由特定模式的条件期望构建的线性算子。然而,逆算子 M − 1 M^{-1} M − 1 涉及跨模式的复杂条件期望复合,使得高效估计量在通常情况下难以计算。
2.2 RAY 分解
为了克服 M − 1 M^{-1} M − 1 的不可计算性,作者引入了受限方差分析层次结构(Restricted ANOVA hierarchY, RAY) 。
函数分解: RAY 利用受限于观测模式集合 Q \mathcal{Q} Q 的包含排斥原理,将任何函数 f f f 分解为一系列层次组件 P s ( f ) P_s(f) P s ( f ) 。
近似特征结构: 在 MCAR 下,算子 M M M 对这些组件 P s ( f ) P_s(f) P s ( f ) 的作用表现为一种“近似特征算子”:M [ P s ( f ) ] = λ s P s ( f ) + Rem s ( f ) M[P_s(f)] = \lambda_s P_s(f) + \text{Rem}_s(f) M [ P s ( f )] = λ s P s ( f ) + Rem s ( f ) ,其中 λ s = P ( R ⊇ s ) \lambda_s = P(R \supseteq s) λ s = P ( R ⊇ s ) 是观测到至少包含集合 s s s 中所有模态的概率。剩余项 Rem s \text{Rem}_s Rem s 涉及非嵌套模式间的条件期望复合。
闭式近似: 通过忽略剩余项(在特定结构条件下这些项趋于零)和跨模式复合,作者推导出了一个易于处理且具有闭式形式的 M − 1 M^{-1} M − 1 近似。由此得到了 RAY 估计函数 : ψ ( R , Z R , θ ∗ ) = I ( R = [ p ] ) π [ p ] ψ F ( Z , θ ∗ ) + ∑ r ∈ Q , r ≠ [ p ] ω r A r [ ψ F ( Z , θ ∗ ) ] \psi(R, Z_R, \theta^*) = \frac{I(R=[p])}{\pi_{[p]}} \psi_F(Z, \theta^*) + \sum_{r \in \mathcal{Q}, r \neq [p]} \omega_r A_r[\psi_F(Z, \theta^*)] ψ ( R , Z R , θ ∗ ) = π [ p ] I ( R = [ p ]) ψ F ( Z , θ ∗ ) + r ∈ Q , r = [ p ] ∑ ω r A r [ ψ F ( Z , θ ∗ )] 其中 ω r \omega_r ω r 是由模式概率导出的闭式权重。
2.3 估计量构建与调优
通用插补: 项 A r [ ψ F ] A_r[\psi_F] A r [ ψ F ] 代表给定观测模式 r r r 时估计函数的条件期望。在实践中,这被替换为插补函数 F r ( Z r ; θ ) F_r(Z_r; \theta) F r ( Z r ; θ ) ,它可以是预测模型(如神经网络)或蒙特卡洛近似。至关重要的是,在 MCAR 下,RAY 权重是均值为零且独立于插补函数的,这确保了即使插补模型存在误设,估计量依然保持无偏性 。
保障调优(Safeguard Tuning): 为了提高效率,作者为每个插补函数引入了调优参数 α r \alpha_r α r 。该估计量通过求解样本校准方程来解决问题,其中权重经过调整以最小化估计方差准则。
自适应 RAY (aRAY): 意识到无论是 RAY 还是现有的插补驱动推断(IPI)方法都无法在所有情况下占据优势,作者提出了一类更广泛的估计量,将两者都包含在内。自适应 RAY (aRAY) 估计量通过优化该类中的调优参数,以实现最小渐近方差。
2.4 向 MAR 的扩展
本文研究了将 RAY 扩展到 MAR 场景的方法。
直接扩展: 虽然存在与 MCAR 权重类似的直接对应物,但它通常依赖于未观测到的模态,这使得作为观测数据估计量的可行性较低。
投影扩展: 通过将尾部倾向(tail propensities)投影到观测到的模态上,可以构建一个可行的估计量。然而,这引入了一个“投影尾部倾向”的干扰项。作者指出,估计该干扰项会对目标方程产生一阶贡献。如果该干扰项允许使用堆叠估计(stacked estimation)进行 N \sqrt{N} N 一致的参数估计,则可以进行正则推断。
3. 核心贡献
闭式高效近似: 本文为任意非单调缺失模式下的 MCAR 情况提供了一个闭式、可计算的半参数高效估计量的近似,避免了需要迭代或嵌套回归的精确逆算子。
插补鲁棒的有效性: 所提出的 RAY 估计量对于任意独立的插补函数 都是有效的,包括误设或有偏的模型。由于 MCAR 下权重的均值为零特性,其有效性得到了保证。
自适应效率: 引入的自适应 RAY (aRAY) 估计量将 RAY 和 IPI 嵌入到一个更大的类中,从而能够在该类中达到最小渐近方差。
精确性条件与效率界限:
作者建立了 RAY 达到效率下界的充要条件:即每种模式的残差必须为零。
他们确定了可验证的充分条件,包括:(i) 观测模式是交集封闭且模态相互独立的;(ii) 单调模式且具有任意依赖关系;(iii) 锚定模式(anchored patterns)且非核心模态条件独立。
当这些条件失效时,效率差距由两个可解释的因子界定:相关因子 (由重叠模式间的私有模态依赖性驱动)和结构因子 (由缺失所需模式交集的缺失驱动)。
MAR 扩展分析: 本文阐明了将 RAY 扩展到一般 MAR 时的理论障碍,明确了投影尾部倾向的具体作用以及实现正则推断的要求。
4. 结果
4.1 模拟研究
作者进行了四项模拟实验:
样本量变化: 与完全病例(CC)和预测驱动推断(PPI++)估计量相比,RAY 和 aRAY 在保持名义 95% 置信区间覆盖率的同时,一致地降低了均方根误差(RMSE)和置信区间宽度。
插补质量变化: 估计量展现了鲁棒性;当插补质量退化为纯噪声时,调优后的估计量会自动回归到 CC 估计量的性能,这说明了保障调优的有效性。
线性回归: 在低维回归设置下,RAY、IPI 和 aRAY 相较于 CC 实现了 6–10% 的 RMSE 降低和 12–18% 的方差降低。
敏感性分析: 在受控的 MAR 和 MNAR 偏离下,基于 MCAR 的估计器表现出偏差增加和覆盖率下降,其恶化程度随缺失机制违反强度的增加而扩大。
4.2 在单细胞多组学中的应用
该方法被应用于估计单细胞数据中的平均表面蛋白丰度(ADT),其中不同的检测手段(DOGMA-seq, CITE-seq, ASAP-seq)提供了 RNA、ATAC 和 ADT 的不同组合。
设置: 使用神经网络预训练来从 RNA 和/或 ATAC 预测 ADT。这些模型被用作 RAY 框架下的插补函数,应用于具有随机缺失模式的基准数据集。
性能: 增强型估计量(RAY, IPI, aRAY)实现了比完全病例估计量更低的绝对误差。aRAY 估计量表现出最高的效率,对于高丰度蛋白,其置信区间长度比完全病例法缩短了高达 35%。
5. 意义与主张
本文声称为日益常见的块状缺失数据下的高效推断提供了一个实用且具有理论依据的解决方案 。其意义在于:
桥接理论与实践: 它将抽象的半参数效率界限转化为一个闭式的、可实现的估计量,无需复杂的迭代算法。
鲁棒性: 它将推断的有效性与插补模型的准确性解耦,这是在使用可能存在误设的灵活机器学习模型时的一项关键特性。
效率提升: 它证明了即使在插补不完美的情况下,结合不同缺失模式的信息也能比完全病例分析获得显著的效率提升。
澄清局限性: 作者谦逊地承认,这种闭式优势本质上是 MCAR 的结果。在一般 MAR 情况下,该方法需要特定的参数假设或正交化技术才能实现正则推断,这也是未来的研究方向。
作者强调,其结构性结果(精确性条件)和效率界限提供了一个清晰的理解,即该方法在何时以及为何有效,为处理复杂缺失结构的从业者提供了一个诊断框架。