技术摘要:存在交互效应的超高维设置下的去偏因果中介分析
1. 问题设定与动机
本文解决了在处理超高维(UHD)变量时,估计自然直接效应(NDE)和自然间接效应(NIE)的挑战,其中前处理协变量(X ∈ R p X \in \mathbb{R}^p X ∈ R p )和后处理中介变量(M ∈ R q M \in \mathbb{R}^q M ∈ R q )均为超高维,即 p ∧ q ≫ n p \wedge q \gg n p ∧ q ≫ n 。至关重要的是,所提出的框架能够容纳二元处理变量(A A A )与协变量及中介变量之间的交互效应。
现有的高维中介分析文献在很大程度上依赖于启发式筛选、降维或路径选择,往往缺乏在存在超高维变量时对自然效应进行严谨推断的理论支持。此外,最近在高维中介领域取得的理论进展(例如 Guo 等人,2构22–2024;Lin 等人,2025)通常假设协变量为固定维度,或者排除了处理-协变量/中介变量的交互作用。本文所解决的具体难点在于估计中介泛函 θ 10 = E [ Y ( 1 , M ( 0 ) ) ] \theta_{10} = E[Y(1, M(0))] θ 10 = E [ Y ( 1 , M ( 0 ))] ,这涉及到一个“跨臂”(cross-arm)交互问题:它结合了从处理臂学习到的参数(结果回归系数 γ 1 \gamma_1 γ 1 )与从控制臂学习到的参数(中介回归矩阵 B 0 B_0 B 0 )。这种结构使得无法直接应用标准的线性或双线性泛函去偏技术,因为目标涉及一个复合项 X ˉ ⊤ B 0 ⊤ γ 1 \bar{X}^\top B_0^\top \gamma_1 X ˉ ⊤ B 0 ⊤ γ 1 ,其中 B 0 X ˉ B_0 \bar{X} B 0 X ˉ 可能是稠密的且无法在 ℓ 1 / ℓ 2 \ell_1/\ell_2 ℓ 1 / ℓ 2 范数下一致估计。
2. 方法论
作者提出了一种新型的多步去偏估计量 ,该方法结合了高维回归与精心设计的平衡步骤。该方法利用交叉拟合(cross-fitting)程序将数据分为两个折叠(D 1 , D 2 D_1, D_2 D 1 , D 2 ),以避免过拟合并确保推断的有效性。
估计程序(算法 1)
核心方法通过以下步骤估计参数 θ 10 = X ˉ ⊤ ( β 1 + B 0 ⊤ γ 1 ) \theta_{10} = \bar{X}^\top (\beta_1 + B_0^\top \gamma_1) θ 10 = X ˉ ⊤ ( β 1 + B 0 ⊤ γ 1 ) :
用于近似的平衡(第 1 步): 利用控制组观测值(A = 0 A=0 A = 0 ),通过求解一个优化问题来构建平衡权重向量 τ ^ 2 \hat{\tau}_2 τ ^ 2 。该权重近似于控制协变量空间中的平均协变量向量 X ˉ \bar{X} X ˉ 。至关重要的是,乘积 m ^ c = M c ⊤ τ ^ 2 \hat{m}_c = M_c^\top \hat{\tau}_2 m ^ c = M c ⊤ τ ^ 2 作为未知向量 B 0 X ˉ B_0 \bar{X} B 0 X ˉ 在 ℓ ∞ \ell_\infty ℓ ∞ 范数下的直接近似,从而绕过了估计完整的超高维矩阵 B 0 B_0 B 0 的需求。
结果回归(第 2 步): 利用处理组观测值(A = 1 A=1 A = 1 ),通过 Lasso 回归估计结果系数 ϕ ^ 1 = ( β ^ 1 , γ ^ 1 ) \hat{\phi}_1 = (\hat{\beta}_1, \hat{\gamma}_1) ϕ ^ 1 = ( β ^ 1 , γ ^ 1 ) 。
第一阶段去偏(第 3 步): 将估计量 ϕ ^ 1 \hat{\phi}_1 ϕ ^ 1 在方向 a = ( X ˉ ⊤ , m ^ c ⊤ ) ⊤ a = (\bar{X}^\top, \hat{m}_c^\top)^\top a = ( X ˉ ⊤ , m ^ c ⊤ ) ⊤ 上进行去偏。这一步纠正了 Lasso 的正则化偏差,但由于方向 m ^ c \hat{m}_c m ^ c 是 B 0 X ˉ B_0 \bar{X} B 0 X ˉ 的近似而非真实值,因此引入了新的偏差。
第二阶段去偏(第 4 步): 为了消除第 3 步中引入的偏差,在控制数据上进行第二次回归。将伪结果 M c ⊤ γ ^ 1 M_c^\top \hat{\gamma}_1 M c ⊤ γ ^ 1 对 X c X_c X c 进行回归以估计 b = B 0 ⊤ γ ^ 1 b = B_0^\top \hat{\gamma}_1 b = B 0 ⊤ γ ^ 1 。随后使用第 1 步中使用的相同平衡权重 τ ^ 2 \hat{\tau}_2 τ ^ 2 对该估计量进行去偏。
组合(第 5 步): 通过结合去偏后的结果项和去偏后的近似项,并减去一个补偿项以处理重叠部分,来构建最终估计量。
交叉拟合(第 6 步): 交换 D 1 D_1 D 1 和 D 2 D_2 D 2 的角色,并将结果取平均值,以获得最终的交叉拟合估计量 θ ^ 10 c f \hat{\theta}_{10}^{cf} θ ^ 10 c f 。
NDE 和 NIE 的估计量是通过将 θ ^ 10 c f \hat{\theta}_{10}^{cf} θ ^ 10 c f 与类似的 θ 11 \theta_{11} θ 11 和 θ 00 \theta_{00} θ 00 估计量(由于不涉及跨臂交互,后者较为简单)相结合而构建的。
3. 理论贡献与结果
本文确立了在较为广泛的稀疏性、正则性和限制特征值条件下,所提估计量具有 n \sqrt{n} n -一致性和渐近正态性 。
偏差结构: 作者证明了估计误差可以分解为一个领先的随机项和一个余项 Δ n \Delta_n Δ n 。该余项呈现出乘积形式 (例如 ∥ 近似误差 ∥ ∞ × ∥ 估计误差 ∥ 1 \|\text{近似误差}\|_\infty \times \|\text{估计误差}\|_1 ∥ 近似误差 ∥ ∞ × ∥ 估计误差 ∥ 1 )。这种结构确保了即使单个估计误差较大,只要满足稀疏性条件 ( 1 + s ) ( 1 + k ) log ( p + q ) / n → 0 (1+s)(1+k)\log(p+q)/\sqrt{n} \to 0 ( 1 + s ) ( 1 + k ) log ( p + q ) / n → 0 ,偏差在渐近意义上也是可以忽略不计的(o p ( n − 1 / 2 ) o_p(n^{-1/2}) o p ( n − 1/2 ) )。
渐近正态性: 本文推导了渐近方差,并构建了其一致估计量,从而能够为 NDE、NIE 和总效应构建有效的置信区间。这些结果对于样本平均目标和总体平均目标均成立,并已扩展到处理条件异方差误差的情况。
与现有方法的比较: 作者展示了其方法避免了某些现有高维推断方法(如 Guo 等人,2023)所要求的强“beta-min”(最小信号强度)和支撑集恢复假设。只要乘积的稀疏度与维度的增长相对于样本量足够缓慢,其方法允许更弱的信号和更高的稀疏水平。
4. 实证评估
该方法通过广泛的模拟研究和实际数据应用进行了评估。
模拟研究: 将所提去偏估计量 (θ ^ 10 c f \hat{\theta}_{10}^{cf} θ ^ 10 c f ) 与标准插件估计量(plug-in estimator)以及 Guo 等人 (2022) 修改后的方法进行了对比。
在各种情形下(包括增加稀疏性、消失的最小信号强度以及异方差噪声),去偏估计量始终表现出较低的均方根误差(RMSE)和接近名义水平(95%)的覆盖概率。
相比之下,标准估计量表现出显著偏差,而 Guo 等人 (2022) 的修改版方法在超高维设置下(特别是在高稀疏性或弱信号时)表现出不稳定性和较差的覆盖率。
实际数据应用: 该方法被应用于 TCGA 肺癌数据集,以估计吸烟对生存时间的效应,其中 DNA 甲基化是中介变量。
分析涉及 n = 738 n=738 n = 738 名患者,包含 p = 42 p=42 p = 42 个协变量和 q = 264 , 797 q=264,797 q = 264 , 797 个中介变量。
结果表明,吸烟对生存时间的总效应主要是通过 DNA 甲基化(NIE)实现的,其中间接效应具有统计学显著性,而直接效应则不显著。
与使用仅 6 个预选 CpG 位点的固定维度 OLS 方法相比,该方法得出了截然不同且违反直觉的结果(暗示吸烟增加了生存率),凸显了在高维复杂生物系统中应用高维方法论的重要性。
5. 重要性与主张
本文声称是首个 提供在同时存在超高维协变量、超高维中介变量及其与处理变量交互的情况下,估计自然直接效应和自然间接效应的方法的研究。
关于本文重要性的关键主张包括:
结构创新: 所提出的多步去偏策略解决了独特的一类结构性挑战(涉及超高维矩阵、向量及跨臂参数的跨臂问题),而现有的用于线性或双线性泛函的去偏技术无法直接处理此类问题。
更弱的假设: 该理论框架在比竞争性高维中介推断方法更弱的信号强度假设下运行,允许在某些活跃系数较弱时仍能检测到效应。
实际效用: 该方法为复杂的生物机制(如表观遗传中介)提供了有效的推断,在这些机制中,潜在中介变量的数量远超样本量,而传统的低维选择方法可能会失效或产生偏差。
作者总结道,虽然目前的工作侧重于线性模型,但所开发的框架为未来扩展到广义线性模型和其他具有类似跨臂复杂性的结构方程模型奠定了基础。