Complete Subset Averaging with Many Instruments
原作者: Seojeong Lee, Youngki Shin
原作者: Seojeong Lee, Youngki Shin
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:多工具变量下的完全子集平均法
问题陈述
工具变量(IV)估计量,特别是二阶段最小二乘法(2SLS),是处理经济模型中内生性问题的标准方法。虽然使用大量的工具变量(过度识别)可以提高效率,但这也引入了一个权衡:增加工具变量的数量往往会增加估计量的有限样本偏差。现有文献通过模型选择(如 Donald 和 Newey, 2001)、带有估计权重的模型平均(如 Kuersteiner 和 Okui, 2010)或收缩方法(如 Okui, 2011)来解决这一问题。然而,当工具变量高度相关时(此时像 Lasso 这样的模型选择方法可能会失效),这些方法面临局限性;此外,在高维情况下估计最优权重会导致有限样本效率的损失。此外,现有的模型平均方法通常要求嵌套模型或预先指定的工具变量主集。
方法论
作者提出了完全子集平均(Complete Subset Averaging, CSA)2SLS 估计量。该方法在第一阶段的操作是通过对从总共 K 个可用工具变量中选出的所有大小为 k 的完全子集的拟合值进行等权重平均。
估计量构建:
- 令 ZK,i 为 K 个排除工具变量的向量。
- 对于选定的子集大小 k,存在 M=(kK) 个可能的子集。
- 对于每个子集 m,计算一个标准的 2SLS 投影矩阵 Pmk。
- CSA 投影矩阵(记作 Pk)是这 M 个投影矩阵的算术平均值:Pk=M1∑m=1MPmk。
- 估计量定义为 β^=(X′PkX)−1X′Pky。
- 至关重要的是,Pk 是对称的,但通常不是幂等的,这使其区别于标准的 2SLS 投影矩阵。
子集大小选择:
- 通过最小化近似均方误差(MSE)的样本对应值来选择子集大小 k。
- 该近似 MSE 是利用 Nagar (1959) 展开式推导出来的,该展开式捕捉了有限样本中的偏差-方差权衡。
- 作者还提出了交叉验证(CV)方法作为选择 k 的另一种替代方案,该方法通过最小化第一阶段的均方预测误差来进行选择。
处理无关工具变量:
- 本文将近似 MSE 推广到无关工具变量数量随样本量增长的情景。
- 推导出的公式包含一个取决于相关子集与总子集比例的惩罚项,这表明在存在无关工具变量的情况下,为了减轻信号稀释,最优的 k 应该更大。
核心理论贡献
- 近似 MSE 的推导: 作者利用 Nagar 展开式推导了 CSA-2SLS 估计量的近似 MSE。解决的一个重要技术挑战是,非嵌套投影矩阵的平均值不是幂等的,这需要与假设嵌套模型的文献不同的新分析技术。推导出的公式明确展示了偏差-方差权衡。
- 渐近最优性: 本文证明了通过最小化样本近似 MSE 来选择 k 的 CSA-2SLS 估计量,在具有不同子集大小的 CSA-2SLS 类中是渐近最优的。这一结果是基于 Li (1987) 和 Whittle (1960) 的最优性准则建立的。
- 对无关工具变量的推广: 作者将 MSE 分析扩展到无关工具变量集合不断增长的情况。他们表明,无关工具变量的存在增加了对较小子集大小的惩罚,从理论上证明了在存在无关工具变量的情况下,应选择比仅有相关工具变量时更大的 k。
- 正交工具变量情况: 本文证明,如果工具变量是相互正交的,那么 CSA-2SLS 估计量就等于使用所有 K 个工具变量的标准 2SLS 估计量,无论所选的 k 为多少。
实证与模拟结果
- 蒙特卡洛模拟: 大量的模拟表明,当工具变量相关时,CSA-2SLS 估计量在偏差和均方误差(MSE)方面优于其他方法(包括 Donald-Newey 选择法、Kuersteiner-Okui 平均法和标准 2SLS)。该方法在减少由于高内生性导致的小工具变量集相关的“矩问题”(大离群值)方面特别有效。
- 实证说明: 作者利用 Berry, Levin, 和 Pakes (1995) 的数据,对汽车的逻辑需求函数进行了估计。
- 在包含许多工具变量的扩展设计中,标准 2SLS 和其他估计量(DN, KO)产生的估计值暗示大量产品的需求缺乏弹性,这与经济学理论相矛盾。
- CSA-2SLS 的估计值得到了更大的价格弹性系数绝对值,仅有 0.3% 的产品显示出需求缺乏弹性。这表明 CSA 估计量成功纠正了将估计值拉向不一致 OLS 结果的“多工具变量偏差”。
意义与主张
本文声称,CSA-2SLS 估计量为处理具有许多工具变量(尤其是当这些工具变量相关时)的情景提供了一种稳健的替代方案。通过利用完全子集的等权重平均,而非模型选择或权重估计,该方法避免了在高度相关时失效以及在高维权重估计中产生效率损失的陷阱。作者断言,该方法在所属类别中实现了渐近最优性,并且通过模拟和实证应用证明,在减少偏差和 MSE 方面,与现有方法相比具有显著的有限样本收益。
作者注明的局限性
- 近似 MSE 的推导假设误差具有条件同方差性。
- 研究重点严格限于 2SLS 估计量;向 k-类估计量(如 LIML)的扩展被推迟到未来的研究。
- 该方法假设工具变量是有效的;虽然它处理了无关工具变量,但并未解决无效工具变量的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 statistics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。