← 最新论文
🤖 machine learning

Doctor Rashomon and the UNIVERSE of Madness: Variable Importance with Unobserved Confounding and the Rashomon Effect

本文介绍了 UNIVERSE,这是一个利用 Rashomon 集在存在未观测混杂因素和模型多样性的情况下,为变量重要性提供鲁棒边界的新型框架,从而解决了标准特征选择和假设生成中的关键局限性。

原作者: Jon Donnelly, Srikar Katta, Emanuele Borgonovo, Cynthia Rudin

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jon Donnelly, Srikar Katta, Emanuele Borgonovo, Cynthia Rudin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数据科学领域,研究人员经常试图理解是什么驱动了特定的结果,例如贷款是否会被偿还,或者患者是否会康复。为了实现这一目标,他们构建数学模型,观察各种因素或特征(如收入、信用历史或年龄)。这一过程的一个标准部分是确定这些因素中哪些是真正重要的。长期以来,科学家们一直依赖于一种方法,即根据移除或打乱某个特征后模型性能下降的程度来为每个特征分配分数。这有助于他们决定未来应该收集哪些变量,以及应该忽略哪些变量。然而,这种标准方法存在一个隐藏的缺陷:它通常假设正在分析的模型是唯一的优选模型。实际上,许多不同的模型可以同样好地解释同一组数据,这种现象被称为“罗生门效应”(Rashmon effect)。此外,现实世界的数据往往是不完整的;关键信息(例如一个人的准确收入或健康史)可能完全缺失于数据集中。当这些缺失环节存在时,标准方法可能会产生误导性的结论,使某个特征看起来很重要,而实际上它并不重要,或者掩盖了一个实际上至关重要的特征。

来自杜克大学和博科尼大学的研究小组开发了一种名为 UNIVERSE 的新框架来解决这些问题。他们的工作应对了两个挑战:拥有多个同样优秀的模型,以及可能扭曲结果的缺失数据。他们并没有选择一个单一的最佳模型并对其进行孤立分析,而是观察了所有表现接近最佳模型的整个群体。他们将这个群体称为“罗生门集”(Rashomon set)。通过检查整个集合,他们可以观察到一个特征的重要性是如何在不同的有效模型中发生变化的。但他们更进一步:他们还考虑了某些重要变量缺失的情况。他们通过创建一个数学边界的安全网来实现这一点。这些边界充当了一组可能值的范围,保证了即使研究人员不知道缺失变量的具体内容,也不确定哪一个特定的模型才是真实的,特征的真实重要性也会落在该范围内。

研究人员使用一种巧妙的模拟技术测试了他们的方法。他们采用了现实世界的数据集,如犯罪累犯记录、学生大学辍学率和信用风险评估,并人工创造了一个部分数据被隐藏的情景。他们将数据分为若干组,并在每组上训练不同的模型,从而有效地创造了一种情况,即“真实”模型取决于一个人属于哪一组,而这一信息在主分析中是不可见的。然后,他们应用 UNIVERSE 框架来观察其是否能在存在此类隐藏信息的情况下,正确识别特征的重要性。结果非常明确:如果没有这些新的调整,标准方法往往无法捕捉到变量的真实重要性,尤其是在样本量较大或数据较为复杂时。相比之下,UNIVERSE 方法能够一致地产生包含正确答案的范围。在测试中,即使在数据缺失关键部分的情况下,该方法也成功捕捉到了超过百分之八十的试验中的正确变量重要性。

他们工作中最为引人注目的演示之一涉及银行使用的一个信用风险数据集。在这种情景下,一种被称为“外部风险评估”(External Risk Estimate)的特定风险评分被广泛认为是预测贷款违约的关键因素。标准分析表明,这一评分至关重要。然而,当研究人员应用 UNIVERSE 框架时,他们发现这一评分的重要性并不像看起来那样稳健。他们证明了,如果存在未被衡量的因素(例如一个人的收入)未包含在数据中,那么“外部风险评估”可能根本不是必要的。他们的分析表明,其他更具解释性的特征可以轻易取代它。这一发现具有重要意义,因为它意味着银行可能正在依赖一种复杂的、昂贵的指标,而这种指标可以被更简单、更透明的信息所取代,从而可能为贷款申请人提供更好的反馈。

这种新方法的优势在于其处理不确定性的能力,且无需做出不切实际的假设。传统方法通常需要知道缺失数据的精确分布,或者假设变量之间存在某种特定类型的关系。UNIVERSE 框架不需要这些。相反,它要求分析师提供一个合理的估计,即缺失数据可能会在多大程度上改变结果。基于这个估计,该方法计算出一个可能的重要性值的范围。研究人员从数学上证明了这些范围是可靠的,这意味着如果分析师对缺失数据影响的估计是正确的,那么特征的真实重要性几乎肯定会落在计算出的边界之内。他们还表明,随着更多数据的获得,这些边界会变得更加紧凑和精确,这使得该方法对小型和大型数据集都非常有用。

这项工作代表了科学家思考变量重要性方式的一种转变。研究人员不再寻求一个依赖于特定模型和完整数据集的单一、确定的答案,而是拥抱现实世界的复杂性。他们承认存在多个正确的模型,并且数据往往是不完整的。通过提供一种能够应对这些现实情况的方法,他们提供了一个关于数据能告诉我们什么以及不能告诉我们什么的更诚实的工具。该框架并不声称找到了那一个真实的模型或那一个真实的重要性得分。相反,它提供了一个可靠的区间来捕捉真相,确保基于数据的决策不会因隐藏变量或单一最佳解释的错觉而偏离轨道。这种方法为金融到公共政策等领域的更可靠、更稳健的科学结论提供了一条路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →