Diagnosing Causal Credibility of Machine Learning Explanations: A Dual- SHAP Attribution Framework Applied to Social Survey Data
本文介绍了一种双重 SHAP 框架,该框架通过比较条件归因与干预归因,将机器学习解释中的相关关系与因果关系区分开来,并证明了其在诊断多种社会调查结果的因果可信度方面的有效性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人类行为研究中,研究人员越来越多地依赖强大的计算机程序来从海量的调查数据中寻找模式。这些机器学习模型擅长发现复杂的联系,例如一个人的收入、年龄和居住地如何结合在一起影响其社交习惯,而传统的统计学可能会忽略这些联系。然而,这些模型通常是不透明的;它们可以高精度地预测结果,却无法提供清晰的解释。为了解决这个问题,科学家们使用了一种名为 SHAP 的工具,它就像一束聚光灯,凸显出模型在做出预测时认为最重要的因素。问题在于,这束聚光灯经常会将两种截然不同的事物混淆:真实的因果关系与纯粹的巧合。仅仅因为两件事同时发生,并不意味着其中一件导致了另一件。例如,模型可能会将“配偶的年龄”标记为一个人互联网使用率的关键原因,但这并不是因为配偶的年龄直接改变了该人的上网频率,而仅仅是因为配偶往往年龄相仿,且年龄本身是技术使用的强力驱动因素。对于希望理解而非仅仅预测人类行为的社会科学家来说,区分这些真实的因果关系与误导性的相关性至关重要。
来自中国北方的研究人员李士东的一项新研究通过对现实世界社会调查数据应用严谨的诊断框架,正面应对了这一困惑。研究人员分析了 2023 年中国综合社会调查(CGSS)的响应数据,这是一个代表了 31 个省份近 4800 人的大规模数据集。研究目标是测试 18 个不同方面的社会生活,范围从人们访问朋友的频率到他们对陌生人的信任以及他们的媒体消费习惯。该研究并没有接受单个计算机模型提供的标准解释,而是采用了“双重 SHAP”(dual-SHAP)方法。这种方法比较了两种不同的计算重要性的方式。第一种方法观察数据自然存在的状态,保留变量之间现有的所有联系。第二种方法则人为地打破这些联系,询问如果某个特定因素在其他因素保持独立的情况下发生变化,会对预测产生什么影响。通过比较这两种方法的结果,研究可以衡量每个因素的“可信度得分”。高分意味着即使在打破相关性时,该因素的重要性依然成立,这表明存在直接的因果联系。低分则表明该因素很可能只是在跟随另一个更有影响力的变量“搭便车”。
调查首先扫描了 18 种社会行为,以查看哪些行为可以被现有数据可靠地预测。在最初考虑的 22 种行为中,有 18 种被发现具有足够的预测性以进行进一步分析,而另外 4 种(如志愿活动频率)则过于随机,无法进行有效建模。在剩下的 18 种行为中,研究测试了五种不同类型的机器学习算法,以观察哪一种在特定行为中表现最好。结果挑战了一个领域内的普遍假设:即一种被称为 XGBoost 的特定算法是所有任务的通用冠军。相反,研究发现没有哪一个模型能统治整个领域。一种名为 RandomForest 的模型在 1 种行为中表现最佳,涵盖了社交互动和媒体使用等领域。然而,包括 Ridge 回归、LightGBM 和 GradientBoosting 在内的其他模型,在处理诸如一般社会信任或报纸阅读等特定结果时表现更为优异。这一发现表明,计算机模型的选择并非微小的技术细节,而是一个实质性的决策,它从根本上塑造了研究人员得出关于人类行为驱动力结论的方式。
在为每种行为选定最佳模型后,研究将潜在原因的列表从 38 个预测因子缩减到了 29 个关键因素。这一筛选过程使用了 SHAP 工具本身来过滤掉贡献极小的变量,例如一个人的女儿数量或对性别角色的特定态度。剩余的 29 个因素包括人口统计特征(如年龄和收入),以及对社会公平的态度和语言能力。年龄成为了所有领域中最主要的预测因子,紧随其后的是个人收入和语言技能。在确定这些关键因素后,研究人员应用双重 SHAP 框架来计算每个因素影响的可信度。他们发现,所有关系的平均可信度得分为 0.727,这表明虽然许多因素确实具有直接影响,但标准模型分配的重要性很大程度上是被相关性所夸大的。
研究揭示了一个可靠性的广泛光谱。一些因素,如一个人对社会公平的感知或其关于移民的政治观点,显示出较高的可信度得分,这意味着它们对社会结果的影响是稳健且可能具有因果性的。相比之下,诸如配偶年龄或婚姻时长等因素,在与其自身年龄的联系被打破时,往往显示出低甚至负的可信度。例如,当研究模拟了一个配偶年龄独立于受访者年龄发生变化的场景时,配偶年龄对互联网使用的表观影响消失了,甚至发生了反转。这作为一个明确的警告,表明原始模型误将相关性当成了因果关系。研究人员建立了一个阈值来帮助解释这些得分:他们建议 0.80 或更高的得分应被视为主要因果关系的强有力指标。使用这一标准,只有约 40% 的“因素-行为”对符合主要因果关系的条件。如果将阈值降低到更宽松的 0.50,则有近 93% 的组合符合标准,但研究人员认为,为了避免被巧合性的模式误导,严格的标准是必要的。
为了确保这些发现不仅仅是统计上的伪影,研究还通过模拟现实世界的变化进行了最终检查。他们询问,如果一个特定因素(如收入或年龄)增加一个标准单位,一个人的预测行为会发生什么变化。结果与常识和既有的社会科学理论一致。例如,在模拟中增加一个人的年龄会导致预测的互联网使用量下降,反映了众所周知的数字鸿沟现象,即老年人使用技术的频率较低。同样,增加个人收入会导致预测的报纸阅读量增加,这符合高社会经济地位与纸质媒体消费相关的观点。这些模拟确认了模型捕捉到的是真实的、可解释的关系,而非随机噪声。此外,当研究人员在不同子群体(如年轻人与老年人,或城市居民与农村居民)上测试该框架时,总体模式保持稳定,尽管具体的信度得分会有所不同。这证明了虽然该方法是稳健的,但因果联系的强度取决于所研究的具体群体。
最终,这项工作为社会科学家提供了一个透明且可重复的工具,用于从机器学习的解释中分离信号与噪声。它并不声称在绝对意义上证明了因果关系,因为仍可能存在未衡量的因素,但它提供了一种实用的方法,用以诊断解释是否可能具有误导性。通过比较模型在面对“数据原貌”与“打破变量间自然联系”时的行为差异,研究人员现在可以识别哪些因素是真正驱动社会结果的,而哪些仅仅是其他变量投下的影子。研究结论指出,虽然机器学习是观察人类行为的强大透镜,但它需要这种细致的校准,以确保它提供的洞察不仅是准确的预测,而且是关于人们为何这样行动的可靠解释。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。