← 最新论文
💻 computer science

SHAP and LIME Explainability in Financial Machine Learning: A Systematic Review of Methods, Evaluation Gaps, and Barriers to Deployment

这项针对 297 项研究的系统综述显示,尽管 SHAP 和 LIME 在金融机器学习(特别是信用建模)的可解释性方面被广泛采用,但它们面临着缺乏正式评估的关键问题,仅有 9.1% 的论文对解释质量进行了评估,这凸显了对加强验证和部署标准以确保符合监管合规性和建立信任的紧迫需求。

原作者: Manpreet Singh, Akshatha Srikantha, Keshav Kaushik, Prajwal Bajpai

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Manpreet Singh, Akshatha Srikantha, Keshav Kaushik, Prajwal Bajpai

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代金融世界中,银行、保险公司和交易公司高度依赖复杂的计算机程序来做出高风险的决策。这些程序通常被称为机器学习模型,它们可以预测一个人是否会偿还贷款、标记一笔交易是否属于欺诈,或者确定保单的价格。虽然这些工具功能极其强大,但它们通常以“黑盒”的形式运行。这意味着,即使是构建这些程序的开发者,也无法轻易看出计算机是如何得出特定答案的。当贷款被拒绝或账户被冻结时,客户、审计员和监管机构都需要知道原因。为了解决这个问题,研究人员开发了一个名为“可解释人工智能”(Explainable AI)的领域。这些工具旨在为黑盒投射光芒,将计算机复杂的数学运算转化为人类可读的原因。其中最受欢迎的两个工具被称为 SHAP 和 LIME。它们就像翻译官一样,通过对已完成的预测进行逆向推导,展示出哪些因素(如收入或消费历史)起到了最重要的作用。然而,仅仅因为一个工具能够生成解释,并不意味着该解释是正确、稳定或足以在真实的法庭或银行网点中被信任的。

来自波士顿大学、加州大学欧文分校、沙尔达大学以及印度理工学院坎普尔分校的研究团队决定调查这些工具在现实金融领域的使用情况究竟如何。他们不仅关注新颖的想法,还对 2016 年至 2026 年间发表的近 300 项科学研究进行了大规模的系统性回顾。他们的目标是审计证据。他们想要看看研究人员仅仅是在展示关于模型运作方式的精美图片,还是在真正证明这些图片是准确且可靠的。该团队遵循严格的方案,通过检索数千份学术记录,仅筛选出那些将 SHAP 或 LIME 真实应用于金融数据(如信用评分或欺诈检测)的研究。随后,他们检查了每一个细节:正在解决什么样的金融问题、正在解释什么样的计算机模型,以及最重要的一点——研究人员是否测试了其解释的质量。

这项回顾的结果揭示了这些工具的采用速度与对其进行的测试严谨程度之间存在显著差距。研究人员发现,该领域的发展非常迅速。在他们分析的大多数研究中,约 74% 关注的是简单的“是或否”决策,例如批准贷款或识别欺诈。在这些研究中,被称为 SHAP 的工具是绝对的宠儿,出现在近 94% 的论文中。这种受欢迎程度很大程度上是因为 SHAP 非常契合银行最常使用的特定类型的计算机模型。第二种工具 LIME 的使用频率要低得多,且通常仅作为 SHAP 的补充说明,而非主要方法。虽然研究人员发现几乎每项研究都报告了其计算机模型预测结果的准确性,但当他们转向观察解释本身时,情况却发生了彻底的变化。

最令人震惊的发现是,几乎没有人真正去检查他们的解释是否优秀。在 297 项被审查的研究中,只有 21 项(约占 7%)进行了正式测试,以查看解释是否符合模型的真实行为。另有 6 项研究提供了有限的证据,但绝大多数研究只是生成了一个解释并假设它是正确的。研究人员指出,这是一个危险的疏忽。在金融领域,解释不仅仅是一个视觉辅助工具;它是决策过程的关键组成部分。如果一家银行告诉客户其贷款被拒绝是因为信用历史,但该解释实际上是错误或不稳定的,这就会产生法律和伦理风险。该综述发现,研究人员经常将“生成解释”的行为等同于“验证解释”,但证据表明这两者是完全不同的两回事。

该研究还探讨了阻碍这些工具在现实系统中安全使用的障碍。研究人员发现,72% 的研究提到了技术或数据相关的障碍。最常见的理由是“类别不平衡”(class imbalance),即被预测的事件(如贷款违约或欺诈案例)相对于正常情况发生的频率极低。这种稀缺性使得解释工具难以给出一致的答案。其他障碍还包括对处理速度的要求、隐私担忧以及金融数据随时间变化的特性。然而,该综述强调了一个脱节现象:虽然研究人员频繁列举这些障碍作为问题,但他们很少测试这些问题究竟如何损害了解释的质量。他们指出了障碍,但并未衡量造成的损害。

当研究人员观察科学家们如何试图建立对其结果的信心时,他们发现大多数人依赖的方法都较为薄弱。约 36% 的研究提到了某种形式的验证,但最常见的方法仅仅是将 SHAP 的结果与 LIME 进行对比。如果这两个工具达成一致,研究人员通常就认为解释是正确的。综述认为,这并不足以作为证据,因为这两个工具完全可能以相同的方式出错。更强有力的方法——例如测试当数据发生轻微变化时解释是否依然稳健,或者请求人类专家对结果进行评判——在研究中所占比例极小。作者总结道,该领域已经掌握了生成解释的艺术,但在证明这些解释是否值得信赖方面却大体上失败了。他们提出了一个新的研究标准,敦促科学家们不要再将“生成解释”视为最后一步。相反,必须将解释本身视为一种需要经过严格测试的产品,就像它所描述的金融模型一样,然后再将其用于影响人类生活的决策之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →