← 最新论文
💰 quantitative finance

Shapley in Context: Explaining Financial Language with Domain Expertise

本文通过理论与实证分析,研究了利用 Shapley 值来解释金融应用领域的大型语言模型,并证明了这些归因结果与既有的领域知识相一致,且能提供符合金融逻辑的有意义见解。

原作者: Dangxing Chen, Pengzhan Guo

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Dangxing Chen, Pengzhan Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位聪明但神秘的财务顾问(一个大语言模型或 LLM)来阅读一份公司报告,并告诉你这是一项好的投资还是一个风险极大的赌博。这位顾问给出了一个分数:“这项风险等级是 10 分之 9!”

但问题在于,这位顾问不会告诉你为什么。它只是给出了一个数字。在金融世界中,人们会损失真金白银,监管机构也要求给出解释,仅仅给出一个数字的“黑箱”是远远不够的。你需要知道:是因为提到了“利率上升”?是因为“债务”?还是仅仅因为关于“员工”的通用警告?

这篇论文旨在构建一个公平的、数学化的“放大镜”,用以查明究竟是报告中的哪些词汇驱动了那个风险评分。作者们将这个工具称为 Shapley Value(夏普利值)

核心思想:公平的分饼法

把最终的风险评分看作是一个美味的派。报告中的成分(即词汇)就是烘焙这个派的原料。Shapley Value 是一种切分这个派的方法,它能根据每个成分实际贡献了多少,公平地分配每一块份额(或责任)。

如果报告中出现了“破产(Bankruptcy)”这个词,它可能拿走了派中巨大的一块;如果出现了“的(The)”这个词,它可能只得到了一点碎屑。Shapley Value 通过反复测试配方来计算这种公平性:“如果我们去掉‘破产’,派会发生什么变化?”“如果我们去掉‘的’,又会怎样?”“如果我们同时拥有这两个词呢?”通过对所有这些场景进行平均,它为每一个词都分配了一个精确的数值。

“金融规则手册”(公理)

作者们并不只是想要任何一种公平的切分方式;他们想要一种能够尊重金融世界规则的切分方式。他们创建了一套“金融规则手册”(他们称之为公理),用来测试他们的 Shapley Value 工具是否符合人类专家的逻辑。

以下是他们检查的规则:

  1. “好词”规则(单调性/Monotonicity): 如果一个词显然是积极的(如“强劲收益”),那么工具必须给它一个正向的分数。如果你把“强劲”换成“疲软”,分数应该下降。该工具通过了这项测试。
  2. “收益递减”规则: 想象你有一个苹果,你会很开心;你得到了第二个苹果,你会更开心,但并不会比第一个快乐的两倍。该工具理解,增加第二个“强劲”词所带来的影响,并不像第一个词那样能让影响力翻倍。它也通过了这项测试。
  3. “语境至上”规则: 该工具知道,“收益稳定”对于一家沉稳、安全的业务公司(如可口可乐)来说是好事,但对于一家需要快速增长的科技公司(如亚马逊)来说,可能就没那么令人兴奋。该工具成功地调整了分数,以反映这些不同的公司个性。

大考:10-K 文件

为了证明他们的工具在现实世界中有效,作者们并没有仅仅观察短句。他们向工具输入了大量的、枯燥的法律文件——Form 10-K。这些是公众公司必须向政府提交的年度报告,其中包含一个名为“风险因素”的部分。

他们测试了三家截然不同的公司:

  • 硅谷银行 (SVB): 在倒闭之前,他们的报告中充满了关于“信贷风险”和“流动性”的警告。该工具查看了报告并指出:“嘿,‘信贷风险’部分是这里危险程度的主要驱动力。”它准确地识别出了预测该银行失败的具体词汇。
  • 富国银行 (Wells Fargo): 这家银行有着悠久的监管丑闻史(例如虚假账户事件)。该工具查看了他们的报告并指出:“‘监管风险’部分才是这里的重头戏。”它正确地区分了富国银行的问题与其他问题的不同。
  • Crocs(鳄鱼鞋公司): 他们对比了 Crocs 在 2020 年(疫情期间)与 2021 年的报告。该工具注意到,“经济风险”评分下降了(因为疫情正在缓解),而“收购风险”上升了(因为他们收购了一个新的鞋类品牌)。

为什么这很重要

论文得出结论,这种“公平的分饼法”(基准 Shapley Value)是打开 AI 金融黑箱的一种可靠方法。

  • 它具有一致性: 如果你运行十次测试,最重要的词汇排名保持不变。
  • 它具有准确性: 如果你移除工具所认为重要的词汇,风险评分会发生剧烈变化。如果你移除那些不重要的词汇,评分几乎不动。

简而言之,作者们构建了一种数学方法,它不仅仅是在猜测 AI 为什么做出某个决定,而是证明了 AI 的决策逻辑与人类金融专家实际的思考方式是一致的,从而使这些强大的 AI 工具可以安全地用于高风险的资金决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →