← 最新论文
💰 quantitative finance

Counterfactual Analysis via Large Language Models

本文证明了经过提示工程处理的 GPT-3.5 模型能够有效地在在线贷款中进行反事实分析,以预测在假设利率情景下的投资回报率,其性能与传统的梯度提升回归相当,同时展现出了逻辑因果推理能力。

原作者: Zonghao Yang

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zonghao Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名拥有神奇“如果……会怎样?”机器的时光旅行者。在科学领域,这被称为反事实分析(counterfactual analysis)。这是一门预测如果你昨天做出了不同的选择,将会发生什么的艺术。是因为班级规模太大导致那个学生不及格,还是如果换个小一点的教室他就能取得优异成绩?那封邮件被忽略是因为主题太无聊,还是如果换一个个性化的主题就能挽救局面?科学家们热爱这些研究,因为它们能帮助我们理解因果关系,而不仅仅是进行猜测。通常,为了回答这些问题,研究人员需要进行昂贵的实验,或者使用复杂的数学模型来通过观察过去的数据来预测未来。但最近,一种新型的数字大脑诞生了:大语言模型(LLM)。把它们想象成读过几乎整个互联网内容的超级智能机器人。它们擅长写故事和聊天,但它们能否扮演时光旅行者的角色,去推演“如果……会怎样”的情景呢?这正是本论文所提出的核心问题。

这项研究的作者决定在在线贷款这个高风险领域测试这些数字大脑。想象一家向人们发放贷款的银行。他们必须决定收取多少利息。如果收费太高,借款人可能会不堪重负并停止还款;如果收费太低,银行就会亏损。银行知道他们实际选择的利率所产生的结果,但他们永远无法确定如果选择了另一种利率,情况会如何。这个缺失的拼图碎片就是“反事实”。研究人员想看看一个人工智能,特别是名为 GPT-3.5 的模型,能否在查看一份贷款申请后说:“如果我们当时收 10% 的利息而不是 12%,借款人会更快地还清款项。”

为了实现这一点,团队并没有只是简单地向 AI 提问。他们意识到,与机器人交流就像与人类交流一样,你必须用正确的方式去提问。他们使用了名为提示工程(prompt engineering)的技术,这基本上是赋予 AI 完美指令的艺术。他们尝试让 AI 假装成借款人,然后又尝试让它假装成信用专家。他们甚至让 AI 模拟一个由四位专家组成的评审小组,让他们互相争论并达成共识,这种方法被称为思维树(tree-of-thought)。他们还让 AI 观察传统计算机算法所做的预测,看看它是否能有所改进。

结果令人惊喜。当研究人员最初在没有任何特殊指令的情况下询问 AI 预测贷款结果时,它的表现相当糟糕,准确率仅为 2% 左右。但一旦他们使用了“专家小组”技巧并提供了正确的上下文,其表现就跃升到了接近 3%。虽然这听起来可能很小,但在该领域实际上是一个巨大的进步,使 AI 几乎达到了最顶尖传统数学模型的准确度。更重要的是,AI 不仅仅是吐出一个数字,它还解释了自己的推理过程。它观察借款人的历史记录,考虑利率因素,并逻辑严密地论证了为什么较低的利率可能有助于他们更快地偿还贷款。

这项研究表明,这些大语言模型不仅仅是聊天机器人;它们正在成为能够推演“如果……会怎样”情景的有力工具。AI 展示了它能够识别出传统计算机模型可能过于乐观,并根据其自身的“知识”关于人类行为的方式来调整预测。例如,当传统模型预测借款人在降低利率后会在 8 个月内还清贷款时,AI 会认为:“考虑到他们的信用历史,这看起来太快了”,并将预测调整为 22 个月。这表明 AI 不仅仅是在复制数学计算,它实际上是在进行逻辑思考。

然而,作者谨慎地指出,这并不是一个完美的解决方案。他们指出,虽然 AI 正在变得越来越好,但它仍是在模拟环境中接受测试。他们发现,AI 的预测在逻辑上符合现实世界的规则(例如,如果降低利率,人们违约的可能性就会降低),但他们并未声称 AI 已经完全破解了人类行为之谜。相反,他们认为这些模型是一种强大的新工具,可以通过模拟不同的未来,帮助贷款机构和科学家做出更好的决策。这就像拥有一位非常聪明、博学多才的顾问,可以在你真正做出选择之前,帮助你预见这些选择带来的后果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →