← 最新论文
🤖 machine learning

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

该论文介绍了 GAUGE,这是一个评估 AI 构建的金融模型是否符合观察到的分析师实践(而非单一“标准答案”)的新型基准测试,研究结果表明,尽管目前的智能体在机械性的模型构建方面表现出色,但在估值判断方面仍显著落后于人类专业人员。

原作者: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位烹饪节的评委。通常情况下,评委手里都有一张“完美”的食谱卡。如果参赛者的菜肴味道哪怕只与这张卡片有细微差别,就会被扣分。但如果制作美味千层面的方法其实有十种呢?如果所谓的“完美”食谱仅仅是一个人的观点,而参赛者的版本同样美味,只是使用了不同的香料呢?这就是科学家在测试人工智能处理复杂任务(如金融建模)时面临的问题。金融建模就像是为一家公司的未来构建一台精密的预测机器;它融合了硬性事实(如过去的销售额)与合理的推测(如公司的增长速度)。几十年来,我们通过将 AI 的预测与某一位专家的答案进行对比来测试它。但如果专家们本身对最佳预测也存在分歧,那么因为 AI 给出了一个不同但合理的答案就惩罚它,似乎并不公平。这篇论文提出了一个问题:当不存在唯一的“正确”答案时,我们该如何为 AI 打分?

这项名为 GAUGE 的研究背后的研究人员决定不再假装存在唯一的完美金融模型。他们构建了一个新的测试场,旨在观察 AI 智能体是否能够构建这些复杂的金融“预测机器”,更重要的是,它们能否做出人类专家所做的那种内部“判断”。

首先,他们测试了旧的评分方式。他们选取了针对同一家公司由不同人类专家构建的 108 对金融模型。当他们使用旧有的“单一完美答案”规则,将一位专家的模型与另一位专家的模型进行对比评分时,结果令人震惊。中位分仅为 0.33(总分 1.0)。事实上,92.6% 的配对得分低于 0.70。这意味着,即使是专业的专业人士,由于他们都是专家,也经常产生如此大的分歧,以至于如果你将其中一人视为“真理”,你就会判定另一人不及格。事实证明,在金融领域,“不同”并不意味着“错误”。

为了解决这个问题,团队创建了 GAUGE(无需“黄金答案”的智能体构建金融模型评分系统)。他们没有采用单一的食谱卡,而是根据现实中专家的实际行为创建了一个“安全包络线”。想象一个靶盘,其靶心不是一个点,而是一个宽阔的圆环。如果 AI 的预测落在那个“合理专家行为”的圆环内,它就能获得分数。该系统检查两件事:

  1. 机制(The Mechanics): 数学运算是否正确?电子表格是否平衡?(就像检查烤箱是否真的打开了一样)。
  2. 判断(The Judgment): AI 的预测是否落在现实中专家认为可辩护的范围内?(就像检查调味是否在优秀厨师的口味范围内一样)。

他们使用这个新系统测试了 24 个不同的 AI 智能体,以及一组由金融系学生到资深分析师组成的 55 名人类样本。以下是他们的发现:

  • AI 擅长数学,但不擅长直觉。 AI 智能体在机械部分表现出色。最优秀的 AI 通过了 93% 的机制检查(确保电子表格公式正确)。然而,在涉及判断的部分(即进行实际预测)时,最优秀的 AI 仅通过了 78%。
  • “差距”是真实存在的。 平均而言,AI 智能体在构建模型方面的表现比在进行估值判断方面高出 26 分。它们能造出汽车,但还不太擅长驾驶。
  • 人类依然胜出。 最优秀的 AI 得分为 53.4。这优于平均水平的金融系学生(43.2),但逊于每一位资深分析师(其平均分为 88.3)以及大多数初级分析师。AI 足以聪明到完成作业,但还不够聪明到能够担任领导。

这项研究表明,虽然 AI 在构建复杂的金融模型方面正变得非常有能力,但最难的部分——即利用专家所使用的细致且可辩护的判断来评估一家公司的价值——仍然是一个重大的挑战。作者们不仅发现了一个分数,他们还证明了旧有的评分方式(寻找唯一完美答案)对人类和机器都是不公平的,并提供了一种新的衡量进步的方法,这种方法尊重了专家分歧这一混乱的现实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →