← 最新论文
🤖 AI

BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

本文介绍了 BigFinanceBench,这是一个包含 928 个项目的综合基准测试,旨在通过详细的评分标准而非仅仅依赖最终答案的准确性,来评估金融研究智能体完整且可审计的推导工作流。

原作者: Alex Wang, Georg Meinhardt, Jacob Katz, Joseph H. Kim, Pratyush K. Chaudhary, Chase Blagden, Eric Xu

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Alex Wang, Georg Meinhardt, Jacob Katz, Joseph H. Kim, Pratyush K. Chaudhary, Chase Blagden, Eric Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位天才金融侦探来破解一个复杂的谜题:“这家公司报告的利润是真实的,还是他们在隐瞒什么?”

在过去,如果你问 AI 这个问题,你只会关心它给出的最终数字。如果 AI 说:“利润是 1000 万美元,”且这个数字是正确的,你会给它一颗金星。但在现实世界的金融领域,一颗金星是不够的。人类专家会追问:“你是怎么算出来的?你看的是正确的文档吗?你使用的统计时间段对吗?你知道如何针对软件成本进行调整吗?” 如果 AI 是通过猜测或幻觉得到了正确答案,这仍然是一种失败,因为其背后的“逻辑过程”是破碎的。

BIGFINANCEBENCH 是一个全新的测试设计,旨在防止 AI 通过“撞大运”式的猜测来骗取金星。以下是该测试的工作原理,通过简单的概念进行拆解:

1. “食谱” vs. “蛋糕”

大多数旧的 AI 测试就像只根据蛋糕的味道来评判面包师。如果蛋糕很甜,面包师就算合格。
BIGFINANCEBENCH 则不同。它根据整个食谱来评判面包师。

  • 他们选对了面粉吗(数据源)?
  • 他们准确测量了鸡蛋的数量吗(数据提取)?
  • 他们按照正确的顺序混合了原料吗(会计逻辑)?
  • 他们用正确的温度烘焙了吗(计算)?

该测试会给 AI 一份“清单”(称为评分细则/rubric),包含 3но 36,000 个微小的步骤。即使最终答案错误,AI 仍可以因正确完成了前面的步骤而获得分数。这就像是在给学生评分时,即便他们在最后的算术上出了点小错,也会因为展示了计算过程而给予部分分数。

2. “专家评审团”

这个测试中的问题并非由计算机或简单的测验编写,而是由真正的金融专家——那些曾在投资银行和私募股权领域工作过的人编写的。

  • 挑战: 他们编写的问题专门旨在让当前的 AI 栽跟头。这些问题需要查阅多份文件、做出明智的假设并进行复杂的数学运算。
  • 审计: 在一个问题被加入测试之前,会有另一位专家对其进行审核,以确保该问题只有一种正确的解题方式,就像裁判检查体育比赛中的判罚一样。

3. “计分卡”

当 AI 进行测试时,它不仅仅是给出一个答案。它必须展示其工作过程:

  1. 搜索: 它必须找到正确的财务报告(如 10-K 表格)。
  2. 提取: 它必须从这些报告中提取出特定的数字。
  3. 调整: 它必须应用会计规则(例如,意识到软件开发成本应如何进行不同的处理)。
  4. 计算: 它必须进行数学运算。

随后,两个独立的“评审” AI 会根据专家的清单对侦探的工作进行评分。它们不仅看最终的数字,还要看 AI 留下的面包屑痕迹(即推理路径)。

4. 他们的发现(结果)

研究人员测试了目前最智能的 10 个 AI 模型。情况如下:

  • 天花板很低: 即便是最优秀的 AI,也只能获得总可能分数的 59% 左右。这意味着 AI 的能力与人类金融分析师之间仍存在巨大的差距。
  • “幸运猜测”问题: 如果你只看最终答案,AI 的得分看起来会稍好一些。但当你观察具体的步骤(评分细则)时,得分就会下降。这证明了 AI 经常通过错误的原因得到正确答案,或者在过程中的关键环节出错。
  • 专业化差异: 没有哪一个 AI 在所有方面都是最强的。有的 AI 擅长查找文档但数学较差;有的 AI 擅长数学但找不对正确的来源。这就像是拥有一个专业团队,而不是一个能包揽一切的“超级英雄”。

核心结论

这篇论文认为,要让 AI 处理资金问题,我们不能只问:“答案对吗?” 我们必须问:“你能证明你是如何得出这个答案的吗?”

BIGFINANCEBENCH 是一个强制要求 AI “展示作业”的工具。它向我们展示了,尽管 AI 正在进步,但在处理现实世界中杂乱且循序渐进的金融研究任务时,它仍然面临困难。这不仅仅关乎知道答案,更关乎理解答案背后的“故事”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →