← 最新论文
💻 computer science

WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance

本文介绍了 WorkstreamBench,这是一个新颖的基准测试,通过准确性、公式和格式的多维分类法评估大语言模型代理在端到端金融电子表格任务上的表现,揭示出尽管像 Claude 这样的顶尖模型能生成外观专业的输出,但当前的代理仍难以可靠地应对现实世界金融工作流所需的复杂性和质量标准。

原作者: Thomson Yen, Julian Poeltl, Harshith Srinivas Gear, Yilin Meng, Joshua Fan, Adam Shen, Yili Liu, Ali Bauyrzhan, Siri Du, Haoyang Liu, Daniel Guetta, Hongseok Namkoong

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomson Yen, Julian Poeltl, Harshith Srinivas Gear, Yilin Meng, Joshua Fan, Adam Shen, Yili Liu, Ali Bauyrzhan, Siri Du, Haoyang Liu, Daniel Guetta, Hongseok Namkoong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一名新助理,为贵公司构建一个复杂的财务模型。你不仅仅希望他们解决一道数学题;你希望他们从头开始构建一个完整的、专业级的电子表格,以便你可以将其交给你的老板、投资者和审计师。

本文介绍的 WorkstreamBench,本质上是一场针对 AI 智能体(智能计算机程序)的“期末考试”,旨在检验它们是否真的能胜任这项工作。

以下是作者所做工作的拆解,辅以简单的类比:

1. 问题所在:“乐高积木”与“城堡”

以往针对 AI 的测试,就像要求建筑工“把一块乐高积木放在另一块上面”或“找到红色的积木”。这些是简单、孤立的 tasks(例如回答问题或修改一个数字)。

但在现实的金融世界中,专业人士不仅仅移动一块积木。他们要建造整座城堡。他们需要一份电子表格,能够:

  • 连接三份不同的报表(利润表、资产负债表、现金流量表),这样当你修改一个数字时,所有内容都会自动更新。
  • 处理“假设分析”场景(例如,“如果销售额下降 10% 会怎样?”)。
  • 看起来专业、易于阅读,并且便于人类后续编辑。

作者意识到,现有的测试过于简单。它们没有测试 AI 是否能建造“整座城堡”,而只是测试它能否放置几块积木。

2. 解决方案:为 AI 打造的新“健身房”

作者创建了 WorkstreamBench,这是一个新的测试平台,充满了源自专业竞赛和培训课程的真实世界金融挑战。

他们不再仅仅检查最终数字是否正确(就像数学老师核对答案键那样),而是创建了一个三部分评分标准来评估 AI 工作质量,类似于人类老板审阅报告的方式:

  • 准确性(数学部分): 最终数字是否正确?AI 是否真正执行了所要求的场景分析?
  • 公式(逻辑部分): 引擎内部的构建是否精良?
    • 类比: 想象一辆汽车。糟糕的建筑师可能会用强力胶将引擎零件粘在一起(硬编码数字)。如果你以后需要更换引擎,就必须把车拆散。优秀的建筑师会使用螺栓和螺丝(动态公式),这样汽车易于维修和升级。AI 需要使用螺栓,而不是胶水。
    • 他们还检查逻辑是否可读。一个巨大且令人困惑的公式就像一团乱麻;而分步的公式则像一份清晰的说明书。
  • 格式(展示部分): 看起来是否专业?
    • 数字是否对齐?负数是否使用括号(金融标准)而不是负号?字体是否一致?如果电子表格看起来杂乱无章,即使数学计算正确,人类老板也可能会拒绝它。

3. 测试:谁参加了考试?

作者测试了许多当今最智能的 AI 智能体,包括 Claude、ChatGPT、Gemini 等版本。其中一些是“网页版”(在浏览器中聊天),另一些是"Excel 版”(嵌入在电子表格软件中的插件)。

4. 结果:“诚实”的成绩单

结果混合了“充满希望”和“尚未准备好投入实战”。

  • 领跑者: Claude Web 智能体表现最佳。它构建了最专业、最易于人类阅读和编辑的电子表格。
  • 差距: 即使是最好的 AI,得分也仅为 100 分中的 69 分 左右。
  • 困境: 随着任务难度增加(需要更长的计算链条),AI 的性能急剧下降。
    • 类比: 这就像一个学生能完美解决简单的加法题,但当被要求解决复杂的代数应用题时,却会感到困惑并犯错。
  • 常见错误:
    • 硬编码: AI 有时不会编写计算数字的公式,而是直接输入数字。这就像在支票上直接写下"100",而不是在框内填写"100"并让银行计算。如果输入发生变化,AI 的答案就会出错。
    • 格式混乱: AI 经常忘记对齐数字或使用错误的颜色,导致电子表格看起来不专业。
    • 放弃: 在极难的任务中,一些 AI 会留下整个电子表格部分空白,或者随意编造数字。

5. 结论

该论文得出结论,虽然 AI 智能体在简单任务上越来越出色,但它们尚未准备好能够独立可靠地构建专业级的财务模型

它们就像非常有才华的实习生,能够进行数学计算,但仍需要人类主管来检查格式、修复逻辑错误,并确保最终产品是客户真正信任的东西。技术已经存在,但在能够取代人类财务分析师之前,还需要更多的完善工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →