← 最新论文
💬 NLP

Herculean: An Agentic Benchmark for Financial Intelligence

本文介绍了Herculean,这是首个面向金融智能的智能体基准,它利用标准化的基于MCP的环境,在交易、对冲、市场洞察和审计这四个复杂工作流中评估AI智能体,结果显示:尽管智能体在交易和市场洞察方面表现良好,但在对冲和审计所需的长程协调与结构化验证方面却存在显著困难。

原作者: Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yi
发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yilun Zhao, Youzhong Dong, Xiaoyu Wang, Yankai Chen, Ye Yuan, Qiyuan Zhang, Fuyuan Lyu, Haolun Wu, Yonghan Yang, Zichen Zhao, Yuyang Dai, Fan Zhang, Rania Elbadry, Ayesha Gull, Muhammad Usman Safder, Nuo Chen, Fengbin Zhu, Tianshi Cai, Zimu Wang, Polydoros Giannouris, Yuechen Jiang, Zhiwei Liu, Mohsinul Kabir, Yuyan Wang, Yixiang Zheng, Yangyang Yu, Weijin Liu, Wenbo Cao, Anke Xu, Peng Lu, Jerry Huang, Fengran Mo, Mingquan Lin, Prayag Tiwari, Yijia Zhao, Victor Gutierrez Basulto, Xiao-Yang Liu, Kaleb E Smith, Jiahuan Pei, Arman Cohan, Jimin Huang, Yuehua Tang, Alejandro Lopez-Lira, Xi Chen, Xue Liu, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一名新的财务助理。过去,你可能会通过提问来测试他们,例如:“苹果昨天的股价是多少?”或“总结这份财报。”如果答对了,你就会认为他们很聪明。

但本文的作者认为,答对单个问题并不等同于能够胜任实际工作。他们创建了一项名为HERCULEAN的新测试(名称取自“Herculean”一词,意指艰巨或庞大的任务),旨在考察 AI 智能体是否真能像专业财务专家那样工作,而不仅仅是回答琐事问题。

以下是他们研究发现的简要概述,辅以简单的类比:

他们给 AI 安排的四项“工作”

研究人员没有进行简单的测验,而是让 AI 执行四项截然不同的复杂任务,这些任务正是人类每天都在做的。你可以将它们想象为一家财务工厂中的四个不同班次:

  1. 交易员(交易):

    • 工作内容: 连续三个月,每天 AI 都必须决定是买入、卖出还是持有某只特定股票。
    • 难点: 这就像在下棋,但棋盘每天都会变化,且你无法预知未来。你必须做出一步棋,承受其后果,然后仅根据当下所知的信息做出下一步决策。
    • 结果: AI 在这项任务上表现尚可。它能够做出决策,尽管并不总是能获利。
  2. 风险经理(对冲):

    • 工作内容: 这就像走钢丝。AI 必须挑选两只走势相反(或至少不同)的股票,并押注于它们之间的价差,而非市场的涨跌。
    • 难点: 这需要长期记住两种不同事物之间的关系。如果你在观察第二只股票时忘记了第一只股票的细节,你就会从钢丝上跌落。
    • 结果: AI 在此处表现挣扎。它难以追踪两只资产之间的长期关系。
  3. 分析师(市场洞察):

    • 工作内容: AI 必须阅读新闻、价格和报告,然后每周撰写一份专业的投资报告,推荐买入或卖出。
    • 难点: 这不仅仅是寻找事实;而是要将它们编织成一个连贯的故事,让人类投资者能够理解。
    • 结果: AI 在这项任务上出奇地出色。它撰写了流畅、结构严谨且看起来非常专业的报告。
  4. 审计员(审计):

    • 工作内容: AI 必须扮演一名严格的会计师。它需要查看公司的官方财务文件,并根据复杂的政府规则检查数字计算是否正确。
    • 难点: 这里没有“也许”或“看起来没问题”的余地。这是一个数学谜题,如果你漏掉一个小数点或误解了一条规则,整个结果就是错的。
    • 结果: 这是最难的工作。AI 频繁失败。尽管它擅长撰写故事,但它往往无法遵循严格的规则或正确进行数学计算。

重大发现:“流利度”与“可靠性”

该论文发现 AI 的思维方式存在一个奇怪的差距。

  • “讲故事者”问题: AI 非常擅长流利的生成。如果你让它写报告或解释趋势,它会听起来自信且聪明。这就像一个能写出优美文章却在数学考试中不及格的学生。
  • “执行者”问题: AI 在结构化验证方面表现不佳。当工作需要严格的逻辑、根据规则核对事实,或长期记忆某种状态(如审计员或风险经理的工作)时,它就会崩溃。

“工具箱”类比

研究人员还测试了不同的“框架”(AI 运行的软件外壳)。他们发现,AI 的性能在很大程度上取决于如何允许其使用工具。

  • “轻量级”智能体: 想象一个试图在脑海中完成所有事情而不做任何记录的 AI。它很容易陷入混乱,尤其是在长期任务中。
  • “结构化”智能体: 想象一个被迫使用清单、记录每一步并在继续之前验证其工作的 AI。这个版本的性能要好得多。

教训: 关键不仅仅在于拥有一个更“聪明”的大脑(更好的 AI 模型),而在于拥有一个更好的系统来管理这个大脑。如果没有一个良好的系统来确保其不偏离轨道,一个聪明的大脑在高风险工作中仍会犯错。

结论

该论文得出结论,虽然 AI 在谈论金融方面越来越擅长,但它尚未准备好承担专业财务工作者的工作。它可以撰写报告(市场洞察),但在管理风险(对冲)或验证数学计算(审计)方面却力不从心。

研究人员构建 HERCULEAN 是为了向我们确切展示这些“肌肉”在哪里薄弱,以便开发者能够构建更好的系统,这些系统不仅听起来聪明,而且实际上能够可靠地工作

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →