Herculean: An Agentic Benchmark for Financial Intelligence
本文介绍了Herculean,这是首个面向金融智能的智能体基准,它利用标准化的基于MCP的环境,在交易、对冲、市场洞察和审计这四个复杂工作流中评估AI智能体,结果显示:尽管智能体在交易和市场洞察方面表现良好,但在对冲和审计所需的长程协调与结构化验证方面却存在显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在招聘一名新的财务助理。过去,你可能会通过提问来测试他们,例如:“苹果昨天的股价是多少?”或“总结这份财报。”如果答对了,你就会认为他们很聪明。
但本文的作者认为,答对单个问题并不等同于能够胜任实际工作。他们创建了一项名为HERCULEAN的新测试(名称取自“Herculean”一词,意指艰巨或庞大的任务),旨在考察 AI 智能体是否真能像专业财务专家那样工作,而不仅仅是回答琐事问题。
以下是他们研究发现的简要概述,辅以简单的类比:
他们给 AI 安排的四项“工作”
研究人员没有进行简单的测验,而是让 AI 执行四项截然不同的复杂任务,这些任务正是人类每天都在做的。你可以将它们想象为一家财务工厂中的四个不同班次:
交易员(交易):
- 工作内容: 连续三个月,每天 AI 都必须决定是买入、卖出还是持有某只特定股票。
- 难点: 这就像在下棋,但棋盘每天都会变化,且你无法预知未来。你必须做出一步棋,承受其后果,然后仅根据当下所知的信息做出下一步决策。
- 结果: AI 在这项任务上表现尚可。它能够做出决策,尽管并不总是能获利。
风险经理(对冲):
- 工作内容: 这就像走钢丝。AI 必须挑选两只走势相反(或至少不同)的股票,并押注于它们之间的价差,而非市场的涨跌。
- 难点: 这需要长期记住两种不同事物之间的关系。如果你在观察第二只股票时忘记了第一只股票的细节,你就会从钢丝上跌落。
- 结果: AI 在此处表现挣扎。它难以追踪两只资产之间的长期关系。
分析师(市场洞察):
- 工作内容: AI 必须阅读新闻、价格和报告,然后每周撰写一份专业的投资报告,推荐买入或卖出。
- 难点: 这不仅仅是寻找事实;而是要将它们编织成一个连贯的故事,让人类投资者能够理解。
- 结果: AI 在这项任务上出奇地出色。它撰写了流畅、结构严谨且看起来非常专业的报告。
审计员(审计):
- 工作内容: AI 必须扮演一名严格的会计师。它需要查看公司的官方财务文件,并根据复杂的政府规则检查数字计算是否正确。
- 难点: 这里没有“也许”或“看起来没问题”的余地。这是一个数学谜题,如果你漏掉一个小数点或误解了一条规则,整个结果就是错的。
- 结果: 这是最难的工作。AI 频繁失败。尽管它擅长撰写故事,但它往往无法遵循严格的规则或正确进行数学计算。
重大发现:“流利度”与“可靠性”
该论文发现 AI 的思维方式存在一个奇怪的差距。
- “讲故事者”问题: AI 非常擅长流利的生成。如果你让它写报告或解释趋势,它会听起来自信且聪明。这就像一个能写出优美文章却在数学考试中不及格的学生。
- “执行者”问题: AI 在结构化验证方面表现不佳。当工作需要严格的逻辑、根据规则核对事实,或长期记忆某种状态(如审计员或风险经理的工作)时,它就会崩溃。
“工具箱”类比
研究人员还测试了不同的“框架”(AI 运行的软件外壳)。他们发现,AI 的性能在很大程度上取决于如何允许其使用工具。
- “轻量级”智能体: 想象一个试图在脑海中完成所有事情而不做任何记录的 AI。它很容易陷入混乱,尤其是在长期任务中。
- “结构化”智能体: 想象一个被迫使用清单、记录每一步并在继续之前验证其工作的 AI。这个版本的性能要好得多。
教训: 关键不仅仅在于拥有一个更“聪明”的大脑(更好的 AI 模型),而在于拥有一个更好的系统来管理这个大脑。如果没有一个良好的系统来确保其不偏离轨道,一个聪明的大脑在高风险工作中仍会犯错。
结论
该论文得出结论,虽然 AI 在谈论金融方面越来越擅长,但它尚未准备好承担专业财务工作者的工作。它可以撰写报告(市场洞察),但在管理风险(对冲)或验证数学计算(审计)方面却力不从心。
研究人员构建 HERCULEAN 是为了向我们确切展示这些“肌肉”在哪里薄弱,以便开发者能够构建更好的系统,这些系统不仅听起来聪明,而且实际上能够可靠地工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。