← 最新论文
🤖 AI

FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction

本文介绍了 FinDeepIndicator,这是首个旨在评估深度研究智能体在金融指标构建四个端到端阶段表现的基准测试,研究表明,尽管这些智能体的表现优于配备标准搜索功能的大语言模型,但在现实金融分析场景中的数据检索和数值执行可靠性方面仍面临挑战。

原作者: Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解谜题的侦探,但你不能只是向证人询问“你看到了什么?”,而是必须独立完成整个工作。你必须弄清楚要问什么问题,在拥挤的城市中找到证人,倾听他们的陈述,将其记录下来,进行数学计算以验证其逻辑是否成立,最后向法官提交判决结果。这就是“深度研究”(Deep Research)智能体的世界。这些是超级聪明的计算机程序,旨在模仿人类研究员的行为:它们不仅仅是回答问题,而是外出、搜寻信息、拼凑碎片并从零开始解决复杂的问题。但问题在于:仅仅因为一台计算机能像人类一样交谈,并不意味着它能像人类一样行动。它可能完美掌握了一个词的定义,却在图书馆里找不到那本正确的书,或者在统计页数时算错了加法。

在金融领域,这是一件大事。金融指标就像是经济的计分板——这些数字告诉我们一家公司是否健康、股市是否紧张,或者一个国家是否正在增长。为了获取这些数字,你不能靠猜测;你必须挖掘多年的财务报告,为特定公司寻找精确的数值,并进行数据运算。科学家们一直在开发这些“深度研究”智能体来从事这项工作,希望它们能取代或协助人类分析师。但直到现在,还没有人真正测试过这些智能体是否真的能够处理从头到尾整个混乱的过程,还是说它们只是擅长装聪明,而在中间环节犯下愚蠢的错误。

于是,FinDeepIndicator 诞生了——这是由一个研究团队创建的一个全新的“考试”,专门用于测试这些数字侦探。把这个基准测试想象成一个专为金融智能体设计的巨大障碍赛。它不再只是问“公司 X 的利润是多少?”,而是强迫智能体完成四件截然不同的任务:首先,搞清楚所需的精确数学公式(例如,知道“利润率”意味着用利润除以销售额);第二,去互联网上寻找原始数据;第三,实际进行数学运算以得出中间结果;最后,给出正确的最终答案。研究人员利用 3,350 个不同的问题构建了这个赛道,涵盖了 234 种不同类型的金融指标,并提取了美国和中国 800 家真实公司在 10 年间的相关数据。

当他们让智能体通过这个障碍赛时,结果喜忧参半。智能体在第一步的表现出奇地好:理解规则。它们正确识别公式的频率超过 70%,这表明它们确实理解金融术词的含义。然而,一旦它们需要外出并寻找数据,表现便一落千丈。准确率直线下降。智能体难以找到正确的数据,经常抓错年份、抓错公司,或者完全遗漏了关键信息。这个“数据收集”步骤被证明是最大的瓶颈,导致了性能的最大跌幅。

即使是最聪明的智能体——那些比简单搜索引擎更擅长规划搜索路径和使用工具的智能体——最终给出正确答案的概率也仅为 40% 左右。研究人员发现,智能体在处理“宏观经济”指标(如通货膨胀率或失业率)时表现尤为糟糕,因为这些数据非常杂乱且来源多样;而在处理需要复杂滚动计算的“技术性”指标时,它们的表现更加吃力。有趣的是,智能体在处理美国市场数据时的表现略优于中国市场数据,这表明不同国家组织和报告数据的方式会产生巨大影响。

底线是,虽然这些 AI 智能体非常擅长掌握金融的“理论”,但在挖掘事实和进行数学运算的“实践”方面仍然很笨拙。论文指出,如果我们希望这些智能体在现实世界中真正发挥作用,我们就不能仅仅关注它们的聊天能力有多好,而应该开始着手修复它们寻找可靠数据并进行无误处理的能力。在此之前,它们就像是一位精通法律但总是在前往犯罪现场的路上迷路的优秀侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →