FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
本文介绍了用于评估金融 AI 智能体的基准测试 FinProBench,以及一种通过从专业交付物中推导评估标准来有效捕捉隐性标准,并在角色专业化金融任务中显著优于基于提示词的方法的“角色锚定准则构建”(RGRC)流水线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何成为一名专业人士,比如医生、律师或金融分析师。在人工智能的世界里,我们拥有这些能够聊天、编写代码和解决谜题的超级智能“智能体”。但我们如何知道它们是真的在做“好”工作,还是仅仅听起来像是在做?这就是人工智能评估领域的一个核心问题。长期以来,我们通过向 AI 提出具有对错答案的简单问题来测试它,比如多项选择题。但真正的专业工作并不是一场测验;它是一个混乱且复杂的项目,比如撰写一份 50 页的报告或构建一个财务模型。为了评判这类工作,我们需要一个“评分标准(rubric)”——一份详细的评分表,明确告知哪些作品是卓越的,哪些仅仅是及格的。问题在于,大多数这些评分表都是通过猜测 AI 应该做什么,或者通过观察 AI 自己的答案得出的,这就像是让一名学生来给自己的作业评分一样。我们需要一种方法,能够基于现实中人类从事工作的实际过程来构建这些评分表。
本文介绍了一种测试金融 AI 智能体的新方法,名为 FinProBench,以及一种用于构建评分表的巧妙方法,称为角色落地式评分标准构建法(Role-Grounded Rubric Construction, RGRC)。你可以把 RGRC 想象成一名侦探,它并不通过观察嫌疑人(AI)来推导规则,而是通过研究犯罪现场(真实的专业工作文档)来观察专家们究竟是如何操作的。研究人员收集了超过 1,700 份真实的文档——例如投资报告和合规性检查——这些都是由真实的金融专业人士编写的。他们利用这些现实世界的案例来教 AI 如何为其他 AI 的工作进行评分。
这里有一个他们发现的转折点:这取决于具体的工作内容。对于那些已经广为人知的常见日常金融任务(如编写标准的市场报告),仅仅要求 AI “做好工作”(使用提示词)的效果几乎与他们这种高级新方法不相上下。然而,对于那些规则隐藏较深或非常特殊的专业化、高难度角色(如小众的保险精算师),简单的“礼貌请求”法会彻底失败。在这些情况下,通过学习真实人类交付成果的 RGRC 方法成为了游戏规则的改变者,它能捕捉到 99.1% 的必要标准,而简单的提示法仅能捕捉到 78%。
当他们使用这些高质量的新型评分表,让 AI 智能体与人类专家进行实战对抗时,人类平均得分仍占优势,得分为 73.7 分(满分 100),而表现最好的 AI 智能体则在 70 分左右徘徊。但情况并非一边倒的碾压。AI 系统也有它们各自的“超能力”:有些擅长深入挖掘数学细节,而另一些则在格式排版方面表现出色。然而,人类则是最稳定的全能选手,在结构、数据准确性和合规性规则方面都做得非常到位。该论文表明,虽然 AI 正在变得非常优秀,但它仍需向专业人士的“默会知识(tacit knowledge)”(即那些不成文的秘密)学习,才能真正掌握复杂的职业工作。最棒的部分在于,由于他们为每个职位角色都建立了一个“主评分表”,因此可以将其复用于许多不同的任务,这节省了大量时间——比为每一项任务从头开始制作新的评分表快了约 6.7 倍。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。