FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management
该论文介绍了 FinSkillBench,这是一个用于评估 AI 智能体在投资管理领域(涵盖投资组合构建、风险管理和基本面分析)表现的全面基准测试,并证明了获取经过策划的程序化技能能显著提升性能,而自生成的技能带来的收益微乎其微。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在投资管理这个高风险的世界里,成功不仅仅取决于对购买哪些股票有一个好的想法。它需要一个严谨的、循序渐进的过程,包括收集精确的数据、进行复杂的计算,并遵循管理资金流动的严格规则。想象一下这样一位金融分析师:他必须观察一个由三十家不同公司组成的投资组合,计算它们在市场突然崩盘时可能如何反应,然后重新组织持仓以保持在法律限制之内,而这一切都要仅使用过去某一特定日期的可用信息。这是人类专业人士的日常现实,但对于人工智能来说,这是一个新的前沿领域。虽然现代人工智能系统非常擅长撰写文本和回答一般性问题,但当被要求执行这些精确、规范的任务时,它们往往会显得力不从心。它们可能理解风险的概念,但在执行衡量风险所需的具体数学步骤,或遵循重新平衡投资组合所需的详细指令以确保不出错方面,经常会失败。
一组研究人员创造了一种新的方法,来测试人工智能代理是否真的能够处理这类工作。他们构建了一个专门的测试场,名为 FinSkillBench,该测试场向人工智能系统展示了 2,603 个不同的投资场景。这些场景涵盖了三个主要领域:构建股票投资组合、管理与这些股票相关的风险,以及分析单个公司的财务状况。研究人员不仅是让人工智能猜测答案;他们给了它一个特定的日期、一套原始数据和一个明确的目标,然后根据使用标准金融软件生成的已知正确解来检查结果。其目标是看人工智能是否能够像专业的分析师一样,在正确的时间检索正确的数据,并使用正确的工具来完成任务。
该研究测试了帮助人工智能的三种不同方式。在第一种场景中,人工智能必须完全独立地解决问题,没有任何帮助。在第二种场景中,研究人员为人工智能提供了一套“精选”的工具和书面指南。这些不仅仅是随机的文件;它们是精心准备的指令和计算机脚本,向人工智能展示了如何执行必要的计算以及如何正确使用可用工具。在第三种场景中,人工智能被要求在尝试任务之前,先为自己编写指令和工具,本质上是在尝试即时学习如何开展这项工作。
结果是清晰且具有决定性的。当人工智能获得预先制作的人类编写的指南和工具时,其表现得到了显著提升。在所有测试中,这些人工智能代理的平均得分从大约 37% 跳升至 53%。这种进步在需要大量数值计算的任务中最为显著,例如构建最优投资组合或识别潜在风险。在这些领域,配备了精选工具的人工智能能够解决以前完全无法解决的问题。研究人员发现,拥有这些可靠的、循序渐进的程序,与人工智能模型本身的选择同样重要。一个没有合适工具的强大人工智能模型往往会失败,而一个配备了合适工具的有能力的模型则会成功。
相比之下,人工智能即时自我教学的想法并不奏效。当代理被要求在解决问题之前先编写自己的指南和工具时,它们的表现几乎没有变化。它们花费了大量的时间和计算能力来编写这些指令,但它们创建的指令往往存在缺陷或不完整。研究表明,在单次尝试中,人工智能无法可靠地发明金融分析所需的复杂且精确的程序。仅仅知道如何编写代码是不够的;它需要被给予已经过测试和验证的代码。研究人员还使用另一个人工智能系统进行了同样的测试,以确保他们的发现不是特定设置下的偶然现象。第二个系统产生了相同的模式:预制工具有所帮助,而自制工具则不然。
这项工作表明,为了使人工智能在金融等严肃领域发挥作用,我们不能依赖模型在过程中自行摸索游戏规则。相反,我们必须构建这样的系统,让人工智能能够获得经过信任、经过人类验证的方法来进行艰苦的工作。研究结论指出,人工智能在投资管理领域的未来,不在于单纯追求更聪明模型,而在于设计更好的系统,将这些模型与可靠、可复用的技能相结合。研究人员已经公开了他们的测试和工具,希望通过关注如何为人工智能代理配备合适的资源以解决现实世界的问题,来推动该领域的发展。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。