长期以来,AI 非常擅长撰写通用报告,比如总结电影剧情或解释火山是如何运作的。但金融是一个完全不同的领域。它不仅仅是寻找事实,更在于将公司的收益、竞争对手的新产品以及政府政策的变化联系起来,从而预测未来。问题在于,大多数 AI 工具就像那些在考试结束前就偷看答案的学生。它们会不经意地“泄露”未来的信息,使它们看起来比实际更有智慧。为了解决这个问题,科学家们需要一种方法,在金融谜题上测试 AI,并严格锁定“未来”的信息,迫使 AI 依靠自身的推理能力而非靠运气猜对答案。
这就是名为 FinanceHarness 的新项目及其训练场 FinanceGym 登场的地方。把 FinanceGym 想象成一个专门为测试金融 AI 而设计的、高风险的电子游戏关卡。创造者们构建了一个巨大的、具备“防穿越”能力的图书馆,其中包含数百万篇文章,但带有一个神奇的转折:对于每一个提出的问题,图书馆都会锁上任何在特定日期之后发表的文章。如果 AI 试图窥探下个月的报告,门将紧闭。这确保了当 AI 做出预测时,它是在运用自己的大脑,而不是在抄袭一个未来的事实。
随后,研究人员开发了 FinanceHarness,它就像是一个专门的工具包和一名 AI 教练。它不是让 AI 在互联网上漫无目的地游荡,而是给它一套结构化的工作方式。它强制要求 AI 收集证据、核实来源,并撰写一份能精确引用信息出处的报告。这就像是给侦探一把放大镜、一个笔记本,以及一本严格的规则书,上面写着:“你必须证明你提出的每一个观点。”
当他们用这个全新的、高难度的“游戏”来测试目前最先进的 AI 模型时,结果令人惊讶。即使是那些在通用知识测试中表现优异的最强 AI 系统也显得力不从心。事实上,最好的模型也仅答对了大约 40% 的问题。这表明,虽然 AI 的阅读能力正在提升,但要让它像资深金融分析师那样,通过观察过去的数据来自信地预测未来,仍然非常困难。论文指出,仅仅拥有一个更大的“大脑”(更大的 AI 模型)是不够的;AI 需要正确的工具和严格的环境来学习如何像专业人士一样思考。
团队发现,他们的全新系统 FinanceHarness 帮助一个标准的开源 AI 模型从 25.3% 的得分跃升到了 32.4%。虽然这听起来可能只是个很小的数字,但在专家级的金融分析领域,这是一个显著的进步。这证明了通过给予 AI 正确的“束缚”(即结合了专业工具、严格时间限制和专家指导的体系),我们可以开始构建出不仅能阅读新闻,而且能真正理解复杂金融故事的机器。论文结论指出,虽然仍有很大的提升空间,因为即使是最优秀的系统也远非完美,但这个新框架为我们提供了一个清晰、公平的方式,来衡量我们究竟取得了多少实质性的进展。