BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation
本文介绍了 BizFinBench.v2,这是一个利用中国和美国股市真实用户数据构建的全面双语基准测试,用于评估大语言模型,并揭示了尽管 DeepSeek-R1 表现优异,但目前的尖端模型在实际业务需求方面仍显不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何成为一名股票交易员。多年来,我们一直在一个充满虚假模拟考试的巨大、安静的教室里测试这些机器人。机器人在这些测试中屡屡拿A+,于是我们便假设它们已经准备好管理真正的资金了。但在现实世界中,股票市场并不是一个安静的教室,而是一个混乱、嘈杂、快速移动的过山车,规则每秒钟都在发生变化。
这就是这篇论文的作者们所致力于解决的大问题:BizFinBench.v2。他们认为旧有的“教室测试”在欺骗我们。这些测试是基于并不符合真实金融复杂性的虚构数据构建的。因此,作者们建立了一个全新的**“实战健身房”**来测试这些机器人。
新的健身房:真实数据,真实赌注
这个新基准不再使用虚假问题,而是使用了来自中美两国股票市场中,真实用户在真实金融应用上提出的 28,860 个真实问题。这就像是从教科书测验切换到了筹码真金白银的实时高额扑克局。
这个健身房有两个主要区域:
- 离线区(The Offline Zone): 在这里,机器人需要回答关于复杂问题的难题,例如“为什么这只股票会崩盘?”或“分析这家公司的财报”。这里包含 8 种不同的任务类型,范围从识别异常数据错误到预测用户对市场的心理情绪。
- 在线区(The Online Zone): 这是最可怕的部分。机器人必须做出实时决策。它们必须在市场发生变化时实时预测股价,并根据实时市场数据每小时买卖一次,从而管理一个虚拟的资金组合。这就像是在蒙着眼睛开车,但车速高达每小时 100 英里,而且路况每秒都在变化。
结果:机器人仍在学习中
当作者将世界上最聪明的机器人放入这个真实的健身房时,结果……怎么说呢,有点令人震惊。
即使是超级明星机器人 GPT-5,也仅答对了 61.5% 的问题。这听起来在学校考试中还不错,但在真实的金融世界中,你需要达到 84.8% 的正确率才能被认为足够安全并投入使用。机器人仍然无法达到基本业务的要求。
在所有测试的机器人中,一个名为 DeepSeek-R1 的模型脱颖而出,但也有个代价。它是唯一一个在在线投资游戏中表现出“卓越投资效能”的模型,实际上实现了 +47.34% 的利润。然而,它也表现得有些鲁莽,一度亏损了高达 53% 的资金(即“最大回撤”)。这就像是一个赛车手赢得了比赛,却在登上领奖台的路上撞毁了赛车。虽然它在同类模型中表现最好,但它也只是唯一一个能接近中等水平传统交易策略的模型;其余的商业模型都未能跑赢大盘。
有趣的是,作者发现一些以“金融专家”闻名的机器人,其表现竟然比通用型机器人还要差。事实证明,如果机器人无法应对真实市场的混乱,仅仅通过金融教科书进行训练并不会让它成为更好的交易员。
“思考”陷阱
作者还尝试了一种叫做**“思维链”(Chain-of-Thought, CoT)的技巧,即告诉机器人要在回答之前“一步步思考”。你可能会觉得这会有帮助,对吧?错了。对于大多数机器人来说,这反而让它们变差了**。这就像是告诉一个紧张的学生,要过度分析数学题的每一个步骤,直到他把答案都给忘了!其中一个机器人 Claude-Sonnet-4,仅仅因为被迫“思考得太多”,其得分就从 39.5% 骤降到了 13.7%!
五大失误
通过观察机器人在哪里出错,作者发现了它们在现实世界中犯错的五种具体方式:
- 语义偏差(Semantic Deviation): 它们理解词汇,但忽略了含义。它们可能认为一家科技公司和一家半导体公司是一样的,仅仅因为两者都使用了“科技”这个词,却忽略了它们是完全不同的业务。
- 逻辑断裂(Logic Discontinuity): 它们在长篇叙述中会丢失思路。如果你要求它们追踪一段长时间内的因果链,它们就会感到困惑并掉链子。
- 多变量分析失效(Multivariate Analysis): 它们无法同时处理太多信息。当需要结合新闻、图表和用户情绪来做出决策时,它们会被信息淹没并选错因素。
- 高精度失真(High-Precision Distortion): 它们不擅长数学。在金融领域,微小的数值误差可能会损失数百万美元,而这些机器人经常计算错误。
- 时间顺序紊乱(Time-Order Disorder): 它们会搞混时间线。它们可能会认为某个事件发生在引起反应之前,或者反之亦然,从而完全颠倒了故事的逻辑。
总结
论文指出,虽然这些 AI 模型正在变得越来越聪明,但它们还没准备好成为你的私人理财顾问。它们的“考试成绩”与“现实表现”之间的差距巨大。作者并不是说 AI 没用,而是说我们需要停止在虚假的教室里测试它们,开始在真实的、混乱的健身房里测试它们。在它们能够稳定达到 84.8% 的准确率之前,我们应该非常谨慎地让它们处理我们的资金。
好消息是?作者正在分享他们的数据和他们构建的这个“健身房”,以便其他科学家可以协助训练机器人,使其能够应对真正的实战。但目前来看,这些机器人仍然只是学生,而非大师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。