Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents
本文介绍了 \textsc{InvestLogicBench},这是一个大规模的真实世界投资者决策基准测试,其结构化为“画像-事件-推理-决策-结果”轨迹,旨在证明当前的金融大语言模型表现出虽然文辞华丽但缺乏事实依据的推理能力,而这一点在传统的仅基于结果的评估中被忽视了,从而倡导为个性化后果驱动型智能体建立一种新的过程原生数据接口。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一座巨大的图书馆,里面收藏了所有关于金钱、股票和经济的书籍。你有一个超级聪明的机器人朋友,它读过了每一页。如果你问:“什么是通货膨胀?”或者“苹果公司的创始人是谁?”,你的机器人可以瞬间且完美地回答。这就是目前大多数被称为“大语言模型”(LLM)的计算机程序进行测试的方式:它们就像博学多才的百科全书冠军,能够背诵事实并解决教科书上的数学问题。但转折在于:成为一名百科全书冠军并不意味着你能玩转现实生活中的游戏。在现实世界中,投资不仅仅是记忆事实,而是要从嘈杂、混乱的新闻中倾听,分辨出什么才是真正重要的,根据你自己的性格和风险承受能力做出决策,然后观察你的判断是否正确。这就像是知道足球的规则与在对方球员试图铲断你时成功射门之间的区别。
这正是这篇新论文所探讨的问题。作者注意到,虽然这些人工智能机器人擅长回答测试题,但在被要求在实时市场中做出真实的投资决策时,它们往往表现得一塌糊 lurch(糟糕透顶)。他们创建了一种新的测试方式,不是问“你知道什么?”,而是问“你怎么思考?”。他们建立了一个特殊的游乐场,让我们观察 AI 如何将新闻事件、自身的推理、特定的行动以及最终的结果连接在一起。他们的重大发现是:那些在通用测试中得分最高的聪明 AI 机器人,在处理这种特定类型的思维时其实表现得很差。它们会被噪音搞糊涂,模仿其他人的想法,并且经常亏钱;而一些“不太聪明”的模型反而表现得更好。论文指出,要构建一个真正有用的金融机器人,我们不能只测试它的记忆力,而要开始测试它在混乱且不确定的世界中构建连贯计划的能力。
“聪明却无知”的悖论
研究人员设置了一个高风险的游戏,叫做“实盘交易竞技场”。想象一下一款电子游戏,不同的 AI 机器人被给予 10,000 美元的虚拟资金,并被要求在七周内对真实的美国市场进行股票交易。它们必须每小时做出自己的选择,像人类交易员一样对突发新闻做出反应。目标是观察 AI 的“通用智能”(它在标准测试中的表现)是否与其“交易智能”(它赚了多少钱)相匹配。
结果令人震惊。论文称之为“能力-表现悖论”。这就像是一个学生在每一场历史考试中都拿了 A+,却因为无法应对突如其来的阵雨而在经营柠檬水摊位时惨败。那些通用评分较高的 AI 模型,如 GPT-5 和 Claude-Sonnet-4.5,表现其实相当糟糕。其中一个模型 GPT-5 最终亏损了约 1.0%,比初始资金还少;另一个模型 Claude-Sonnet-4.5 几乎没有产生任何利润。它们都表现得不如仅仅坐着不动购买简单的指数基金(即 S&P 500 指数),这相当于“不做任何事”的策略。
具有讽刺意味的是,那些在通用测试中得分较低的模型在市场中表现得好得多。例如,DeepSeek-V3 将其 10,000 美元变成了超过 11,400 美元,不仅跑赢了大盘,也跑赢了那些“更聪明”的模型。这表明,擅长回答问题并不自动意味着在未来充满不确定性时擅长做出决策。
为什么“聪明”的机器人会失败?
作者深入研究了为什么高分模型会亏钱。他们发现了两个主要原因,称之为“共识偏差”和“推理碎片化”。
把共识偏差想象成随大流的羊群。当重大事件发生时,“聪明”的模型倾向于重复其他人已经在想的事情,因为这是它们在训练数据中最常看到的。它们没有勇气去寻找不同的角度或隐藏的机会。它们只会说:“哦,市场正在下跌,所以我应该卖出,”即使人类专家可能会看到低价买入的机会。
推理碎片化就像是在有人向你脸上撒纸屑时试图解开一个拼图。当市场充斥着大量冲突的新闻噪音时,这些模型会被淹没。它们无法将一条关于政府会议的新闻与特定的股价联系起来。它们无法构建一个清晰的故事,而是会感到困惑、草率下结论,或者做出自相矛盾的决策。它们可能看到一条关于科技公司的头条新闻,就立即买入,却忽略了该公司刚刚发布了糟糕的财报这一事实。
新的测试:INVESTLOGICBENCH2026
为了解决这个问题,团队构建了一个新的测试场,名为 INVESTLOGICBENCH2026。该基准测试不再只是要求 AI 回答一个问题,而是观察投资过程的整个链条。他们称之为 P→E→R→D→O 链:
- P (Person/人): 谁是投资者?他们的目标和恐惧是什么?
- E (Event/事件): 世界发生了什么?(例如:“美联储提高了利率。”)
- R (Reasoning/推理): 投资者如何将该事件与他们的目标联系起来?(例如:“利率上升意味着借贷成本增加,因此科技股可能会下跌。”)
- D (Decision/决策): 他们采取了什么行动?(例如:“卖出我的科技股。”)
- O (Outcome/结果): 是否奏效?(例如:“是的,股票下跌了,我节省了资金。”)
他们收集了来自 151 位真实专家(如著名的基金经理和金融影响力人士)的 20 多万条真实投资决策。他们详细拆解了这些人类是如何思考的,从他们阅读的新闻到他们做出的交易。然后,他们要求 AI 模型也这样做:观察新闻,像特定类型的投资者一样思考,做出决策,并观察逻辑是否成立。
结果:逻辑鸿沟
当他们在这种新的标准下测试 AI 模型时,结果非常明确。模型在“推理质量”上的得分很低。在 1 到 5 分的量表中,表现最好的模型(DeepSeek-V3)得分为 2.8,而表现最差的模型(GPT-5)仅为 1.8。它们难以区分重要新闻和随机噪音。它们经常做出与其自身推理不符或与其投资者画像不符的决策。
例如,在一个测试案例中,一位人类专家观察了关于政府停摆、就业报告和利率的一系列混合新闻,并正确地决定购买“安全”资产。然而,AI 模型却感到困惑。有些模型只关注可怕的头条新闻,有些忽略了最重要的部分,有些则做出了自相矛盾的论证。甚至有一个模型买入了与它正在阅读的新闻完全无关的股票。
论文得出结论,虽然 AI 有时可以产生盈利的交易(可能是由于运气或模仿模式),但它缺乏人类专家在应对不确定性时所使用的那种深刻、一致的逻辑。这些“聪明”的模型之所以失败,不是因为它们不知道事实,而是因为它们无法从混乱的现实世界中构建出一个连贯的故事。
这对未来意味着什么
这篇论文并不是说 AI 永远不会擅长投资。相反,它是在说我们需要改变测试和训练它们的方式。我们不能仅仅给它们更难的百科全书测试。我们需要教它们如何像战略家一样思考,如何过滤掉噪音,以及如何在情况变得可怕时依然坚持计划。通过使用这个新的基准测试,研究人员希望构建出不仅知识渊博,而且真正睿智的 AI 智能体——能够在这个混乱、不可预测的现实世界中做出个性化且符合逻辑的决策。可靠金融 AI 的旅程才刚刚开始,而这张新地图是迈向正确方向的第一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。