Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics
本文介绍了 MARKET-BENCH,这是一个通过要求大语言模型根据自然语言描述生成可执行的回测器,从而评估其在入门级量化交易任务上表现的基准测试,研究揭示了虽然目前的模型能够可靠地搭建基础交易架构,但在关于价格、库存和风险的鲁棒推理方面仍存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一支非常聪明、反应极快的机器人团队。这些机器人擅长读各种书、写故事以及回答常识问题。但现在,你想看看它们能否完成一项更难的任务:经营一个柠檬水摊位,而柠檬的价格每秒钟都在变化,你必须在不赔掉底裤的前提下赚到钱。
这篇论文介绍了一个名为 MARKET-BENCH 的新测试,旨在观察这些“机器人大脑”(被称为大语言模型或 LLM)是否真的具备运行简单交易业务所需的数学和逻辑能力。
以下是这项测试的工作原理,通过日常用语进行了拆解:
1. 测试内容:“造出机器,而不只是空谈它”
大多数测试会要求这些机器人描述如何进行交易。“如果价格上涨,就买入!”它们可能会这么说。
MARKET-BENCH 则不同。它说的是:“这里有一份食谱和一份原料清单。请编写出实际运行该业务的计算机代码。”
机器人必须编写出能够实现以下功能的代码:
- 追踪他们有多少钱。
- 根据特定规则买卖股票(如微软、可口可乐和百事可乐)。
- 精确计算他们赚了多少钱或赔了多少钱。
- 至关重要的一点是: 机器人的数学计算必须与“金标准”答案完全一致。如果机器人说他们赚了 100 美元,但金标准显示他们只赚了 95 美元,那么这个机器人就失败了。
2. 三个挑战(“关卡”)
测试分为三个难度等级,就像电子游戏关卡一样:
第一关:简单的日程表(微软)
- 任务: 在特定时间买入或卖出微软股票,就像工厂里的机械臂一样按部就班。
- 难点: 你必须完美地记录每一分钱和每一股股票。
- 结果: 大多数机器人都能造出机器(代码可以运行),但许多机器人在数学上出现了微小的误差,而这些误差累积起来会导致巨大的错误。有些机器人表现完美,而有些则错得离谱。
第二关:舞伴(可口可乐 vs 百事可乐)
- 任务: 这是一个“配对交易”游戏。你赌的是可口可乐和百事可乐之间的差异。如果可口可乐相对于百事可乐变得太贵了,你就买入百事并卖出可口,希望它们能恢复正常。
- 难点: 你必须同时操控两只股票,计算一个复杂的“价差”(两者之间的差距),并在两只股票之间管理你的总资金。
- 结果: 这变得更加困难。好几台机器人直接把机器搞坏了(代码无法运行)。有一个机器人(Qwen3 Max)造出的机器运行得非常完美,但它计算出的利润竟然是 4 亿美元,而实际应该是几百美元。这就像是一个机器人造了一辆行驶完美的汽车,却以为自己正开在月球上。
第三关:走钢丝(期权对冲)
- 任务: 这是最难的一关。你拥有一份针对微软股票的复杂保险单(期权),你必须不断买入或卖出股票,以保持风险中性。这就像是在走钢丝的同时还要玩杂耍。
- 难点: 时机就是一切。如果你晚了一瞬间,你就会亏钱。
- 结果: 这是最难的关卡。许多机器人甚至连让机器启动都做不到。那些能跑起来的机器人,其数学计算往往存在巨大误差。
3. 主要结论
论文发现了三个主要问题:
- 可靠性 vs 准确性: 有些机器人非常擅长遵循指令来构建代码(机器能启动),但在代码内部的数学计算方面却表现糟糕。另一些机器人擅长数学,却连机器都造不出来。
- “幻觉”问题: 在现实世界中,如果一个机器人认为自己赚了一百万美元,而实际上却亏了钱,你会破产的。论文表明,这些机器人经常会“幻觉”(凭空捏造)一些看起来很漂亮但完全错误的数字。
- 尚未准备好步入实战: 作者得出结论,目前这些机器人并不安全,不能作为交易的主要大脑。它们就像是非常聪明的实习生,可以起草一份报告,但在交给老板之前,需要人类去核对每一个数字。
总结
把这些大语言模型看作是非常有天赋但缺乏经验的学徒。它们可以编写代码来启动一门交易业务,但经常在会计核算上出错。在它们在数学和逻辑方面变得更好之前,你不能信任它们独立管理你的资金。
作者发布了这个测试(MARKET-BENCH)和一个公开的排行榜,以便其他科学家可以尝试构建更好的机器人,并观察谁在数学方面真正取得了进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。