← 最新论文
💬 NLP

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

本文介绍了 BacktestBench,这是首个大规模自动化量化回测基准,包含源自 600 万条市场记录的 18,000 多个标注任务,并推出了 AutoBacktest,这是一个多智能体框架,旨在将自然语言策略转化为可复现的回测,并评估 23 种主流大语言模型的能力。

原作者: Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位厨师,想要创造一道能让你致富的新菜谱。在金融世界里,这道“菜”就是一个交易策略。在将其端给世界(或用你自己的资金投资)之前,你必须对其进行回测。这意味着你要用一锅巨大的历史数据(过去几年股市发生了什么)来“烹饪”你的菜谱,看看它是否真的能赚钱,还是会把厨房烧掉。

传统上,进行这种回测就像每次想测试新菜谱时,都要从零开始建造一个复杂的机器人。你需要同时是一位精通机械的大师(程序员)、一位数据图书管理员(寻找正确的历史“食材”)以及一位金融巫师。这既缓慢又昂贵,只有少数专家能做到。

BacktestBench 是一个新项目,它问道:“人工智能(AI)能否学会同时扮演那位机械大师、图书管理员和巫师?”

以下是该论文内容的简要分解:

1. 问题:金融的“黑盒”

作者认为,虽然人工智能(特别是大型语言模型或 LLM)在编写代码和聊天方面表现出色,但没有人真正测试过它是否能胜任自动化量化回测这一具体且高风险的工作。

  • 挑战:这不仅仅是编写代码。AI 必须理解模糊的人类请求,例如“当价格连续上涨 5 天时买入”,然后:
    1. 从数据库中找出完全正确的股票数据。
    2. 编写一个程序来计算“连续 5 天上涨”的规则,且不作弊(不使用未来数据)。
    3. 运行模拟。
    4. 计算最终得分(例如“夏普比率”,这是一种 fancy 的说法,意为“我们承担的风险带来了多少利润?”)。

如果 AI 在第 2 步犯了一个微小的错误,整个结果就会是一团糟。

2. 解决方案:一场巨大的“模拟考”(BacktestBench)

为了测试 AI 是否能做到这一点,研究人员构建了 BacktestBench。你可以将其想象为 AI 的驾照考试,只不过 AI 驾驶的不是汽车,而是交易策略。

  • 数据:他们使用了来自中国股市的超过 600 万条真实市场记录(就像一座巨大的历史图书馆)。
  • 问题:他们创建了 18,246 道具体的测试题。这些不是简单的数学题,而是复杂的场景,例如:
    • “计算该特定策略在这只特定股票上的利润。”
    • “哪只股票配合该策略表现最好?”
    • “哪个设置(参数)效果最佳?”
  • 真实答案:由于这些问题是基于他们自己编写的真实代码构建的,他们知道确切的正确答案。这使得他们能够严格地给 AI 打分:对或错。

3. 测试对象:"AutoBacktest"(AI 团队)

研究人员没有只让一个 AI 完成所有工作。他们组建了一个由三个专门的 AI 代理组成的团队,称为 AutoBacktest,它们像厨房团队一样协同工作:

  1. 总结器(翻译员):你给它一句杂乱的人类语言。它将这句话转化为系统所需的精确金融“食材”(指标)列表。
  2. 检索器(图书管理员):它拿到该列表,前往数据库获取所需的精确原始数据(如“开盘价”和“成交量”)。它编写查询语句(SQL)来获取数据。
  3. 编码员(厨师):它利用数据和指令,编写运行模拟的 Python 代码,执行它,并给出最终数字。

4. 结果:谁通过了考试?

他们在此考试中测试了 23 个不同的 AI 模型(包括开源和付费的“闭源”模型)。

  • 获胜者:顶级的闭源模型(如 Gemini 3 Pro)表现最好,但即使它们也只有约 67% 的正确率。这意味着即使是最聪明的人工智能,目前也难以应对金融领域的复杂逻辑。
  • “逻辑差距”:他们发现,许多 AI 擅长编写看起来正确的代码(语法),但在逻辑上却失败了。例如,AI 可能会编写计算“波动率”(一种风险衡量指标)的代码,但由于不理解金融定义,其数学计算却是错误的。
  • “小模型”的挣扎:较小的 AI 模型(“脑细胞”或参数较少)在涉及大量数学的部分表现糟糕。如果问题需要复杂的统计推理,小模型往往完全失败,而大模型的表现则更好。
  • 秘密武器:他们发现,给 AI 提供一份标准化短代码的“作弊小抄”(例如一本字典,说明“波动率 = 这个特定公式”),有助于 AI 编写出更好的代码。

5. 结论

该论文得出结论,虽然 AI 在自动化金融研究方面正变得更好,但我们尚未达到那个阶段

  • 当前的 AI 模型就像才华横溢的学生,能写出精彩的论文,但往往在数学考试中不及格。
  • BacktestBench 数据集现已向所有人开放,可用于训练和测试他们自己的 AI 模型,确保未来的金融 AI 真正可靠,而不仅仅是“幻觉”出数字。

简而言之:该论文为 AI 构建了一场严格的“期末考试”,以证明其能够处理股票回测这一复杂且易出错的世界。结果表明,虽然 AI 前景可期,但在我们信任它管理真金白银之前,它还需要学会如何完美地做数学题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →