← 最新论文
💬 NLP

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

本文提出了 QuantCode-Bench 基准,旨在通过多阶段评估流程系统性地衡量大语言模型将英文描述转化为可执行 Backtrader 量化交易策略的能力,并指出当前模型的主要瓶颈在于交易逻辑的准确实现、专用 API 的调用以及与任务语义的对齐,而非语法正确性。

原作者: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 QuantCode-Bench 的新“考试”,专门用来测试人工智能(大语言模型)能不能把人类写的交易想法,变成真正能赚钱(或至少能跑通)的自动交易程序

为了让你更容易理解,我们可以把这件事想象成**“让 AI 当一名金融界的‘私人厨师’"**。

1. 核心挑战:不仅仅是“会做饭”

以前,我们测试 AI 写代码,就像测试它会不会切菜、会不会开火。只要菜做熟了(代码能运行),就算及格。

但在量化交易这个领域,要求高得多。这就好比:

  • 普通编程考试:你给 AI 一个菜谱(比如“做番茄炒蛋”),它只要能把番茄和鸡蛋炒熟,就算满分。
  • QuantCode-Bench 考试:你给 AI 一个模糊的指令(比如“我想在番茄变红的时候加蛋,但蛋不能太老”),它不仅要把菜做熟(代码没报错),还要真的尝出味道(程序真的在历史数据上产生了买卖信号),而且必须完全符合你的口味(逻辑不能跑偏,不能炒成一盘番茄汤)。

如果 AI 炒了一盘完美的番茄炒蛋,但你让它炒的是“番茄蛋花汤”,那它虽然技术满分,但在交易任务里就是零分

2. 这个“考试”是怎么考的?(四步走)

为了公平地给 AI 打分,作者设计了一个四关闯关的机制,只有全部通过才算“通关”:

  1. 第一关:语法检查(能不能下锅?)

    • 代码写得对不对?有没有拼写错误?就像检查厨师有没有把刀拿反了。
    • 现状:现在的顶级 AI 几乎都能过这一关,就像现在的厨师都会拿刀。
  2. 第二关:模拟回测(能不能开火?)

    • 把代码放进“模拟厨房”(Backtrader 框架),用过去的历史数据跑一遍。程序会不会崩溃?会不会报错?
    • 现状:很多 AI 在这里翻车,代码虽然没语法错误,但一跑就崩。
  3. 第三关:产生信号(有没有菜出锅?)

    • 这是最关键的!程序跑通了,但有没有真的产生“买入”或“卖出”的动作
    • 比喻:就像厨师炒了一锅菜,但全程没动勺子,或者火候太猛把菜烧焦了导致没熟。如果程序跑完了,但没产生任何交易信号,那就是白忙活
    • 现状:很多 AI 能写出代码,但设定的条件太苛刻(比如“等番茄变成紫色再炒”),导致历史上从未触发过交易。
  4. 第四关:语义裁判(味道对不对?)

    • 最后,请一位"AI 裁判”(另一个大模型)来尝一尝。它对比你的指令和 AI 做的菜,问:“这真的是你要的番茄炒蛋吗?还是它自作主张加了辣椒?”
    • 现状:这是最难的一关。AI 经常“偷换概念”,比如你让它用“红绿指标”交易,它可能偷偷换成了“均线策略”,虽然也能跑,但完全不是你要的。

3. 考试结果:AI 表现如何?

作者测试了各种最先进的大模型,发现了两个有趣的现象:

  • 单人模式(一次性通过):

    • 如果只给 AI 一次机会,不许改错,最好的模型也只能拿到 70%-76% 的分数。
    • 这说明:AI 已经学会了“拿刀切菜”(写代码),但还不太会“掌勺调味”(理解复杂的交易逻辑和 API 接口)。它们经常做出“看起来很美,但没法吃”的菜。
  • 多轮对话模式(允许改错):

    • 如果允许 AI 在犯错后,根据反馈(比如“你的代码报错了”或“你没产生交易”)进行修改,最多改 10 次,最好的模型分数能飙升到 95%-98%
    • 比喻:这就像给 AI 配了一个严厉的帮厨。帮厨告诉它:“火太大了!”AI 就调小火;“没放盐!”AI 就加盐。只要有人指导,它们就能把菜做得完美。

4. 最大的问题出在哪?

研究发现,AI 最大的短板不是“不会写代码”(语法错误很少),而是:

  1. 逻辑太死板:设定的交易条件太苛刻,导致历史上根本触发不了。
  2. 理解偏差:没听懂人话,把“在下跌时买入”理解成了“在上涨时买入”。
  3. API 使用不当:就像厨师不知道怎么用特定的锅具,导致程序跑不通。

5. 总结与启示

这篇论文告诉我们:

  • 写代码容易,写“能赚钱”的代码难:现在的 AI 很擅长写通用的代码,但在金融这种需要精准逻辑特定领域知识的领域,它们还需要“特训”。
  • 互动很重要:在现实工作中,我们不应该指望 AI 一次就写出完美的策略。给它一个**“试错 - 反馈 - 修正”**的循环,它的表现会好得多。
  • 不能只看代码能不能跑:如果只检查代码有没有报错,会误以为 AI 很厉害。必须检查它到底有没有按你的意图去交易

一句话总结
QuantCode-Bench 就像给 AI 厨师发了一张“米其林挑战卡”,告诉它们:别光会切菜,要能听懂顾客挑剔的口味,并且真的端出一盘符合要求的菜。现在的 AI 在“试错”环节表现很棒,但想让它“一次做对”,还得再练练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →