BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
本論文は、600 万件の市場記録に由来する 18,000 件を超える注釈付きタスクから構成される、自動化された定量的バックテストのための初の大規模ベンチマークである BacktestBench と、自然言語の戦略を再現可能なバックテストに変換し、23 の主要な LLM の能力を評価するように設計されたマルチエージェントフレームワークである AutoBacktest を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが富を得るための新しい料理のレシピを作りたいシェフだと想像してください。金融の世界において、この「料理」は取引戦略です。それを世界に提供したり(あるいはあなた自身の資金を投資したり)する前に、それをバックテストする必要があります。つまり、あなたのレシピを過去数年間の株式市場で何が起こったかという膨大な歴史データという巨大な鍋で調理し、実際に利益を生んだのか、それとも台所を燃やしてしまったのかを確認するのです。
従来のバックテストは、新しいレシピを試すたびにゼロから複雑なロボットを構築しようとするようなものでした。あなたはマスターメカニック(プログラマー)、データ司書(適切な歴史データを見つける)、そして金融の魔法使いをすべて兼ね備えている必要があります。それは遅く、高額であり、ごく一部の専門家しか行うことができませんでした。
BacktestBenchは、新しいプロジェクトとして次の問いを投げかけます:「人工知能(AI)は、そのマスターメカニック、司書、そして魔法使いをすべて兼ね備えることを学ぶことができるでしょうか?」
以下に、この論文が何を行ったかの簡単な内訳を示します:
1. 問題:金融の「ブラックボックス」
著者たちは、AI(特に大規模言語モデル、LLM)はコードの作成や会話には優れているが、自動化された定量的バックテストという具体的かつ高リスクな仕事を処理できるかどうかは、誰も実際にテストしていないと主張しています。
- 課題: コードを書くことだけではありません。AI は、「5 日間価格が上昇したら購入する」といった曖昧な人間の要求を理解し、その後、以下の処理を行う必要があります:
- データベースから正確な株式データを見つける。
- 不正(将来のデータの使用)を犯さずに「5 日間の上昇」というルールを計算するプログラムを作成する。
- シミュレーションを実行する。
- 最終スコアを計算する(「シャープレシオ」のようなもので、これは「私たちが取ったリスクに対してどれだけの利益を得たか」という洗練された表現です)。
AI がステップ 2 でわずかな間違いを犯せば、結果全体がゴミになります。
2. 解決策:巨大な「模擬試験」(BacktestBench)
AI がこれを行えるかどうかをテストするために、研究者たちはBacktestBenchを構築しました。これは、AI 向けの巨大で標準化された運転免許試験のようなものです。ただし、車を運転する代わりに、AI は取引戦略を運転します。
- データ: 彼らは中国の株式市場から600 万件以上の実際の市場記録(歴史の巨大な図書館のようなもの)を使用しました。
- 質問: 彼らは18,246 個の具体的なテスト問題を作成しました。これらは単純な数学の問題ではなく、以下のような複雑なシナリオです:
- 「この特定の株式における、この特定の戦略の利益を計算せよ。」
- 「どの株式がこの戦略で最も良いパフォーマンスを示したか?」
- 「どの設定(パラメータ)が最も機能するか?」
- 正解(グラウンドトゥルース): 彼らは自分自身で書いた実際のコードから質問を構築したため、正確な正解を知っています。これにより、AI を厳格に評価できます:正解か不正解か。
3. 被験者:「AutoBacktest」(AI チーム)
研究者たちは、すべての作業を 1 つの AI に任せたわけではありませんでした。彼らはAutoBacktestと呼ばれる 3 つの専門化された AI エージェントのチームを構築し、キッチンクルーのように連携して働かせました:
- サマライザー(翻訳者): あなたが与える乱雑な人間の文を受け取り、それをシステムが必要とする正確な金融「材料」(インジケーター)のリストに変換します。
- リトリーバー(司書): そのリストを受け取り、データベースにアクセスして必要な正確な生データ(「始値」や「出来高」など)を取得します。データ取得のためのクエリ(SQL)を作成します。
- コーダー(シェフ): データと指示を受け取り、シミュレーションを実行する Python コードを作成し、実行して最終数値を返します。
4. 結果:誰が試験に合格したか?
彼らは、この試験で23 種類の異なる AI モデル(オープンソースと有料の「クローズドソース」の両方)をテストしました。
- 勝者: トップのクローズドソースモデル(Gemini 3 Pro など)が最も良い結果を出しましたが、それでも正解率は約**67%**でした。これは、最も賢い AI でさえ、金融の複雑な論理に依然として苦労していることを意味します。
- 「論理のギャップ」: 多くの AI は、見た目上は正しい(構文上は正しい)コードを書くことは得意ですが、論理では失敗することがわかりました。例えば、AI は「ボラティリティ」(リスクの尺度)を計算するコードを書くかもしれませんが、金融的な定義を理解していないため、数学を間違えることがあります。
- 「小規模モデル」の苦戦: 小規模な AI モデル(少ない「脳細胞」またはパラメータを持つもの)は、数学が中心の部分でひどい結果でした。複雑な統計的推論を必要とする質問の場合、小規模モデルは完全に失敗することが多く、大規模モデルの方が良い成績を収めました。
- 秘密の武器: 標準化された短いコードの「カンニングペーパー」(「ボラティリティ=この特定の計算式」といった辞書のようなもの)を AI に与えることで、AI がはるかに優れたコードを書くことができることがわかりました。
5. 結論
この論文は、AI が金融研究の自動化において改善されつつあるものの、私たちはまだそこに到達していないと結論付けています。
- 現在の AI モデルは、素晴らしいエッセイを書くことができるが、数学の試験ではよく失敗する、優秀な学生のようなものです。
- BacktestBenchデータセットは、将来の金融 AI が単に数字を「幻覚」させるのではなく、実際に信頼できるものとなるよう、誰もが自分の AI モデルを訓練しテストするために利用可能になりました。
要約: この論文は、AI が株式市場のバックテストという複雑でエラーが発生しやすい世界を処理できることを証明するための厳格な「最終試験」を構築しました。結果は、AI は有望であるものの、私たちが現実のお金を信頼する前に、完璧に数学を行えるようになる必要があることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。