Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics
本論文は、自然言語による記述から実行可能なバックテスターを生成させることで、大規模言語モデルを初歩的な計量取引タスクにおいて評価するベンチマークであるMARKET-BENCHを紹介するものであり、現在のモデルは基本的な取引インフラの足場を構築することは確実にできるものの、価格、在庫、およびリスクに関する堅牢な推論には依然として苦慮していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたの手元には、非常に賢く、非常に足の速いロボットのチームがあります。彼らは本を読み、物語を書き、トリビアの問題に答えるのが得意です。しかし今、あなたは彼らに、もっと難しいことに挑戦させようとしています。それは、レモンの価格が1秒ごとに変動するレモネードスタンドを経営し、損をして「服を失う(全財産を失う)」ことなく、いかにお金を稼ぐかという挑戦です。
この論文は、これらの「ロボットの脳」(大規模言語モデル、通称LLM)が、単純なトレーディングビジネスを運営するために必要な数学や論理を、実際に実行できるかどうかを検証するための新しいテスト、MARKET-BENCHを紹介しています。
このテストの仕組みを、日常的な言葉で分かりやすく説明します。
1. テストの内容:「ただ語るのではなく、機械を構築せよ」
ほとんどのテストは、ロボットにトレードについて「説明」することを求めます。「価格が上がったら、買いましょう!」といった具合です。
MARKET-BENCHは異なります。こう命じるのです。「これはレシピと材料のリストです。実際にビジネスを動かすためのコンピュータコードを書きなさい。」
ロボットは以下の機能を備えたコードを書かなければなりませんでした。
- 保有資金の追跡。
- 特定のルールに基づいた株式(マイクロソフト、コカ・コーラ、ペプシなど)の売買。
- 正確な利益または損失の計算。
- 極めて重要な点: ロボットの計算結果は、「ゴールドスタンダード(正解)」となる回答と完全に一致していなければなりません。もしロボットが「100ドル稼いだ」と言い、ゴールドスタンダードが「95ドルである」とした場合、そのロボットは不合格となります。
2. 3つのチャレンジ(「レベル」)
テストには、ビデオゲームのレベルのように、3つの難易度レベルがありました。
レベル1:単純なスケジュール(マイクロソフト)
- 仕事: マイクロソフトの株を、まるで工場の組み立てラインのロボットアームのように、特定のタイミングで売買すること。
- 落とし穴: 一円単位の端数まで、完璧に記録し続けなければなりません。
- 結果: ほとんどのロボットは「機械(コード)」を構築できましたが(コードは動作した)、多くのロボットが小さな計算ミスを犯し、それが積み重なって大きな間違いとなりました。完璧なロボットもいれば、大きく外れてしまうロボットもいました。
レベル2:ダンスパートナー(コカ・コーラ vs ペプシ)
- 仕事: これは「ペア・トレーディング」というゲームです。あなたはコカ・コーラとペプシの「差」に賭けます。もしコカ・コーラがペプシに対して高くなりすぎたら、ペプシを買い、コカ・コーラを売ります。そうすることで、両者の価格差が正常に戻ることを期待します。
- 落とし穴: 2つの銘柄を同時に操り、複雑な「スプレッド(価格差)」を計算し、両銘柄にわたる総資金を管理しなければなりません。
- 結果: これは非常に困難でした。いくつかのロボットは、機械自体を完全に壊してしまいました(コードが実行できなかった)。あるロボット(Qwen3 Max)は、完璧に動作する機械を構築しましたが、利益を(本来は数百ドルであるはずなのに)4億ドルと計算しました。それはまるで、車を完璧に走らせているのに、自分は月の上を走っていると思い込んでいるロボットのようなものでした。
レベル3:綱渡り(オプション・ヘッジ)
- 仕事: これが最も難しいレベルです。あなたはマイクロソフト株に関する複雑な保険(オプション)を持っており、リスクを中立に保つために、常に株を売買しなければなりません。これは、ジャグリングをしながら綱渡りをするようなものです。
- 落とし穴: タイミングがすべてです。ほんの一瞬でも遅れれば、損失が出ます。
- 結果: これが最も困難でした。多くのロボットが、機械を起動することすらできませんでした。起動できたものも、計算において巨大なエラーを抱えていました。
3. 大きな教訓
論文では、主に3つのことが明らかになりました。
- 信頼性 vs 正確性: コードを指示通りに作る能力(機械を起動させる能力)には長けていても、その中の計算がひどいロボットがいます。逆に、計算は得意だが、機械を起動することすらできないロボットもいます。
- 「ハルシネーション(幻覚)」の問題: 現実の世界では、もしロボットが「100万ドル稼いだ」と考えていても、実際には損をしていた場合、あなたは破産します。論文は、これらのロボットが、もっともらしく見えるが完全に間違っている数字を「捏造(ハルシネーション)」することがよくあることを示しています。
- 実戦投入にはまだ早い: 著者らは、現在のこれらのロボットは、トレーディングのメインの脳として使用するには安全ではないと結論づけています。彼らは、報告書のドラフトは書けるものの、上司に送る前に人間がすべての数字をチェックする必要がある、非常に優秀なインターンのような存在です。
まとめ
これらの大規模言語モデル(LLM)を、**「非常に有能だが経験不足の徒弟」**と考えてください。彼らはトレーディングビジネスを開始するためのコードを書くことはできますが、会計処理でミスをすることがよくあります。彼らが数学と論理において向上しない限り、彼らに自分のお金を任せて自律的に運用させることはできません。
著者らは、他の科学者たちがより優れたロボットを構築し、誰が本当に数学に強くなっているのかを競えるように、このテスト(MARKET-BENCH)と公開スコアボードをリリースしました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。