Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents
本論文は、現実世界の投資家の意思決定を「プロファイル・イベント・推論・決定・結果」のトレースとして構造化した大規模ベンチマークである\textsc{InvestLogicBench}を導入し、現在の金融特化型LLMが、従来の「結果のみ」の評価では見落とされてしまう、洗練されているが根拠の乏しい推論を行っていることを示し、それによって、パーソナライズされた結果重視のエージェントのための、新たなプロセスネイティブなデータインターフェースを提唱するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、お金、株式、経済に関するあらゆる本が詰まった巨大な図書館に足を踏み入れたところだと想像してください。あなたの隣には、すべてのページを読み終えた超スマートなロボットの友人がいます。あなたが「インフレとは何か?」や「アップルの創設者は誰か?」と尋ねれば、そのロボットは即座に、かつ完璧に答えることができます。これは、現在のほとんどのコンピュータプログラムである「大規模言語モデル(LLM)」がどのようにテストされているかを表しています。それらは、事実を暗記し、教科書的な数学の問題を解くことができる、博識なトリビア・チャンピオンのようなものです。しかし、ここにひねりがあります。トリビアのチャンピオンであることは、人生というゲームをプレイできることを意味しません。現実の世界において、投資とは、ニュースという混沌とした騒々しい群衆の声に耳を傾け、何が本当に重要なのかを見極め、自分自身の性格やリスク許容度に基づいて意思決定を行い、そして自分の判断が正しかったかどうかを見守ることなのです。それは、サッカーのルールを知っていることと、相手チームがタックルを仕掛けてくる中で実際にゴールを決めることの違いです。
これこそが、ある新しい論文が取り組んでいる問題です。著者たちは、これらのAIロボットはテストの質問に答えることには驚異的に優れている一方で、ライブ市場での実際の投資判断を求められると、惨めな失敗をすることが多いことに気づきました。彼らは、AIに「何を知っているか?」と問うのではなく、「どのように考えるか?」と問う、新しい方法でAIをテストする仕組みを作り上げました。彼らは、AIがニュースの出来事、自身の推論、特定の行動、そして最終的な結果の間で、どのように点と点をつなげているのかを観察できる特別な遊び場を構築しました。彼らの大きな発見は何でしょうか? それは、一般的なテストで最高スコアを獲得する最もスマートなAIロボットたちが、実はこの特定の種類の思考においては非常に稚拙であるということです。彼らはノイズに混乱し、他の誰もが考えていることを模倣してしまい、結果としてお金を失うことが多い一方で、「あまり賢くない」モデルの方が実際には優れた成果を出すことがありました。この論文は、真に有用な金融ロボットを構築するためには、記憶力をテストするのをやめ、混沌とした不確実な世界の中で一貫した計画を立てる能力をテストする必要があると示唆しています。
「スマートだが無知」というパラドックス
研究者たちは、「ライブ・トレーディング・アリーナ」と呼ばれる高額な賭けが行われるゲームを設定しました。ビデオゲームを想像してください。異なるAIボットに1万ドルの架空の資金を与え、米国の実際の市場で7週間にわたって株式を取引させます。彼らは、人間のトレーダーと同じように、最新のニュースに反応しながら、1時間ごとに独自の選択を行わなければなりません。目的は、AIの「一般的な知能(標準的なテストでの成績)」が、その「トレーディングの知能(どれだけ利益を上げたか)」と一致するかどうかを確認することでした。
結果は衝撃的でした。論文ではこれを「能力とパフォーマンスのパラドックス」と呼んでいます。それは、あらゆる歴史の試験でA+を取る生徒が、突然の雨風への対処ができず、レモネードスタンドの運営に惨敗するようなものです。GPT-5のような一般的なスコアが最も高いAIモデルは、実際には非常に低いパフォーマンスを示しました。例えば、GPT-5は開始時の資金より少ない金額となり、約1.0%の損失を出しました。もう一つのClaude-Sonnet-4.5は、ほとんど利益を上げることができませんでした。両者とも、単に座ってインデックスファンド(S&P 500)を購入するだけの「何もしない」戦略よりも悪い結果となりました。
皮肉なことに、一般的なテストでは低いスコアを持っていたモデルの方が、市場ではるかに良い成績を収めました。例えば、DeepSeek-V3は1万ドルを1万1,400ドル以上に増やし、市場や「よりスマートな」モデルを上回りました。これは、質問に答えるのが得意であることが、将来が不確実な状況での意思決定に優れていることを自動的に保証するわけではないことを示唆しています。
なぜ「スマートな」ボットは失敗するのか?
著者たちは、なぜ高スコアのモデルが資金を失っているのかを突き止めるために深く掘り下げました。彼らは、主に2つの理由を見つけ出し、それを「コンセンサス・バイアス(合意バイアス)」と「推論の断片化(Reasoning Fragmentation)」と呼んでいます。
コンセンサス・バイアスは、群れに従う羊のようなものです。大きな出来事が起こったとき、「スマートな」モデルは、トレーニングデータの中で最も頻繁に目にした内容に従い、周囲の誰もがすでに考えていることを繰り返す傾向があります。彼らには、異なる視点や隠れた機会を探る勇気がありません。彼らはただ、「あぁ、市場が下がっているから、売るべきだ」と言うだけです。たとえ人間の専門家なら、安く買うチャンスを見出す場面であってもです。
推論の断片化は、顔に紙吹雪を投げつけられながらパズルを解こうとしているようなものです。市場が多くの矛盾するニュースで騒がしくなると、これらのモデルは圧倒されてしまいます。彼らは、政府の会合に関するニュースと、特定の株価との間の点と点を結びつけることができません。明確なストーリーを構築する代わりに、混乱し、結論を急いだり、自分自身の中で矛盾する決定を下したりします。例えば、テック企業に関するヘッドラインを見て、その企業が直後に悪い決算を発表したという事実を無視して、即座にその株を買ってしまうといったことです。
新しいテスト:INVESTLOGICBENCH2026
これを解決するために、チームは INVESTLOGICBENCH2026 と呼ばれる新しいテスト場を構築しました。単にAIに質問に答えるよう求めるのではなく、このベンチマークは投資が行われるプロセス全体の連鎖を注視します。彼らはこれを P→E→R→D→O チェーンと呼んでいます。
- P (Person/人物): 投資家は誰か? その目標と恐れは何か?
- E (Event/出来事): 世界で何が起きたのか?(例:「FRBが金利を引き上げた」)
- R (Reasoning/推論): 投資家はその出来事をどのように自身の目標に結びつけるのか?(例:「金利の上昇は借入コストを高めるため、ハイテク株は下落する可能性がある」)
- D (Decision/決定): どのような行動をとるのか?(例:「ハイテク株を売却する」)
- O (Outcome/結果): それはうまくいったか?(例:「株価が下落したので、資産を守ることができた」)
彼らは、有名なファンドマネージャーや金融インフルエンサーなど、151人の実在の専門家による20万件以上の実際の投資判断を集めました。彼らは、人間がニュースからどのように考え、どのようにトレードを行ったかというプロセスを詳細に分解しました。そして、AIモデルにも同じことを行うよう求めました。つまり、ニュースを見て、特定のタイプの投資家として考え、決定を下し、そのロジックが成立しているかを確認させるのです。
結果:ロジックの溝
この新しい基準に対してAIモデルをテストしたところ、結果は明白でした。モデルの「推論の質」のスコアは非常に低かったのです。1から5のスケールにおいて、最も優れたパフォーマンスを示したモデル(DeepSeek-V3)のスコアは2.8であり、最も劣っていたモデル(GPT-5)はわずか1.8でした。彼らは、重要なニュースとランダムなノイズの区別をつけることに苦戦しました。彼らはしばしば、自身の推論や投資家のプロフィールと一致しない決定を下していました。
例えば、あるテストケースでは、人間の専門家は政府の閉鎖、雇用統計、金利に関する一連のニュースを見て、正しく「安全資産」を購入すると判断しました。しかし、AIモデルは混乱しました。あるモデルは恐ろしい見出しだけに集中し、別のモデルは最も重要な部分を無視し、また別のモデルは矛盾する議論を展開しました。あるモデルに至っては、読んでいるニュースとは全く無関係な銘柄を購入しました。
この論文は、AIが(おそらく運やパターンの模倣によって)時として利益の出るトレードを生成できることはあるものの、人間が不確実性を乗りこなすために用いる深く一貫したロジックを欠いていると結論付けています。「スマートな」モデルが失敗しているのは、知識がないからではなく、現実世界の混沌から一貫したストーリーを構築できないからです。
これが未来に意味すること
この論文は、AIが投資において決して成功しないと言っているわけではありません。そうではなく、私たちはAIのテスト方法と訓練方法を変える必要があると言っています。単に難しいトリビアのクイズを与え続けるだけでは不十分なのです。私たちは、戦略家のように考え、ノイズをフィルタリングし、状況が悪化しても計画を堅持する方法を教える必要があります。この新しいベンチマークを用いることで、研究者たちは、単に知識が豊富なだけでなく、真に「賢明」な——つまり、予測不能で複雑な現実世界において、パーソナライズされた論理的な決定を下すことができる——AIエージェントを構築したいと考えています。信頼できる金融AIへの旅はまだ始まったばかりであり、この新しい地図は、正しい方向への第一歩なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。