巨大なデジタル競技場で、AI の「水晶玉」が未来を予見する競争を想像してみてください。この論文は、人工知能が現実世界の出来事を本当に予測できるのか、それとも単に推測しているだけなのかを検証する新しい方法、「Foresight Arena」を紹介しています。
仕組みを簡単な比喩を使って解説します。
1. 課題:なぜ従来のテストは欠陥があったのか
以前、AI 予言者のテストには 3 つの大きな穴がありました。
- 「カンニングペーパー」問題: 従来のテストは静的な質問(固定されたクイズ)を使用していました。AI モデルは訓練中に答えを見ていた可能性があり、実際に「予測」しているのではなく、単に「記憶」しているだけでした。
- 「審判」問題: ほとんどのテストは、スコアを記録するために人間や中央集権的な企業に依存していました。その審判が偏見を持っていたり、ハッキングされたりすれば、結果は偽物になります。
- 「トレーダー対予言者」問題: 一部のテストでは、AI が出来事への賭けでいくら稼いだかを測定していました。しかし、お金を稼ぐことは単に正解することだけでなく、いつ賭けをし、どの程度のリスクを取ったかにかかっています。AI が未来の予測が下手でも、幸運なギャンブラーとしてお金を稼ぐことは可能です。
2. 解決策:信頼不要なデジタル競技場
Foresight Arena は、ブロックチェーン(公開され、変更不可能なデジタル台帳)上にテストを構築することでこれを解決します。
- 「コミット・リベール」ゲーム: 誰にも先に見られる前に、自分の予想を紙に書き、封筒に入れて密封し、テーブルに置くというポーカーのようなゲームを想像してください。全員が予想を密封してから、封筒を開けます。これにより、AI エージェントが他の人の予想を先に覗いて不正をするのを防ぎます。
- 「人間審判不在」ルール: 結果は人間によって決定されません。公共の分散型システム(Polymarket/Gnosis)から自動的に読み取られます。出来事が発生すれば、ブロックチェーンがそれを認識します。事後に誰かがスコアを変更することはできません。
- 「自由参加」ルール: 誰でも(またはどの AI でも)、許可を求めずに参加できます。
3. スコアカード:「真実」対「運」の測定
金額を数える代わりに、この競技場はブライアースコアと呼ばれる特別な数学的数式を使用します。
- 比喩: 天気予報士を想像してください。「90% の確率で雨が降る」と予報し、実際に雨が降れば良いスコアになります。90% と予報して晴れれば悪いスコアです。このスコアは、その人の自信が現実とどの程度近かったかを測定します。
- 「アルファスコア」(優位性): これが論文の秘密の武器です。単に「正解でしたか?」と問うのではなく、**「あなたは群衆よりもより正解していましたか?」**と問います。
- スポーツの勝者を予想する 1,000 人の群衆を想像してください。「市場コンセンサス」とは、その群衆の平均的な予想です。
- AI が群衆と同じ予想をした場合、そのスコアはゼロになります。
- AI が群衆とは異なる予想をし、かつ正解した場合、プラスのスコアが得られます。これは、AI が群衆が見落とした情報を発見したことを証明します。
4. 実験:勝者は誰か?
著者らは、5 つの一流 AI モデル(Anthropic、OpenAI、Google などの企業から提供されたもの)と「ランダム基準」(ランダムに数字を推測するコンピュータ)を含む 50 ラウンドの実験を行いました。
結果:
- ランダム推測者: 彼らは惨敗し、テストが機能していることを証明しました。
- トップ AI モデル: 3 つのモデル(Claude、GPT、Gemini)は群衆よりわずかに良い結果を出しましたが、その差は微小でした。上位 3 人のランナーがわずかな秒差でゴールするレースのようなものです。このテストは、誰が絶対的に最速かを確実に言うには長すぎませんでした。
- 「コピーキャット」モデル: 2 つのモデル(Grok と GLM)は、群衆が何を考えているかを推測しようとしながら、いくつかの「ノイズ」(ランダムな誤り)を加えました。彼らは群衆を完璧にコピーするよりも悪い結果を出しました。これは重要な発見です:実際には賢くないのに、群衆とは少し違うことをしようとすると、スコアが低下するだけです。
5. 優れた予測の「解剖学」
この論文は、「マーフィー分解」(スコアを分解する高度な方法)を使用して、AI が勝つまたは負ける理由を分解しています。
- 分解力(「鋭さ」): AI は起こりやすい出来事と起こりにくい出来事の区別ができますか?勝者は群衆よりも「鋭い」判断を持っていました。
- 信頼性(「誠実さ」): AI が「70% の確率」と言ったとき、それは実際に 70% の頻度で起こりますか?勝者は自信について非常に誠実でした。
- 教訓: 市場に勝つには、群衆よりも鋭くなければなりません。群衆が見落としているものを見ていなければ、単に「冷静」または「誠実」であるだけでは十分ではありません。
6. 大きな教訓
この論文は、AI 向けの永久的で変更不可能な評判システムを構築しました。
- 過去には、AI 企業が「私たちの AI は最高の予言者だ!」と主張し、彼らが捏造したスプレッドシートを見せることができました。
- 現在、Foresight Arena を通じて、AI はブロックチェーン上に公開され、偽造不可能な実績を持っています。あなたは自分で歴史を確認できます。
結論:
この論文は、現在の AI モデルはランダムな推測よりはるかに優れているが、現時点では人間の群衆の「集合的知恵」に非常に近いと結論付けています。AI が真に優れていることを証明するには、これらのテストを(50 ラウンドではなく)はるかに長い期間(数百ラウンド)続けて、微小な差が明確な勝者につながるかどうかを確認する必要があります。
この論文が主張していないこと:
- これらの AI が利益のために株式市場を予測できるわけではないこと(それは別のゲームです)。
- これらの AI が政府や病院を運営する準備ができているわけではないこと。
- 現在の結果が最終的な結論であるとは主張していないこと。トップのパフォーマーを区別するには、テストをより長く実行する必要があると明確に述べています。
以下は、論文「Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents」の詳細な技術的サマリーです。
1. 問題提起
本論文は、AI の予測能力を評価する現在の手法における 3 つの根本的な限界を特定しています。
- データセット汚染: 静的なベンチマーク(固定された質問/解決策)は、トレーニングデータの漏洩に対して脆弱です。モデルはテストセットを事前学習中に暗記したため、単に正確に見えているに過ぎないという状況が発生します。
- 中央集権的な信頼: 既存のフレームワークは、予測の記録やスコア計算のために中央機関に依存しており、事後の改ざんや選択的な報告のリスクを生み出し、商業的な信頼を損なっています。
- 不適切な指標: 取引の損益(PnL)を通じてエージェントを評価することは、予測の精度と取引戦略(ポジションサイジング、タイミング、リスク許容度)を混同します。エージェントは、正確な予測にもかかわらず資金を失ったり、不運や過剰な賭けにより予測が不正確でも資金を得たりする可能性があります。
著者らは、厳密な評価には、過学習に耐性があり、**分散型(トラストレス)**であり、インセンティブ整合的なスコアリングルールに基づいた環境が必要であると主張しています。
2. 手法とシステム設計
Foresight Arena は、Polymarket から供給されるリアルワールドの二値予測市場において AI エージェントを評価するために、Polygon PoS 上に展開されたライブのパーミッションレスなオンチェーンベンチマークです。
コアアーキテクチャ
- コミット・リーveal プロトコル: エージェントは、競争相手の動きを観察するのを防ぐため、期限前に予測の暗号化ハッシュ(コミットフェーズ)を提出します。その後、実際の確率とソルトを後ほど開示(リーvealフェーズ)します。これにより、予測の独立性が保証されます。
- トラストレスな解決: 結果は、Polymarket が使用するのと同じオラクルである**Gnosis 条件付トークンフレームワーク(CTF)**を介して自動的に解決されます。人間のキュレーターが解決を操作することはできません。
- ガスレスな参加: エージェントは、EIP-712 で署名されたメッセージを使用してリレイヤーを介して対話するため、ネイティブトークン(POL)を保有することなく参加できます。
- 永続的な評判: スコアはERC-8004 評判レジストリに蓄積され、各エージェントにとって改ざん不可能で検証可能な実績記録が作成されます。
スコアリングフレームワーク
このシステムは、主に 2 つの指標を使用します。
- ブライアースコア: 確率的予測の精度を測定する適切なスコアリングルール(S=(p−x)2)です。エージェントが真の信念を報告するときにのみ、厳密に最小化されます。
- アルファスコア(α): エージェントが市場のコンセンサスに対して持つ優位性を測定する新しい指標です。
- 数式: α=Bbase−Bagent。ここで、Bbase は市場のミッドプライスのブライアースコアです。
- 正の α は、エージェントが市場の集合知よりも優れていることを示します。
統計的分析
著者らは、スコアリングルールに対する形式的な数学的処理を提供しています。
- マーフィー分解: ブライアースコアを不確実性(UNC)、信頼性(REL)、**解像度(RES)**に分解しています。
- α は、解像度の向上(市場よりも優れた識別力)と信頼性のギャップ(市場よりも優れた較正)の和であることが示されています。
- 検出力分析: アルファの分散に対する閉形式の式を導出し、特定の優位性(α∗)を検出するために必要なサンプルサイズを計算しています。
- 発見: 真の優位性 α∗=0.02 を検出するには、約 350 回の予測(7 市場の 50 ラウンド)が必要です。α∗=0.01 を検出するには、その約 4 倍の量が必要です。
3. 主な貢献
- オンチェーン検証可能性: すべての予測、コミット、スコアがパブリックブロックチェーンに記録され、第三者が主催者を信頼することなくエージェントの履歴を独立して再生および検証できる、初のベンチマークです。
- トラストレスな解決: 結果の解決に Gnosis CTF を使用することで、中央集権的な仲裁者の排除を実現しました。
- 形式的なアルファスコア分析: アルファが適切なスコアリングルールであることを示す厳密な統計的証明と、予測スキルを信頼性高く検出するための分散およびサンプルサイズ要件の導出。
- マーフィー分解の洞察: 「市場に勝つこと」と「較正されていること」が数学的に区別可能であることを実証し、特定の失敗モード(例:ノイズを伴う市場追従対真の較正不備)の診断を可能にしました。
- パーミッションレスなインフラ: オープンソースでガスレスなシステムであり、任意の Ethereum 互換アドレスが参加し、永続的なオンチェーン資格を構築できます。
4. 実験結果
著者らは、5 つの最先端大規模言語モデル(LLM)エージェントとランダムなベースラインを含む50 ラウンドのライブ評価を実施しました。
- 評価対象エージェント:
claude-opus-4-5, gpt-5-2, gemini-3-pro, grok-4-1, glm-4-7、およびランダムベースライン。
- 全体的なパフォーマンス:
- ランダムベースライン: すべての LLM よりも著しく低いパフォーマンス(αˉ≈−0.14)を示し、LLM が真の予測能力を有していることを確認しました。
- トップティア:
claude-opus-4-5, gpt-5-2, gemini-3-pro は、わずかな正のアルファスコア(+0.003 から +0.005)を達成しました。正値ではあるものの、50 ラウンドの期間では統計的に有意ではありませんでした(α∗≥0.02 が必要であるという検出力分析の予測と一致)。
- 低パフォーマンス:
grok-4-1 と glm-4-7 は負のアルファスコアを達成しました。マーフィー分解により、これらは較正エラーだけでなく、低い解像度(市場価格を追跡しながらノイズを追加する)に苦しんでいたことが明らかになりました。
- ドメイン特化:
- 暗号資産: LLM はここで最も強い優位性を示しました。これは、市場のミッドプライスよりも速く速報ニュースを統合できる能力に起因する可能性があります。
- 地政学: すべてのエージェントが市場を下回りました。これは、LLM が低頻度で曖昧性の高い政治的出来事に対処することに苦労していることを示唆しています。
- スポーツ/経済: 特定のモデルがドメインごとの強みを示すなど、結果は混合しました。
5. 意義と含意
- 予測と取引の分離: 損益(PnL)の代わりに適切なスコアリングルールを使用することで、Foresight Arena はモデルの世界に関する知識を取引戦略から分離します。これにより、PnL ベースの評価では見逃される失敗モード(例:ノイズを伴う市場追従)が明らかになります。
- 検証可能な AI 資格: このシステムは、オンチェーン資格という AI 評価の新しい基準を提案しています。これらは改ざん不可能で累積的なパフォーマンス記録であり、偽造できません。自律エージェントの商業的ライセンス付与と展開に不可欠です。
- 統計的誠実さ: 本論文は、現在の短期評価(例:50 ラウンド)がトップティアの最先端モデルを区別する検出力を欠いていることを強調しています。AI の予測能力を信頼性高く順位付けるには、長期的かつ継続的な評価が必要であることを確立しました。
- 設計ガイダンス: この分析は、エージェントが市場に勝つためには、単に市場価格を反復したり、過信したりするのではなく、新鮮な情報(解像度)と制御された大胆さを優先する必要があることを示唆しています。
結論として、Foresight Arena は、静的なデータセットや利益ベースの指標を超え、暗号学的検証と情報理論に基づいたシステムへと移行する、AI 予測を測定するための最初の堅牢で分散型かつ統計的に厳密なフレームワークを提供します。
毎週最高の quantitative finance 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録