← 最新の論文
💰 quantitative finance

Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents

本論文は、信頼不要なスマートコントラクトと適切なスコアリング則を用いて現実世界の予測市場における AI 予測エージェントを評価し、過学習やデータ汚染を防止しながら予測精度を厳密に測定する、許可不要なオンチェーン・ベンチマークである「Foresight Arena」を紹介する。

原著者: Maksym Nechepurenko, Pavel Shuvalov

公開日 2026-05-04
📖 1 分で読めます☕ さくっと読める

原著者: Maksym Nechepurenko, Pavel Shuvalov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大なデジタル競技場で、AI の「水晶玉」が未来を予見する競争を想像してみてください。この論文は、人工知能が現実世界の出来事を本当に予測できるのか、それとも単に推測しているだけなのかを検証する新しい方法、「Foresight Arena」を紹介しています。

仕組みを簡単な比喩を使って解説します。

1. 課題:なぜ従来のテストは欠陥があったのか

以前、AI 予言者のテストには 3 つの大きな穴がありました。

  • 「カンニングペーパー」問題: 従来のテストは静的な質問(固定されたクイズ)を使用していました。AI モデルは訓練中に答えを見ていた可能性があり、実際に「予測」しているのではなく、単に「記憶」しているだけでした。
  • 「審判」問題: ほとんどのテストは、スコアを記録するために人間や中央集権的な企業に依存していました。その審判が偏見を持っていたり、ハッキングされたりすれば、結果は偽物になります。
  • 「トレーダー対予言者」問題: 一部のテストでは、AI が出来事への賭けでいくら稼いだかを測定していました。しかし、お金を稼ぐことは単に正解することだけでなく、いつ賭けをし、どの程度のリスクを取ったかにかかっています。AI が未来の予測が下手でも、幸運なギャンブラーとしてお金を稼ぐことは可能です。

2. 解決策:信頼不要なデジタル競技場

Foresight Arena は、ブロックチェーン(公開され、変更不可能なデジタル台帳)上にテストを構築することでこれを解決します。

  • 「コミット・リベール」ゲーム: 誰にも先に見られる前に、自分の予想を紙に書き、封筒に入れて密封し、テーブルに置くというポーカーのようなゲームを想像してください。全員が予想を密封してから、封筒を開けます。これにより、AI エージェントが他の人の予想を先に覗いて不正をするのを防ぎます。
  • 「人間審判不在」ルール: 結果は人間によって決定されません。公共の分散型システム(Polymarket/Gnosis)から自動的に読み取られます。出来事が発生すれば、ブロックチェーンがそれを認識します。事後に誰かがスコアを変更することはできません。
  • 「自由参加」ルール: 誰でも(またはどの AI でも)、許可を求めずに参加できます。

3. スコアカード:「真実」対「運」の測定

金額を数える代わりに、この競技場はブライアースコアと呼ばれる特別な数学的数式を使用します。

  • 比喩: 天気予報士を想像してください。「90% の確率で雨が降る」と予報し、実際に雨が降れば良いスコアになります。90% と予報して晴れれば悪いスコアです。このスコアは、その人の自信が現実とどの程度近かったかを測定します。
  • 「アルファスコア」(優位性): これが論文の秘密の武器です。単に「正解でしたか?」と問うのではなく、**「あなたは群衆よりもより正解していましたか?」**と問います。
    • スポーツの勝者を予想する 1,000 人の群衆を想像してください。「市場コンセンサス」とは、その群衆の平均的な予想です。
    • AI が群衆と同じ予想をした場合、そのスコアはゼロになります。
    • AI が群衆とは異なる予想をし、かつ正解した場合、プラスのスコアが得られます。これは、AI が群衆が見落とした情報を発見したことを証明します。

4. 実験:勝者は誰か?

著者らは、5 つの一流 AI モデル(Anthropic、OpenAI、Google などの企業から提供されたもの)と「ランダム基準」(ランダムに数字を推測するコンピュータ)を含む 50 ラウンドの実験を行いました。

結果:

  • ランダム推測者: 彼らは惨敗し、テストが機能していることを証明しました。
  • トップ AI モデル: 3 つのモデル(Claude、GPT、Gemini)は群衆よりわずかに良い結果を出しましたが、その差は微小でした。上位 3 人のランナーがわずかな秒差でゴールするレースのようなものです。このテストは、誰が絶対的に最速かを確実に言うには長すぎませんでした。
  • 「コピーキャット」モデル: 2 つのモデル(Grok と GLM)は、群衆が何を考えているかを推測しようとしながら、いくつかの「ノイズ」(ランダムな誤り)を加えました。彼らは群衆を完璧にコピーするよりも悪い結果を出しました。これは重要な発見です:実際には賢くないのに、群衆とは少し違うことをしようとすると、スコアが低下するだけです。

5. 優れた予測の「解剖学」

この論文は、「マーフィー分解」(スコアを分解する高度な方法)を使用して、AI が勝つまたは負ける理由を分解しています。

  • 分解力(「鋭さ」): AI は起こりやすい出来事と起こりにくい出来事の区別ができますか?勝者は群衆よりも「鋭い」判断を持っていました。
  • 信頼性(「誠実さ」): AI が「70% の確率」と言ったとき、それは実際に 70% の頻度で起こりますか?勝者は自信について非常に誠実でした。
  • 教訓: 市場に勝つには、群衆よりも鋭くなければなりません。群衆が見落としているものを見ていなければ、単に「冷静」または「誠実」であるだけでは十分ではありません。

6. 大きな教訓

この論文は、AI 向けの永久的で変更不可能な評判システムを構築しました。

  • 過去には、AI 企業が「私たちの AI は最高の予言者だ!」と主張し、彼らが捏造したスプレッドシートを見せることができました。
  • 現在、Foresight Arena を通じて、AI はブロックチェーン上に公開され、偽造不可能な実績を持っています。あなたは自分で歴史を確認できます。

結論:
この論文は、現在の AI モデルはランダムな推測よりはるかに優れているが、現時点では人間の群衆の「集合的知恵」に非常に近いと結論付けています。AI が真に優れていることを証明するには、これらのテストを(50 ラウンドではなく)はるかに長い期間(数百ラウンド)続けて、微小な差が明確な勝者につながるかどうかを確認する必要があります。

この論文が主張していないこと:

  • これらの AI が利益のために株式市場を予測できるわけではないこと(それは別のゲームです)。
  • これらの AI が政府や病院を運営する準備ができているわけではないこと。
  • 現在の結果が最終的な結論であるとは主張していないこと。トップのパフォーマーを区別するには、テストをより長く実行する必要があると明確に述べています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →