✨ 要約🔬 技術概要
その部屋で最も賢い人が、実は決して最も賢いわけではない、そんな世界を想像してみてください。代わりに、テーブルを囲んで座っているグループ全体こそが真の天才なのです。この考え方は「群衆の知恵」として知られており、多くの異なる人々の推測を取り上げ、それらを平均化すると、その結果はしばしば、たった一人の優れた専門家の推測よりも正確になるというものです。鳥の群れを思い浮かべてください。一羽の鳥が全体像を見ているわけではありませんが、集まることで完璧にナビゲートしていきます。科学者たちは、これが人間に対して機能することを長い間知ってきました。しかし今、人工知能(AI)があらゆる場所に存在する中で、大きな疑問が生じています。この魔法のようなトリックは、ロボットに対しても通用するのでしょうか? もし多くの異なるAIモデルに将来の出来事の結果を推測させた場合、それらの答えを組み合わせた回答は、単一のAIよりも賢くなるのでしょうか? これは単なる楽しいゲームではありません。なぜなら、もしAIの群衆が機能するならば、人間の専門家チームを必要とせずに、天気から株式市場に至るまであらゆることを予測するためにそれらを利用できるからです。しかし、一つ落とし穴があります。AIモデルは過去のデータに基づいて学習しているため、もし彼らがすでに学習データの中に答えを見つけてしまっていたら、彼らは本当の意味で推測しているのではなく、記憶によって「カンニング」をしているに過ぎないのです。
この論文は、まさにその問いを掘り下げており、15種類の異なる大規模言語モデル(LLM)を、予測ゲームの出場者チームとして扱っています。研究者たちは、これらのAIに対し、スポーツチームが勝つか、あるいは政治家が当選するかといった賭けに似た、254個の実世界の質問に対する結果を推測するよう求めました。そして、グループが個々のAIを打ち負かせるかどうかを確認するために、さまざまな方法でAIの回答を組み合わせる試みを行いました。結果は、エキサイティングなニュースと、重大な警告ラベルが混ざり合ったものでした。
まず、良いニュースです。「群衆の知恵」は、正しく組み合わせればAIに対しても機能するようです。研究者たちは、単にすべてのAIの推測の平均を取ることは最善の戦略ではないことを見出しました。代わりに、彼らは回答をどのように混ぜ合わせるかを判断するために、巧妙なコンピュータプログラム(「学習済みアグリゲーター」)を使用しました。このスマートなミキサーは、単一のAIモデルよりも、また単純な平均よりも優れた仕事を行いました。興味深いことに、この研究は、この改善がAIミキサーによる複雑で魔法のような数学的処理によってもたらされたのではないことを示唆しています。そうではなく、それはモデルが「異なる種類の間違い」をする傾向を学習したことによって機能したのです。それは、ある選手は守備には長けているが攻撃には弱く、別の選手はその逆であることに気づいたスポーツコーチのようなものです。両者を組み合わせることで、あらゆる局面をカバーできるのです。研究では、単純な線形結合(基本的には重み付き平均)だけで最良の結果を得るのに十分であったことが示されており、AIの群衆の知恵の鍵は、複雑な相互作用ではなく、「エラーの多様性」にあることを示唆しています。
しかし、すべてを変えてしまうほどの巨大な「ただし書き」があります。研究者たちは、多くのAIモデルが密かにカンニングをしていることを発見しました。これらのモデルは、ある一定の日付までのインターネット上の膨大な塊に基づいて学習しているため、学習が終了する前に解決された質問の答えをしばしば「記憶」していたのです。これは「汚染(コンタミネーション)」と呼ばれます。研究者が、AIがすでに答えを知っている可能性のあるすべての質問を排除したところ、結果は劇的に変化しました。高価で豪華な「クラウド」モデルと、より小規模なローカルモデルとの間の大きな格差は、ほとんど消失しました。記憶に頼ることができなくなると、巨大なモデルははるかに印象が薄くなりました。実際、最高のAIの群衆であっても、人々がリアルタイムで結果に金を賭ける実際の「予測市場」と比較すると、依然として大幅に劣っていました。人間による市場は、人間がAIと同じ情報を参照していたとしても、AIの群衆よりも約2倍正確でした。
では、教訓は何でしょうか? AIの群衆は賢くなり得ますが、自分自身の記憶によって簡単に欺かれてしまいます。もしAIが本当に未来を予測する能力があるかどうかを知りたいのであれば、学習を終えた「後」に起きた事象についてテストしなければなりません。それまでは、AIの群衆の「知恵」とは、それが自ら導き出したものというよりも、単にすでに知っていることの反映に過ぎない可能性があるのです。この研究は、異なるモデルを混ぜ合わせることでより優れたAIチームを構築できる可能性を示唆していますが、私たちは、動的でリアルタイムの知能を持つ人間の群衆に匹敵するまでには、まだ長い道のりがあることを示しています。
技術要約:LLMの群衆の知恵
問題提起
「群衆の知恵」現象は、多様なグループからの判断を集計することで、多くの場合、個々の最良のメンバーよりも高い精度が得られるという仮説に基づいている。これは人間の予測者においては広く検証されているが、大規模言語モデル(LLM)が同様の集合知を示すかどうかは未解決の問いである。先行研究(例:Schoenegger et al., 2024)は、LLMの群衆が人間のパネルに匹敵することを示唆したが、それは単純な集計(中央値)に依存しており、集計による利益のメカニズムやデータ汚染の影響を系統的に調査したものではなかった。
解決済みの予測市場の質問を用いてLLMを評価する際の重大な課題は、学習カットオフによる汚染 である。もしモデルの学習データに、そのカットオフ日より前に解決された質問の結果が含まれている場合、モデルは推論するのではなく、答えを「記憶」している可能性があり、性能を人工的に膨張させ、モデル間の比較を歪めてしまう。本研究は、LLMの群衆が「群衆の知恵」の効果を示すかどうかを判断し、最適な集計戦略を特定し、汚染がモデルのランキングや能力差に与える影響を厳密に評価することを目的とする。
手法
データとモデル
データセット: 本研究では、Manifold Marketsから取得した254個の二値(YES/NO)予測市場の質問を利用した。
メインセット: 2024年6月から2026年3月の間に解決された208項目。
クリーン・サブセット: モデルのいずれの学習カットオフとも重複しないよう、2025年9月1日以降に解決された94項目。
モデル: 15種類のLLMから確率推定値を抽出した。これらは以下の構成となっている:
フロンティア・クラウド・モデル: 10モデル(例:Claude 4.6シリーズ、GPT-5シリーズ、Gemini Flash/Proなど)。
ローカル・モデル: 5つのより小規模なオープンウェイト・モデル(例:Mistral 7B、LLaMA 3.1 8B、Phi-4 14B)。
抽出(Elicitation): モデルに対し、インターネット検索を行わず、学習知識のみに基づいて各声明に対する確率推定値(0–1)を提示するようプロンプトを与えた。
集計方法
本研究では、4つの古典的な集計方法と2つの学習型アグリゲーターを評価した:
古典的な方法: 算術平均、幾何平均、調和平均、および対数オッズ平均(ロジット平均)。
学習型アグリゲーター:
ロジスティック回帰: 15のモデル入力を非一様な重みで学習する線形モデル。
多層パーセプトロン(MLP): 15次元の入力ベクトルを単一の確率にマッピングするように訓練された、2つの隠れ層(それぞれ64および32ユニット)を持つニューラルネットワーク。
評価プロトコル: 学習型アグリゲーターは、160個の非クリーン項目で訓練され、未知のデータでのテストを確実にするため、94個のクリーン・サブセットで評価された(時間的転移)。古典的な手法は、クリーン・サブセットで直接評価された。
分析手法
指標: 主要な指標はブリア・スコア(Brier score、低いほど良い)とし、二次的な指標として分類精度およびAUCを用いた。
記号回帰(Symbolic Regression): 訓練されたMLPに適用し、精度と複雑さのパレート最適解を探索しながら、MLPの集計戦略を近似する解釈可能な数学的公式を復元した。
汚染分析: 「カットオフ内」の項目と「カットオフ外」の項目のモデル性能を比較し、全データセットとクリーン・サブセットの間でのランクの安定性を分析した。
人間ベースライン: 市場の価格(最終的な市場価格および、各モデルの学習カットオフ時点での「カットオフ一致」価格の両方を使用)を用いて、人間(Manifold市場)の確率と比較した。これにより、情報の優位性を制御した。
主な結果
1. 集計性能
学習型 vs. 古典型: 両方の学習型アグリゲーター(ロジスティック回帰およびMLP)は、クリーン・サブセットにおいて、個々のモデルおよび古典的な集計方法を大幅に上回った。
ロジスティック回帰 は、算術平均(0.313)を約23%上回る最低のブリア・スコア(0.241)を達成した。
MLP は、わずかに高いブリア・スコア(0.264)を示したが、ランク順序の識別能(AUC 0.657 vs. 0.633)において優れていた。
利益の線形性: ロジスティック回帰とMLPがほぼ同等であったことは、集計による利益が、多様なモデル出力の複雑な非線形な相互作用ではなく、主に線形結合 を学習することから派生していることを示唆している。
記号回帰による知見: MLPから復元された最も単純で有用な公式は、2つの特定のモデル間の対照的な信号、すなわち σ ( p Gemini Pro − p Claude Haiku ) \sigma(p_{\text{Gemini Pro}} - p_{\text{Claude Haiku}}) σ ( p Gemini Pro − p Claude Haiku ) であった。この公式は、わずか2つのモデルを使用しながら、15モデルを用いたフルMLPの性能をほぼ再現しており、このことは、利益が少数の補完的なエラーパターンから生じていることを示している。
2. 汚染の影響
性能の膨張: モデルは、学習カットオフより前に解決された項目において、カットオフ後の項目よりも有意に高い精度を示した。精度の差は+0.05から+0.26に及んだ。
ランクの不安定性: 汚染はモデルのランキングを著しく歪めた。全データセットとクリーン・サブセットの間のスピアマンの順位相関係数は、わずか ρ = 0.532 \rho = 0.532 ρ = 0.532 であった。顕著な変動として、LLaMA 3.1 8Bがランク14から6へ上昇し、GPT-5.4 Miniが6から13へと下落したことが挙げられる。
クラウドとローカルの格差崩壊: フロンティア・クラウド・モデルと小規模なローカル・モデルの間の見かけ上の性能差は、(全データセットでは**35.8%であったが)クリーン・サブセットでは 8.9%**へと縮小した。これは、予測タスクにおけるフロンティア・モデルの優位性の多くが、推論能力ではなく、結果に関する知識によるものであったことを示唆している。
3. 人間の群衆との比較
LLM vs. 市場: 市場の情報優位性を制御した場合(カットオフ一致の市場価格を使用)、人間の群衆(Manifold市場)は、ブリア・スコアにおいてすべての個別のLLMに対して1.5倍から2.6倍の差で上回った。
メカニズム: 人間の優位性は、能動的なトレーダーが分散した知識を動的に集計し、リアルタイムで推定値を更新できる能力を反映している。これは、静的なスナップショットから推論するLLMには再現できない能力である。
先行研究との整合性: 本研究は、LLMの群衆は動的な予測市場には及ばないものの、静的な人間のパネル(Schoenegger et al., 2024によるもの)の性能には匹敵することを指摘しており、その差は(LLMの認知能力に対する根本的な失敗ではなく)構造的なもの(動的 vs. 静的集計)であることを強調している。
意義と主張
本論文は、主に3つの貢献を主張している:
LLMの群衆の知恵の検証: LLMの群衆が集計による「群衆の知恵」の効果を示すこと、すなわち、学習された集計が最良の個別モデルを大幅に上回ることを証明した。
メカニズムの特定: LLMにおける集計の利益が、人間と同様に、単純な性能の重み付けではなく、エラーパターンの多様性 に依存していることを示した。著者らは、多様なモデルの単純な線形結合が、この利益の大部分を捉えるのに十分であることを示している。
汚染という重大な交絡因子: 学習カットオフによる汚染は、フロンティア・モデルの性能を人工的に膨張させ、能力評価を歪める蔓延した問題であることを確立した。本研究は、「クリーン」な評価(すべてのモデルの学習カットオフ後に解決される質問を使用すること)が信頼できる評価のために不可欠であり、それによって、ローカル・モデルとフロンティア・モデルの間の格差がこれまで考えられていたよりもはるかに小さいことが明らかになることを主張している。
著者らは、LLMの群衆は集合的な知性を発揮できる一方で、その正確性は(動的な人間市場と比較して)その静的な性質によって構造的に制限されており、真の推論能力を理解するためには、汚染のない厳密な評価が必要であると結論づけている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×