← 最新の論文
🤖 AI

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

本論文は、学習手法を介して多様な大規模言語モデルの予測を集約することで個々のモデルの性能を上回ることができることを実証すると同時に、学習データのカットオフによる汚染が能力評価を著しく歪めること、および、このようなアンサンブルリングの主な利点は複雑な非線形相互作用ではなく、多様なモデルの出力を線形結合することに起因することを明らかにしている。

原著者: Igor Douven

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Igor Douven

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

その部屋で最も賢い人が、実は決して最も賢いわけではない、そんな世界を想像してみてください。代わりに、テーブルを囲んで座っているグループ全体こそが真の天才なのです。この考え方は「群衆の知恵」として知られており、多くの異なる人々の推測を取り上げ、それらを平均化すると、その結果はしばしば、たった一人の優れた専門家の推測よりも正確になるというものです。鳥の群れを思い浮かべてください。一羽の鳥が全体像を見ているわけではありませんが、集まることで完璧にナビゲートしていきます。科学者たちは、これが人間に対して機能することを長い間知ってきました。しかし今、人工知能(AI)があらゆる場所に存在する中で、大きな疑問が生じています。この魔法のようなトリックは、ロボットに対しても通用するのでしょうか? もし多くの異なるAIモデルに将来の出来事の結果を推測させた場合、それらの答えを組み合わせた回答は、単一のAIよりも賢くなるのでしょうか? これは単なる楽しいゲームではありません。なぜなら、もしAIの群衆が機能するならば、人間の専門家チームを必要とせずに、天気から株式市場に至るまであらゆることを予測するためにそれらを利用できるからです。しかし、一つ落とし穴があります。AIモデルは過去のデータに基づいて学習しているため、もし彼らがすでに学習データの中に答えを見つけてしまっていたら、彼らは本当の意味で推測しているのではなく、記憶によって「カンニング」をしているに過ぎないのです。

この論文は、まさにその問いを掘り下げており、15種類の異なる大規模言語モデル(LLM)を、予測ゲームの出場者チームとして扱っています。研究者たちは、これらのAIに対し、スポーツチームが勝つか、あるいは政治家が当選するかといった賭けに似た、254個の実世界の質問に対する結果を推測するよう求めました。そして、グループが個々のAIを打ち負かせるかどうかを確認するために、さまざまな方法でAIの回答を組み合わせる試みを行いました。結果は、エキサイティングなニュースと、重大な警告ラベルが混ざり合ったものでした。

まず、良いニュースです。「群衆の知恵」は、正しく組み合わせればAIに対しても機能するようです。研究者たちは、単にすべてのAIの推測の平均を取ることは最善の戦略ではないことを見出しました。代わりに、彼らは回答をどのように混ぜ合わせるかを判断するために、巧妙なコンピュータプログラム(「学習済みアグリゲーター」)を使用しました。このスマートなミキサーは、単一のAIモデルよりも、また単純な平均よりも優れた仕事を行いました。興味深いことに、この研究は、この改善がAIミキサーによる複雑で魔法のような数学的処理によってもたらされたのではないことを示唆しています。そうではなく、それはモデルが「異なる種類の間違い」をする傾向を学習したことによって機能したのです。それは、ある選手は守備には長けているが攻撃には弱く、別の選手はその逆であることに気づいたスポーツコーチのようなものです。両者を組み合わせることで、あらゆる局面をカバーできるのです。研究では、単純な線形結合(基本的には重み付き平均)だけで最良の結果を得るのに十分であったことが示されており、AIの群衆の知恵の鍵は、複雑な相互作用ではなく、「エラーの多様性」にあることを示唆しています。

しかし、すべてを変えてしまうほどの巨大な「ただし書き」があります。研究者たちは、多くのAIモデルが密かにカンニングをしていることを発見しました。これらのモデルは、ある一定の日付までのインターネット上の膨大な塊に基づいて学習しているため、学習が終了する前に解決された質問の答えをしばしば「記憶」していたのです。これは「汚染(コンタミネーション)」と呼ばれます。研究者が、AIがすでに答えを知っている可能性のあるすべての質問を排除したところ、結果は劇的に変化しました。高価で豪華な「クラウド」モデルと、より小規模なローカルモデルとの間の大きな格差は、ほとんど消失しました。記憶に頼ることができなくなると、巨大なモデルははるかに印象が薄くなりました。実際、最高のAIの群衆であっても、人々がリアルタイムで結果に金を賭ける実際の「予測市場」と比較すると、依然として大幅に劣っていました。人間による市場は、人間がAIと同じ情報を参照していたとしても、AIの群衆よりも約2倍正確でした。

では、教訓は何でしょうか? AIの群衆は賢くなり得ますが、自分自身の記憶によって簡単に欺かれてしまいます。もしAIが本当に未来を予測する能力があるかどうかを知りたいのであれば、学習を終えた「後」に起きた事象についてテストしなければなりません。それまでは、AIの群衆の「知恵」とは、それが自ら導き出したものというよりも、単にすでに知っていることの反映に過ぎない可能性があるのです。この研究は、異なるモデルを混ぜ合わせることでより優れたAIチームを構築できる可能性を示唆していますが、私たちは、動的でリアルタイムの知能を持つ人間の群衆に匹敵するまでには、まだ長い道のりがあることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →