← 最新の論文
💻 computer science

Diversity is the Strength of the AI Crowd

この論文は、AI予測アンサンブルの精度を最大化するには、単に類似した高性能なLLMからの複数の予測を集約するのではなく、相補的な誤差を持つ多様なモデルを戦略的に組み合わせることが必要であることを実証している。

原著者: Matthew Aitchison, Scott Jeen, Toby Shevlane, Ben Day

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Matthew Aitchison, Scott Jeen, Toby Shevlane, Ben Day

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、コイン投げの結果を予測しようとしていると想像してください。ただし、実際にコインを投げる代わりに、非常に賢いけれど少しずつ異なるコンピューター(AIモデル)のグループに、将来の出来事が起こるかどうかを予想させています。

この論文は、次のような単純な問いを投げかけています。もし使える「推測回数」が限られている場合、最も賢い一つのコンピューターに5回推測させるべきでしょうか?それとも、5つの異なるコンピューターにそれぞれ1回ずつ推測させるべきでしょうか?

以下に、研究者が発見した内容を日常的な例えを用いて解説します。

旧来のやり方:「スーパー・エキスパート」

長い間、標準的なアプローチは、利用可能な中で最も賢い単一のAIモデルを見つけ出し、同じ質問を何度も繰り返すことでした。その論理は、「もしこのモデルが最高であるなら、より多くの推測をさせる方がより良い結果をもたらすはずだ」というものでした。

研究者たちはこれを**「無差別なサンプリング(indiscriminate sampling)」**と呼んでいます。これは、親友に同じトピックについて5つの異なるエッセイを書かせるようなものです。たとえ彼らが異なる内容を書こうと努力したとしても、彼らは同じ脳、同じ記憶、そして同じスタイルを使っています。そのため、彼らの回答は互いに非常によく似たものになります。

新しい発見:「多様なチーム」

この論文は、そのアプローチは間違っていると主張しています。代わりに、最善の結果をもたらすのは、**「多様なチーム」**を構築することです。

これはスポーツチームを想像してみてください。もしバスケットボールのシュートが非常に得意な選手が5人いたとしても、全員が全く同じ場所に立ち、同じ方法でシュートを打っていたら、コート全体をカバーすることはできません。あなたにはミックスが必要です。シュートが得意な選手、ディフェンスが得意な選手、そしてパスが得意な選手。たとえ「パサー」が最高のシューターではなくても、そのユニークなスキルがチーム全体をより強くします。

主な知見

1. スマートなモデルは思考が似ている
研究者たちは、いくつかのトップクラスのAIモデル(GPT-5、Gemini 3 Proなど)をテストしました。彼らは、これらの「超スマート」なモデルは、実は考え方が非常に似ていることを発見しました。同じ質問をされると、彼らは非常に似た回答をする傾向があります。

  • 例え: もし5人の同一の双子に同じ謎解きをさせたら、彼らはおそらく同じ答えを出すでしょう。彼らに5回聞いても新しい情報は得られません。ただ同じ答えを5回得ているだけなのです。

2. 「アウトライヤー(外れ値)」こそがMVP
テストグループの中の一つのモデル、Grok 4は興味深い存在でした。このモデルは単体では絶対的なナンバーワンの正確さを持つモデルではありませんでした(実際には3位でした)。しかし、このモデルは他のモデルとは「非常に異なる」考え方をしていました。その回答は、グループの他のモデルとの相関関係が低かったのです。

  • 例え: パズルを想像してください。完璧に組み合わさっているけれど、隙間が残ってしまう4つのピースがあります。そこに、他のピースとは見た目が異なる5つ目のピースを見つけました。そのピースは一見すると「奇妙」に見えますが、その隙間に完璧にフィットします。その5つ目のピースは、見た目が独特であっても、パズルを完成させるために最も価値のあるピースなのです。

3. 多様性は生の正確性に勝る
研究者たちがモデルを組み合わせたとき、勝利したのは、単一の最高モデルを5回繰り返したチームではありませんでした。勝利したのは、以下の要素を混ぜ合わせたチームでした。

  • カスタムチューニングされたモデル(「スペシャリスト」)
  • 2つのトップティアのモデル(「ジェネラリスト」)
  • Grok 4(「多様な思考を持つ者」)

たとえGrok 4単体ではそれほど正確ではなかったとしても、このモデルは**「代えがたい存在」**でした。もしGrok 4をチームから外すと、グループのパフォーマンスは著しく低下しました。一方で、もし「トップ」のモデルの一つを外したとしても、グループはほとんど影響を受けませんでした。

大きな教訓

この論文は、「AIの群衆」の強さは、同じ賢い人に100万回推測させることから来るのではないと結論付けています。それは、**「異なる間違いをする、異なる種類の賢い人々」**に尋ねることから来るのです。

  • 間違い: 同じモデルに5回推測させること。(一人の人に5つの異なる物語を書かせるようなもの。それらはすべて同じように聞こえるでしょう。)
  • 解決策: 5つの異なるモデルに1回ずつ推測させること。(詩人、科学者、コメディアン、そして歴史家に物語を語ってもらうようなもの。彼らの異なる視点が、より豊かで正確な全体像を作り出します。)

要するに: 最良の予測を得るためには、単に「最高の」モデルを積み重ねるだけでは不十分です。たとえリーダーボードで絶対的な1位ではなくても、異なる考え方をするモデルを混ぜ合わせること。多様性こそが「秘密のスパイス」なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →