← 最新の論文
💻 computer science

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

本論文は、進化戦略(ES)が、より広い解のカバー範囲と高いpass@kスコアを維持することで、RLの有効性を制限する出力分布の崩壊を回避し、発見領域における大規模言語モデルの事後学習において強化学習(RL)を凌駕することを実証している。

原著者: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

広大な霧に包まれた島で、隠された宝探しをしているところを想像してみてください。人工知能の世界において、大規模言語モデル(LLM)は、地図を読み解き、宝がどこにあるかを推測できる、非常に賢い探検家のような存在です。長い間、これらの探検家を訓練する最善の方法は、問題を示し、彼らに推測させ、そのたった一つの「最高の推測」が完璧だった場合にのみ報酬を与えるというものでした。この手法は、間違った答えには「間違い!」と怒鳴り、正解に対してのみ「完璧だ!」と褒める、非常に厳しいコーチのようなものです。問題は、このコーチがたった一つの完璧な答えを見つけることに執着しすぎるあまり、探検家が他の場所を探すのをやめてしまうことです。彼らは、他の宝が隠れているかもしれない霧の端の方を探索することをやめ、自分が正しいと考えている一点だけに集中してしまうのです。

しかし、もし宝がたった一つではなかったらどうでしょう?もし、数学の問題を解いたり、新しい科学的事実を発見したりする方法が、他にもたくさんあったとしたら?こうした「発見」の領域では、単に一つの完璧な推測を出すだけでは不十分であり、あらゆる正解を捕まえるための「広い網」が必要になります。ここで、「テスト時スケーリング(test-time scaling)」と呼ばれる新しい概念が登場します。モデルに一つの答えを求める代わりに、数十通り、あるいは数百通りの試行を生成させ、そのうちのどれかが正解であるかどうかを確認するのです。この論文は、私たちの「厳しいコーチ(RL)」が、探検家に広い網を投げる術を教えるのに適しているのか、それとも別の訓練方法の方が優れているのかを調査しています。研究者たちは、RLが探検家を特定の場所に非常に自信を持たせる一方で、「進化戦略(ES)」と呼ばれる別の手法が、探検家の好奇心を維持し、彷徨わせることで、もし霧の中に解決策が存在すれば、それを発見できる可能性をより高くすることを明らかにしました。


論文:最高の推測を超えて

この論文は、AIの訓練における難問に取り組んでいます。それは、AIモデルがいかにして「ただ一つの正解を当てるのが上手くなる」だけでなく、「あらゆる正解を見つけ出すために選択肢を広げておく」ことができるようにするか、という問題です。著者であるCognizant AI Labおよびテキサス大学オースティン校の研究者たちは、二つの訓練手法を比較しました。標準的な**強化学習(RL)**と、**進化戦略(ES)**と呼ばれる新しいアプローチです。

強化学習は、解答集を丸暗記してテスト勉強をする学生のようなものです。質問に対して正解すればご褒美をもらえますが、間違えれば何ももらえません。時間が経つにつれ、その学生はその特定の質問については達人になりますが、根本的な概念を理解することをやめてしまいます。AIの世界では、これは「分布崩壊(distribution collapse)」と呼ばれる現象を引き起こします。モデルは自分の「最高の推測」に集中しすぎるあまり、多様な回答を生成することを止めてしまうのです。それは、拍手をもらえる唯一の音符だけを弾き続け、曲全体を演奏する方法を忘れてしまったミュージシャンのようなものです。

一方、**進化戦略(ES)**は、より自然界のエコシステムに近い働きをします。ESは単一のモデルを訓練するのではなく、わずかに異なるバージョンのモデルからなる「集団(ポピュレーション)」を作り出します。自然界における遺伝子の突然変異のように、彼らの「脳(重み)」をランダムに微調整し、どのバージョンが最も優れたパフォーマンスを示すかを見極めます。決定的なのは、ESは単一の勝者を選んで残りを切り捨てるのではなく、集団全体から学び取るという点です。これにより、AIの「脳」は柔軟かつ多様性を保ち、解決策への多くの異なる経路を探索できるようになります。

研究者たちは、単純な算術から難解なオリンピアードレベルの課題まで、さまざまな規模のモデル(15億から320億パラメータ)を用いて、これらの手法を数学の問題でテストしました。成功の測定には、pass@kと呼ばれる指標を用いました。AIに問題に対する100通りの異なる回答を生成させると想像してください。pass@1は、「最初の回答は正しいか?」と問い、pass@kは、「100通りの回答のうち、少なくとも一つは正しいか?」と問いかけます。

研究結果は以下の通りです:

1. 「最高の推測」の罠
研究者がpass@1(単一の最高の推測)を見たとき、RLで訓練されたモデルはしばしば非常に優秀でした。彼らは鋭く、自信に満ちていました。しかし、研究者が推測の数(k)を2、8、16、あるいは128へと増やしていくと、RLモデルは壁に突き当たりました。彼らのパフォーマンスは向上を止めました。実際、一部の困難な問題では、RLモデルは多くのチャンスを与えられたとしても、未訓練の元のモデルよりも性能が悪化していました。RLモデルは思考があまりにも狭くなってしまったため、自分の「お気に入りの答え」とは少し異なる正解を見つけることができなくなっていたのです。

2. 多様性の力
対照的に、ESで訓練されたモデルは異なるパターンを示しました。彼らもまた、最初の推測を正解させる能力は高かったのですが、真の超能力は推測の数が増えるにつれて発揮されました。研究者がより多くのサンプル(最大128個)を求めるにつれ、ESモデルは新しい正解を次々と見つけ出し続けました。論文によれば、ESはテストされたすべてのモデルサイズおよび数学的ベンチマークにおいて、RLよりも一貫して高いpass@kスコアを達成しました。

3. なぜそうなるのか
著者らは、なぜこのようなことが起こるのかを掘り下げました。彼らは、RLの訓練がAIの知識を「剪定(せんてい)」してしまうことを発見しました。RLは、正解ではあるものの一般的ではない回答へと続く経路を削除してしまい、たとえAIが100回試みたとしても、一部の問題を解くことを事実上不可能にしてしまいます。しかし、ES法はAIの知識の「広がり」を維持します。ESは単に正解を学ぶのではなく、多くの扉を開けたままにしておくことを学びます。研究者がAIの「エントロピー」(回答の多様性の尺度)を調べたところ、RLモデルが失敗したとき、彼らは自信満々に間違っていました(低い多様性)。一方で、ESモデルが失敗したときは、依然として多様であり、不確実な状態でした。これは、彼らが依然として探索を続けており、より多くの時間や計算資源を与えられれば正解を見つける可能性が高いことを意味しています。

4. 実世界への影響
この論文は、新しいことを発見する必要がある領域(難しい数学の証明、コードの記述、あるいは新しい科学的事実の発見など)においては、一つの特定の推測に非常に長けているモデルよりも、幅広い正しい解決策を生成できるモデルの方が価値が高いことを示唆しています。ESを使用することで、私たちは「ローカル・トラップ(局所的な罠)」に陥る可能性を減らし、グローバルな解決策を見つけ出す可能性を高めることで、これらの発見領域においてより良い結果を得ることができます。

要約すると、この論文は、もしあなたが未知の世界における偉大な探検家を求めているのであれば、単に「その日の最高の推測者」になるよう訓練すべきではないと主張しています。むしろ、選択肢を広げ、少し彷徨い、どこに宝が隠されていてもそれを見つけられる準備ができているように訓練すべきなのです。進化戦略こそが、そのような冒険のための、より優れたコーチであると言えます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →