← 最新の論文
🤖 machine learning

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

本論文は、推論時のサンプリング多様性と RL による分布の鋭化との間の緊張関係を解決し、分布内および分布外タスクの両方において LLM の推論性能と安定性を向上させるために、多様性を促進する探索目的を iDPO や GRPO などの反復的ポストトレーニング手法に統合する新たな枠組みである探索駆動型最適化(EDO)を提案する。

原著者: Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。複雑な数学パズルを解くことを学んでいる、優れた学生(大規模言語モデル)がいます。あなたは彼らが問題解決の達人になることを望んでいます。

通常、これらの学生を訓練する際、強化学習と呼ばれる手法を使用します。これは、学生が唯一の最善の答えを見つけ出した場合のみ報酬を与える、厳格なコーチのようなものです。時間とともに、学生はその特定の経路を見つけることに非常に熟達します。しかし、ここに問題があります。彼らは探索を停止し、一つの解決方法しか知らない「型にはまった」状態に陥ります。その唯一の方法が失敗すれば、彼らには代替案がありません。

これは矛盾を生みます。非常に難しいパズルを解くためには、テスト時に**「自己一貫性(Self-Consistency)」*と呼ばれる手法をよく用います。これは、学生に同じ問題を 10 回解かせ、最も頻繁に現れる答えを選ぶようなものです。もし学生が 10 種類の異なる*アプローチを生成しているなら、これは非常に効果的に機能します。しかし、学生が一つの手法のみを知るよう訓練されていれば、10 回試させることは、単に同じ(おそらく誤った)答えの 10 個のコピーを生むに過ぎません。

この論文は、この問題を解決するための新しい訓練手法、**EDO(Exploration-Driven Optimization:探索駆動最適化)**を導入します。

核心となるアイデア:「好奇心旺盛な探検家」対「安全な専門家」

著者らは、「自己一貫性」というトリックを機能させるためには、モデルが訓練中に単なる**「安全な専門家」ではなく、「好奇心旺盛な探検家」**である必要があることに気づきました。

  • 従来の方法(専門家): コーチは「答えが合えば素晴らしい!間違えたら、最後に正解した時のように振る舞おう」と言います。学生は同じ成功パターンを繰り返し学習します。その結果、非常に狭く、鋭い思考様式が生まれます。
  • 新しい方法(EDO:探検家): コーチは「答えを正しく導き出すが、前回と同じことを繰り返すだけではいけない」と言います。「少し異なる経路を試せ。もし全く同じことを繰り返せば、優しく新しいことを試すよう促す」と。

創造的な比喩:迷路と懐中電灯

学生が巨大で暗い迷路(問題空間)にいて、出口(正解)を見つけようとしていると想像してください。

  1. 標準的な訓練: 学生は出口への経路を見つけ、報酬を受けます。次に、彼らはその全く同じ経路をレーザーのように集中して追うよう訓練されます。壁や他の通路を見るのをやめます。もしその唯一の経路が後で塞がれたら、彼らは立ち往生します。
  2. EDO 訓練: 学生は出口への経路を見つけ、報酬を受けます。しかし、コーチはルールを追加します。「これまでに試したことのないいくつかの側道にも迷い込む必要がある」と。学生は、自分が知っている一つだけではなく、多くの異なる経路を照らすように、その「懐中電灯(確率分布)」を広く保つことを学びます。

実際における仕組み

この論文は、既存の 2 つの訓練手法(iDPOGRPO)を取り上げ、これらに「好奇心」のルールを追加します。彼らは新しいバージョンをED-iDPOED-GRPOと呼びます。

  • メカニズム: 数学的には、モデルが過去の答えにあまりにも安住する際に「ペナルティ」を加えます。これにより、モデルはわずかに「居心地の悪さ」を保ち、多様性を維持し、選択肢を開いたままにします。
  • 結果: これらの新しいモデルをテストすると、単に一つのよい答えを得るだけでなく、多様な解決策を生成します。

なぜこれが重要なのか(「テスト時」の魔法)

モデルが多様な解決策を生成するようになったため、「自己一貫性」というトリック(10 個の答えを求め、投票する)が突然、はるかに効果的に機能します。

  • 以前: 10 個の答えを要求 \rightarrow 10 個の同一の誤った答えが返ってくる \rightarrow 投票 \rightarrow 依然として誤り。
  • EDO あり: 10 個の答えを要求 \rightarrow 10 個の異なるアプローチ(いくつかは正しく、いくつかは誤り)が返ってくる \rightarrow 投票 \rightarrow 正解が、異なる形で複数回現れたため勝利する。

結果

著者らは、この手法を難易度の高い数学コンテスト(AIME や MATH データセットなど)でテストしました。

  • 精度: 新しい手法(ED-iDPO と ED-GRPO)は、以前の最良の手法よりも多くの問題を正解しました。
  • 多様性: モデルははるかに多様な答えを生成しました(単語やステップの差異によって測定)。
  • 安定性: 時としてモデルが「崩壊」(すべてを忘れ、反復的になる)を引き起こす他の手法とは異なり、EDO は訓練プロセス全体を通じてモデルを安定させ、創造的に保ちました。

まとめ

簡単に言えば、EDO は AI モデルに「完璧な一貫性」に執着するのを減らし、「創造的な多様性」をより受け入れるように教えます。 訓練中に異なる経路を探索することをモデルに強制することで、テスト時に複数の解決策を生成するように求められた際、難しい問題を解く能力が大幅に向上します。これは、一つの解法を暗記する学生と、問題の全体像を十分に理解し、多くの異なる角度から答えを見つけられる学生との違いです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →