← 最新の論文
💬 NLP

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

本論文は、強化学習における探索と活用のバランスを改善し、支配的な行動モードによる探索の低下を防ぐために、サンプリング後に一時的に学習を忘却させる「サンプル・テン・フォゲット」機構を採用した新しい方策最適化フレームワーク「EEPO」を提案し、複数の推論ベンチマークで既存手法を大幅に上回る性能を示したことを報告しています。

原著者: Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

公開日 2026-04-14
📖 1 分で読めます☕ さくっと読める

原著者: Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🧠 物語:AI の「思考の壁」とそれを壊す方法

1. 問題:AI は「正解」に固執しすぎて、新しい道を見つけられない

AI が問題を解くとき、通常は「正解になりそうな道」を何度も試します。これを**「探索(新しい道を探すこと)」「活用(知っている正解を使うこと)」**のバランスと言います。

しかし、現在の AI のトレーニング方法(GRPO という手法)には大きな欠点がありました。

  • 状況: AI がたまたま「正解っぽい道」を見つけると、報酬(ご褒美)をもらいます。
  • 結果: AI は「この道が最高だ!」と信じてしまい、その道ばかりを繰り返すようになります。
  • 罠: これが**「エントロピーの崩壊(思考の硬直化)」**です。AI は自信過剰になり、他の可能性のある道(実はもっと良い解法があるかもしれない道)を完全に無視してしまいます。
    • たとえ話: 迷路で「ここが出口だ!」と信じて同じ場所をぐるぐる回り続ける探検家のよう。新しい出口があるかもしれないのに、その可能性を閉ざしてしまいます。

2. 既存の解決策の限界:「ランダムに振る舞う」だけではダメ

これまでの対策は、「温度を上げる(ランダムに振る舞う)」や「ご褒美の基準を緩める」といったものでした。

  • たとえ話: 迷路で「あてもなくふらふら歩く」ように指示するのと同じです。
  • 問題点: 確かにランダムに動きますが、「正解っぽい道」が依然として一番人気なので、AI は結局またその人気ルートに戻ってしまいます。根本的な「固執」は治りません。

3. 新手法「EEPO」の登場:一度見た道を「忘れる」魔法

ここで登場するのが、この論文で提案された**「EEPO(探索強化方策最適化)」です。
その核心は、
「サンプル・テン・フォーゲット(Sample-Then-Forget:試して、忘れる)」**という仕組みです。

🌟 仕組みのたとえ話:「探検家の記憶消去」

AI が迷路を解く際、以下の 2 段階のプロセスを踏みます。

  1. 第 1 段階(試す):
    AI がまず、いくつかの道(答えの候補)を探します。

    • 「あ、この道は正解っぽい!」と AI が自信を持って選びます。
  2. 第 2 段階(忘れる):
    ここがミソです。AI は**「さっき選んだ道は、もう存在しないものとして一時的に忘れる」**という魔法をかけます。

    • たとえ話: 探検家が「さっき選んだ道は、実は行き止まりだった(あるいは消えてしまった)」と思い込むように、脳内をリセットします。
    • 効果: AI は「さっき選んだ道」に戻れなくなるため、**「他にどんな道があるかな?」**と、これまで無視していた新しい・少し変わった道を探さざるを得なくなります。
  3. 第 3 段階(本番):
    忘れられた状態の AI が、残りの道を探します。

    • ここで、今まで見逃していた「実は素晴らしい別の正解」が見つかる可能性が高まります。
  4. 学習:
    最終的に、すべての道(1 段階と 2 段階で探したもの)をまとめて評価し、AI の能力をアップさせます。

    • 重要: この「忘れる」操作は、その瞬間だけ。次のトレーニングの時は、AI は元の記憶を取り戻します。だから、AI の能力が落ちることはありません。

4. なぜこれがすごいのか?

  • 偏りを防ぐ: 「一番人気な道」に依存する悪循環を、強制的に断ち切ります。
  • 多様な解法を見つける: 数学の問題には、一つの問題に対して複数の解法があることが多いです。EEPO は、それらの「隠れた名案」を見つけやすくします。
  • 効率が良い: 余計な計算をせず、トレーニング時間も従来の方法とほぼ変わりません。

📊 結果:どれくらい良くなった?

実験では、有名な数学パズル(AMC や AIME など)でテストしました。

  • 結果: 従来の方法(GRPO)に比べて、10%〜33% もの劇的な改善が見られました。
  • 意味: AI が「正解」に固執しすぎて失敗するのを防ぎ、より柔軟で創造的な思考ができるようになったのです。

💡 まとめ

この論文が伝えているのは、**「AI に『正解』を教えるだけでなく、『正解に固執しない』ように教えることも重要だ」**という点です。

EEPO は、AI に**「一度見た道に執着せず、勇気を持って未知の道へ踏み出す」**という習慣を、トレーニングの最中に一時的に強制する素晴らしいアイデアなのです。まるで、迷路の探検家に「さっきの道は忘れなさい、新しい道を探しなさい」と囁くガイド役のようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →