← 最新の論文
💬 NLP

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

本論文は、アンカー・トークンの埋め込みとその最も近い意味的近傍を動的に混合することで、意味的一貫性を維持しつつ多様性を注入し、それによってイン分布およびアウトオブ分布の両方のタスクにおいて既存のベースラインを凌駕する、数学的推論を強化するための新しい探索戦略であるN-GRPOを導入する。

原著者: Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

公開日 2026-06-10
📖 1 分で読めます☕ さくっと読める

原著者: Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢い学生(大規模言語モデル)に、難しい数学の問題を解く方法を教えていると考えてください。本当に優れた能力を身につけるためには、学生が同じ問題を解くために多くの異なる方法を試す「練習」が必要です。この練習フェーズは「ロールアウト」と呼ばれます。

ここで、この学生の練習を助けるための新しい手法であるN-GRPOを紹介します。これは以下のように、シンプルな概念に分解して説明できます。

問題点:2つの悪い練習方法

現在、AIモデルが練習する際、通常は次の2つのいずれかの方法で多様性を出そうとしますが、どちらにも欠陥があります。

  1. 「オウム返し」アプローチ(トークンレベル・サンプリング)
    学生に文章を書き換えるよう頼む場面を想像してください。彼らは「猫がマットの上に座っている」と言うか、「マットの上に猫が座っている」と言うかもしれません。

    • 問題点: これらは単なる言い換えに過ぎません。根底にある論理は全く同じです。学生は数学の問題に対する「新しい解き方」を学んでいるのではなく、単に同じことを別の言葉で言っているだけなのです。これは、ピアノの曲を練習しているのに、音符を変えずに音量だけを変えているようなものです。
  2. 「静的なノイズ」アプローチ(ランダム埋め込みノイズ)
    学生の思考を揺さぶるために、ランダムな電気ショックを与える場面を想像してください。

    • 問題点: これはあまりにも混沌としています。それは歯車にレンチを投げ込むようなものです。学生は突然、代数について話すべき時に「バナナ」について話し始めるかもしれません。ランダムなノイズは意味を破壊し、学生を脱線させ、失敗へと導きます。

解決策:N-GRPO(「賢い隣人」メソッド)

著者らは、**セマンティック・ネイバー・ミキシング(意味的隣人混合)**と呼ばれる、中間の解決策を提案しています。これは「ガイド付きグループ・ブレインストーミング」のようなものです。

単に言葉を言い換えたり、ランダムな言葉を選んだりするのではなく、モデルは自分が最も言おうとしている言葉(「アンカー」)を探します。そして、その言葉に最も近い**3つの「隣人」**を自身の内部辞書から見つけ出します。

  • 比喩: 学生が「正方形(Square)」という言葉を言いそうになっている場面を想像してください。
    • 「オウム返し」アプローチなら、「四角形(Quadrilateral)」と言うでしょう(単なる類義語です)。
    • 「静的なノイズ」アプローチなら、「バナナ(Banana)」と言うでしょう(ランダムで間違いです)。
    • N-GRPOは「正方形」を見つけ、その隣人である「長方形(Rectangle)」「菱形(Diamond)」「立方体(Cube)」を見つけ出します。そして、これら4つの概念を混ぜ合わせた**「混合された思考」**を作り上げます。

この混合物は「連続的な」思考です。これはまだ単一の単語ではなく、これらの関連するアイデアのちょうど真ん中に位置する、曖лоー(曖昧)な概念です。

なぜこれが機能するのか

  1. 経路を維持する: 隣人が元の言葉と非常に類似しているものとして選ばれるため、新しく作られた「混合された」思考は、依然として数学的かつ論理的に関連性を保っています。これにより、意味不明な内容(「バナナ」の例のような)へと脱線することがありません。
  2. 新しい経路を見つける: それは混合物であるため、単一の言葉を用いるよりも、問題に対して少し異なる角度からアプローチすることを可能にします。これは、同じ道を速く歩いたり遅く歩いたりするのではなく、隠れた近道を見つけるために森の中を通る少し異なるルートを通るようなものです。

どのように使用されるか

論文では、これをGRPOと呼ばれるトレーニング・フレームワークに統合しています。

  • トレーニング中: モデルは練習します。時々(約10%の確率で)、この「賢い隣人」による混合を用いて解を生成します。もしその解が正しい答えに導いた場合、モデルには報酬が与えられ、「この『混合された』経路は正しかった」と学習します。
  • テスト中(推論時): 興味深いことに、論文では、モデルが単独で質問に答える際、この混合はパフォーマンスを低下させることが分かったため、テスト時には混合をオフにし、標準的で明確な回答を行うようにしています。

結果

研究者たちは、AIMEやMATHといったベンチマークを用いた数学問題で、さまざまなサイズのAIモデルを用いてテストを行いました。

  • 結果: N-GRPOを使用したモデルは、従来のメソッドを使用したモデルよりも多くの問題を正しく解きました。
  • 教訓: 似た概念を混ぜ合わせることで、AIは混乱したり道を見失ったりすることなく、よりクリエイティブな解決策を探索できるようになります。

限界

論文では、主に2つのデメリットを指摘しています。

  1. 速度: 「隣人」を見つけ出し、それらを混合するには追加の計算能力が必要であり、トレーニングプロセスが少し遅くなります。
  2. 範囲: 彼らはこれを数学と科学にのみテストしました。コード(プログラミング)については、ルールが非常に厳格であるため(コードの構文を「混ぜる」と壊れてしまう可能性があるため)、まだ試されていません。

要約すると、N-GRPOは、似たアイデアを混ぜ合わせることでAIに思考を教え、正気を失うことなく新しい解決策を探索することを可能にする手法です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →