← 最新の論文
🤖 machine learning

Parameter Exploration for RLVR via Variational Learning

本論文は、パラメータ空間を探索することで多様な方策を生成し、それによってGRPOのような標準的な行動空間探索手法と比較して、ダウンストリームの性能と学習の安定性を向上させる、LLMのための強化学習手法であるPerturbed Parameter Policy Optimization (3PO) を導入するものである。

原著者: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いロボットに、複雑な数学の問題やコードの記述のような難しいパズルを解く方法を教えようとしていると想像してください。ただ答えを見せて座っているわけにはいきません。代わりに、ロボットに試行錯誤させ、もし正解したらハイタッチ(報酬)を与えます。もし間違えたら、優しく「もう一度やってみて」と伝えます。これは「強化学習」と呼ばれます。難しいのは、ロボットが自力でどうすればハイタッチをもらえるかを見つけ出さなければならない点です。時として、ロボットは新しいことを試すのを怖がりすぎて、同じ間違いを何度も繰り返すという、マンネリ状態に陥ってしまうことがあります。これを解決するために、科学者たちは通常、ロボットの思考を少し「混沌」としたもの、あるいは「ランダム」なものにしようとします。そうすることで、素晴らしい新しい解決策に偶然辿り着くことを期待するのです。

長い間、この混沌を加える標準的な方法は、ロボットの「温度(temperature)」を調整することでした。これは、ラジオの静電気のボリュームを上げるようなものだと考えてください。これによってロボットの選択は少し予測不能になりますが、ロボットが知っていることや考え方そのものを変えるわけではありません。単に、推測の順番を少しシャッフルしているだけなのです。これは、シェフに対して、レシピ自体を変えることなく、スープにスパイスをより多く投入するように命じるようなものです。問題は、たとえそうしても、スープが依然としてひどい味になることがあり、ロボットは単に異なる順番で同じ悪い推測を繰り返すだけになってしまうことです。この論文では、より過激なアイデアを探求しています。もし、単にスパイスをシャッフルするのではなく、シェフの脳自体を調整したらどうなるでしょうか? もし、試行ごとにロボットにわずかな、一時的な「脳霧(ブレイン・フォグ)」や、わずかな「性格の変化」を与えたらどうなるでしょうか? これにより、ロボットは単に推測の仕方を変えるだけでなく、全く新しい考え方そのものを探索できるようになります。

この研究の背後にいる研究者たち、Vatsal Venkatkrishna、Nico Daheim、そしてIryna Gurevychは、この「脳の調整」というアイデアを大規模言語モデル(テキストを書き、問題を解決するタイプのAI)でテストすることに決めました。彼らは、この新しい手法のファミリーを3PO(Perturbed Parameter Policy Optimization:摂動パラメータ・ポリシー最適化)と呼んでいます。3POは、単にロボットの推測をランダムにする(アクション空間の探索)のではなく、実際にロボットの内部的な重みに少しのノイズを加えます(パラメータ空間の探索)。16人のシェフからなるチームがパズルを解こうとしている場面を想像してください。従来の方法(GRPOと呼ばれます)では、16人のシェフ全員が全く同じレシピ本を使い、ただランダムに推測を行うことになります。もし全員が失敗すれば、チーム全体が行き詰まってしまいます。

3POチームは、状況を打破するために3つの異なる方法を試しました。第一に、B3POは、チーム全体に、ラウンドの間ずっと、わずかに異なる「霧がかかった」バージョンのレシピ本を与えるようなものです。第二に、M3POは、チームに4つの異なる「霧がかかった」バージョンの本を、次々と試させ、その結果を平均化するようなものです。しかし、真の主役はC3POです。C3POでは、チームが分割されます。全員が同じレシピ本を使う代わりに、チームを小さなグループに分け、各グループに全く異なる「霧がかかった」バージョンのレシピ本を与えます。これは、チームが同時に多くの異なる「宇宙」の解決策を探索していることを意味します。

結果は非常に有望でした。彼らがこれらの手法を難しい数学の問題(AIMEコンペティションのような)やコーディングの課題でテストしたところ、C3POの手法は一貫して標準的な手法よりも優れた性能を示しました。この論文は、これらの異なる「霧がかかった」バージョンのモデルを使用することで、チームが標準的な手法では見逃してしまった正しい答えを見つけることができたと示唆しています。具体的には、C3POは、すべての試行が同じ誤った答えに到達してしまうデッドエンド(行き止まり)になるはずだったグループの試行を、より多く「救済」することができました。また、「形が崩れた(malformed)」回答、つまりロボットがナンセンスな内容を繰り返すだけの、奇妙で壊れた応答も少なく抑えました。

興味深いことに、この論文は、単にロボットをよりランダムにする(温度を上げるような)だけでは不十分であると主張しています。実際、ロボットをランダムにしすぎると、単にゴミのような回答が増えるだけであることを彼らは発見しました。鍵となるのは、探索の「構造」でした。すなわち、複数の異なるバージョンのモデルが同じグループ内で協力して動いていることです。この論文は、これがすべてを解決する魔法の杖であると主張しているわけではありませんが、モデルの内部パラメータを調整することが強力な新しいツールであることを強く示唆しています。それは、隠された宝を見つけるためには、単にランダムな方向に歩き回るのではなく、それぞれが少しずつ異なる地図を持った探検隊を送り出し、より広い範囲をカバーする必要があることに気づくようなものです。研究者たちは、このアプローチが大幅に多くの計算資源を必要とすることなくうまく機能することを発見しており、これはより賢いAIを訓練するための実用的なアップグレードとなっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →