← 最新の論文
💬 NLP

Constrained Group Relative Policy Optimization

本論文は、グループ内正規化によって引き起こされる有害な結合効果を排除するために、生の報酬ではなく標準化されたアドバンテージをスカラー化することで、制約の遵守と学習の安定性を向上させる、Group Relative Policy Optimizationのラグランジュ法に基づく拡張であるConstrained GRPOを導入するものである。

原著者: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

公開日 2026-09-03
📖 1 分で読めます☕ さくっと読める

原著者: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、研究者たちは、自動運転車のナビゲーションから難解な数学パズルを解くことまで、複雑な問題を解決するために大規模なコンピュータモデルを教えています。これらのモデルは、試行錯誤を通じて学習しますが、これは「強化学習」として知られるプロセスです。迷路を解こうとしている学生を想像してみてください。その学生は、出口に到達すると報酬を受け取り、壁に当たるとペナルティを受け取ります。時間をかけて、学生は報酬を最大化し、ペナルティを避ける方法を学びます。しかし、モデルに「歩行者に決してぶつからない」や「常に正しい文法を使用する」といった厳格なルールに従わせつつ、同時に役に立つ存在であってもらいたい場合に、大きな課題が生じます。ルールが厳格すぎると、モデルは役に立たなくなってしまいます。一方で、ルールが緩すぎると、モデルはそれを破ってしまうかもしれません。これを解決するために、科学者たちは、成功への欲求と制約を守る必要性のバランスを取りながら、学習が進むにつれて各ルールの重要性を調整する数学的な枠組みを使用しています。

これらのモデルを教えるための一般的な手法である「グループ相対方策最適化(Group Relative Policy Optimization)」は、効率的であり、すべてのステップを評価するための個別の「審判」モデルを必要としないため、好んで用いられています。その代わりに、同じ質問に対して生成された一連の回答を比較して、どれがより優れているかを判断します。この手法は一般的なタスクにはうまく機能しますが、研究者たちは、これを厳格な安全ルールに適用することが難しいことを発見しました。Mila – ケベックAI研究所およびエコール・ポリテクニーク・ド・モントリオールのチームによる新しい研究では、異なる目標を単一のスコアに組み合わせる標準的な方法が、実はシステムのルール遵守能力を損なっていたことが明らかになりました。彼らは、欠陥を修正し、モデルが安全限界を厳格に遵守しながら複雑な行動を学習できるようにする、新しいアプローチである「制約付きグループ相対方策最適化(Constrained Group Relative Policy Optimization)」を導入しました。

研究者たちが特定した核心的な問題は、コンピュータが複数の目標を同時にどのように扱うかという点でした。標準的なアプローチでは、モデルはすべての報酬とペナルティを取り込み、それらを一つに混ぜ合わせ、学習しやすくするためにその数値を正規化します。研究者たちは、この混合プロセスが「隠れた干渉」を生み出すことを示しました。コンピュータがあるルールの重みを調整すると、意図せずして他のすべてのルールの相対的な重要性も変化させてしまうのです。それは、オーケストラの一つの楽器の音量を調節しようとして、バンド全体のバランスをも変えてしまうつまみを回すようなものです。バイオリンを大きくしようとしても、その過程でドラムが静かになりすぎたり、フルートが大きくなりすぎたりしてしまうのです。これにより、モデルはどのルールに従うべきかを正確に学ぶことが非常に困難になり、しばみ、安全制約を無視したり、学習中に不安定になったりすることがよくあります。

これを修正するために、研究者たちは処理の順序を変更しました。報酬とペナルティを最初に混ぜ合わせるのではなく、モデルが各ルールの価値を個別に計算し、それぞれを個別に正規化するようにしたのです。各ルールが独自に公平に扱われた後にのみ、学習された重みを用いてそれらを結合します。この単純な切り替えにより、隠れた干渉が取り除かれます。信号を最後まで分離しておくことで、モデルは特定のルールに対して自身がどれだけ改善しているかを明確に把握できるようになります。その結果、学習プロセスはより安定し、予測可能になります。研究者たちは、この新手法を3つの非常に異なる環境でテストしました。エージェントが溶岩を避けつつバッテリーを管理しなければならない単純なグリッドベースのゲーム、数千の複雑な交通シナリオを含む現実的な自動運転シミュレーション、そして算数の文章題を含む数学的推論タスクです。

グリッドベースのゲームでは、新手法によってエージェントがよりスムーズに学習できるようになりました。標準的なアプローチでは、エージェントが過度に慎重になり、溶岩を極端に避けすぎるあまりほとんど動けなくなりましたが、新手法では、エージェントがリスクの「予算」を効果的に使い、安全を保ちながらゴールに到達することができました。自動運転シミュレーションでは、新しいアプローチは、より安全であるだけでなく、ルートの完了においてもより効果的なドライバーを生み出しました。新手法で訓練されたモデルは、信号を先に混ぜ合わせていた従来の手法と比較して、安全性遵守とルート進行の両方で高いスコアを達成しました。彼らは、前進する能力を犠牲にすることなく、衝突を回避し、交通法規に従うことに成功しました。

最後のテストでは、言語モデルに、答えが短く、フォーマットが正しく、有効な数字が含まれていることを保証しながら、数学の問題を解くように教えました。ここで、新手法は再び優位性を示しました。標準的な混合アプローチで訓練されたモデルは、答えを短くしたり特定のフォーマットに合わせたりするために、正解性を犠牲にすることがよくありました。対照的に、新手法は、フォーマットや長さの基準を維持しながらも、数学的に正解することを優先させました。15億パラメータの小さなモデルから70億パラメータの大きなモデルまで、異なるサイズのコンピュータモデルを通じて、この新しいアプローチは、高価な追加のトレーニングコンポーネントを必要とすることなく、一貫してより正確な結果を生み出しました。

これらの知見は、異なる学習信号をどのように組み合わせるかは、信号そのものと同じくらい重要であることを示唆しています。コンピュータが報酬とルールを処理する順序を単に変更するだけで、研究者たちは制約をより確実に尊重するシステムを作り出すことができました。この研究は単なる小さな改善ではありません。これは、ルールに従うことが目標を達成することと同じくらい重要な現実世界において、人工知能を安全に運用するための、より明確な道筋を提供するものです。この研究は、私たちがAIに能力と安全性の両方を求めているとき、成功の測定方法が、モデルに本来何をすべきかを混乱させることのないよう、細心の注意を払わなければならないことを裏付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →