← 最新の論文
💬 NLP

Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization

本論文は、複数の報酬を伴う強化学習における利得推定の安定化を目的として、マグニチュードを考慮した分位正規化とマハラノビス・ホワイトニングを採用する Reward-Decorrelated Policy Optimization(RDPO)という新たな手法を導入し、これにより推論能力やコーディング能力を損なうことなく、指示追従、文章作成、および堅牢性におけるモデルの性能を向上させるものである。

原著者: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

公開日 2026-05-14
📖 1 分で読めます☕ さくっと読める

原著者: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いロボット(AI)に、物語を書く、数学の問題を解く、ソフトウェアをコーディングする、厳格な指示に従うなど、多くの異なる仕事を同時にさせるよう訓練していると想像してください。ロボットを教えるために、あなたは試行のたびにフィードバック(報酬)を与えます。

問題は、これらのフィードバック信号がごちゃごちゃしていることです。いくつかは「合格/不合格」の単純な成績(バイナリスイッチのようなもの)であり、いくつかは0から100までのスコアであり、いくつかは複雑な意見です。さらに、これらの信号はしばしば重複しています。例えば、長い回答は「詳細である」という点で加点される一方で、「冗長すぎる」という点で減点され、「詳細である」スコアと「冗長である」スコアが数学的に関連している可能性があります。

これらごちゃ混ぜになったスコアをすべて足し合わせて、ロボットがどのように改善すべきかを伝えようとするとき、訓練は混沌となります。ロボットは巨大なスコアに混乱し、他のものを無視したり、2つの信号が互いに戦っているためにループに陥ったりするかもしれません。

この論文の著者たちは、この混乱を解決するために**RDPO(Reward-Decorrelated Policy Optimization:報酬非相関方策最適化)**と呼ばれる新しい手法を提案しています。RDPOは、ロボットが学習する前にフィードバックを準備する2段階の「信号クリーナー」と考えてください。

ステップ1:「公平性フィルター」(マグニチュード感知型量子正規化)

問題: 教室で採点していると想像してください。ある生徒は100点、別の生徒は99点、3人目は0点です。生の数字だけを見ると、99と100の差はわずかに見えますが、0と99の差は巨大です。AI訓練において、ある種類の報酬(例えば「合格/不合格」チェックなど)に巨大な差がある場合、それは他のすべてのフィードバックを飲み込んでしまい、ロボットがその1つのことだけに集中し、他のすべてを無視するようになります。

解決策: RDPOはマグニチュード感知型量子正規化と呼ばれる「公平性フィルター」を使用します。

  • 仕組み: 生の数字を見るのではなく、試行間の順位ギャップを見ます。巨大なギャップを圧縮し(100点が99点よりも無限に優れているわけではないように)、小さなギャップを伸ばします(99点と100点が依然として区別できるように)。
  • 比喩: あるランナーが10秒で、もう一人が100秒でゴールするレースを想像してください。時間だけを見ると、2人目のランナーはひどく見えます。しかし、レースを正規化して、全員をグループ全体に対する相対的なパフォーマンスで評価するようにすれば、2人目のランナーは1人目のランナーの巨大なリードに押しつぶされることなく、改善する公平な機会を得られます。これにより、単一の「悪い」または「外れ値」の試行がロボットの学習プロセスを乗っ取ることを防ぎます。

ステップ2:「ノイズキャンセラー」(マハラノビス・ホワイティング)

問題: 時には、フィードバック信号が冗長であることがあります。2つのセンサーを持っていると想像してください。1つは「ロボットがどれだけ話したか」を測定し、もう1つも「ロボットがどれだけ話したか」を測定します。これら2つのスコアを足し合わせると、同じ情報を二重にカウントすることになります。あるいは、2つのセンサーが反対のことを言っていると想像してください。1つは「もっと長く」と言い、もう1つは「もっと短く」と言います。これらを単に足し合わせると、互いに打ち消し合い、ロボットは明確な方向性を得られません。

解決策: RDPOはマハラノビス・ホワイティングと呼ばれる「ノイズキャンセラー」を使用します。

  • 仕組み: 異なるフィードバック信号間の関係を確認します。2つの信号が同じことを言っている場合(相関している場合)、一方の重みを減らして二重カウントを防ぎます。互いに戦っている場合は、ロボットが明確でバランスの取れた指示を得られるように調整します。
  • 比喩: ドラマーとベーシストが全く同じリズムを演奏しているバンドを想像してください。それは濁って冗長に聞こえます。「ノイズキャンセラー」は、リズムセクションが濁ったのではなく、鮮明でクリアに聞こえるように、ベースを少し下げるサウンドエンジニアのようなものです。これにより、ロボットは繰り返しのノイズではなく、固有の情報から学習することが保証されます。

結果

著者たちは、この手法をLongCat-Flashと呼ばれる大規模なAIモデルでテストしました。彼らは4種類のタスクでそれを訓練しました:

  1. 指示追従: 求めたことを正確に行うこと。
  2. 一般執筆: 良い物語や記事を作成すること。
  3. 数学的推論: 論理パズルを解くこと。
  4. コーディング: コンピュータプログラムを書くこと。

何が起こりましたか?

  • 執筆と指示追従: ロボットは指示に従うことと高品質なテキストを書くことが大幅に向上しました。困難またはトリッキーなプロンプトが与えられたとき、より堅牢になりました。
  • 数学とコーディング: ロボットは、以前の最良の方法と同じパフォーマンスを発揮しました。数学やコーディングの能力が低下したわけではありません。他のタスクで大幅に向上しながら、競争力を維持しました。

結論

この論文は、AIが学習する前にフィードバック信号を整理する(公平にし、冗長性を除去する)ことで、訓練プロセスがはるかに安定するとの主張を述べています。これにより、AIは数学の問題を解いたりコードを書いたりする能力を失うことなく、執筆やルール遵守など、複雑なマルチタスクの仕事で向上することができます。AIが正しい教訓を学ぶために、異なる種類の賞賛と批判を混ぜるより賢い方法です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →