← 最新の論文
🤖 machine learning

Hölder Policy Optimisation

本論文は、勾配の集中と分散の安定性のバランスを動的に調整するホルダー平均パラメータを導入した一般化された方策最適化フレームワークである HölderPO を紹介し、これによりグループ相対方策最適化(GRPO)における固定集約の限界を克服し、数学およびタスク指向ベンチマークにおいて最先端のパフォーマンスを達成する。

原著者: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。あなたが、非常に優秀だが少し混乱している生徒(大規模言語モデル)に、複雑な数学の問題を解く方法や、ビデオゲームの世界を navigate する方法を教えていると。あなたは彼に多数の練習試行を与え、それぞれの試行に対して、次のような決断を下さなければなりません:「彼らの回答の中で、どの特定の単語が最も重要で、正しくすべきだったのか?」

これが、この論文が取り組む核心的な課題です。著者たちは、HölderPO(Hölder 方策最適化)と呼ばれる新しい教授法を提案しています。

以下に、簡単な比喩を用いて解説します。

1. 問題点:「画一的な」教師

従来の手法(GRPO など)は、生徒の論文を採点する際に、常に同じルールを適用する教師のように振る舞っていました。

  • 算術平均(標準的な GRPO): この教師は、すべての単語を均等に平均化します。生徒が単語の 90% を正解したとしても、難しい数学問題における重要な「ひらめき」の瞬間を 1 つ見逃した場合、その見逃しは平均における単なる小さなノイズとして扱われます。その結果、生徒はその特定の間違いから十分に学び取ることができません。
  • 幾何平均(他の手法): この教師は非常に穏やかです。彼らは成績を滑らかにし、単一の単語が過度に重要にならないようにします。これは、生徒が一貫性さえ保てればよいような簡単なタスクには適していますが、難しいタスクにおいては、生徒がようやく何かを理解したという稀で決定的な瞬間を無視してしまいます。

問題点: この論文は、単一の「完璧な」ルールは存在しないことを発見しました。

  • 困難でスパースなタスク(AIME 数学コンテストなど)では、正解は数少ない稀で優れたステップに依存します。あなたは、残りを無視してその特定のステップにズームインする教師が必要です。
  • 密なタスク(標準的な数学の宿題など)では、正解は多くの単語に分散しています。あなたは、ノイズに惑わされないように全体像を見る教師が必要です。

2. 解決策:「ダイヤル付き」教師(HölderPO)

著者たちは、教師が生徒を採点する方法を制御する、単一のダイヤル(パラメータ pp と呼ばれる)を備えた新しいシステムを作成しました。

  • ダイヤルを上げる(高い pp): 教師はスポットライトになります。彼らは退屈で平均的な単語を無視し、「超正解」または「超誤答」であった数少ない単語に集中的に焦点を当てます。これは、コーチが「その動きは完璧だった!それを繰り返せ!」と叫ぶようなものです。これにより、生徒は稀で困難なスキルを学ぶことができます。
  • ダイヤルを下げる(低い pp): 教師は広角レンズになります。彼らは単語のシーケンス全体を均等に眺めます。これにより、生徒が一つの小さな詳細を完璧にしようとして狂い、残りを無視することを防ぎます。これにより、トレーニングは安定し、冷静に保たれます。

3. 秘密の武器:「動的スケジューリング」

この論文の最大の画期的な点は、ダイヤルを一度の位置に固定し続けてはいけないと気づいたことです。

マラソンランナーのトレーニングを想像してください:

  1. 初期段階(スプリント): ランナーが新米の頃は、スタートするために特定の爆発的な動きを学ぶ必要があります。ダイヤルを上げます(高い pp)。「その完璧なストライドに集中せよ!」と叫びます。これにより、稀で良いシグナルが増幅され、動き出すことができます。
  2. 後期段階(持久力): 走り方を覚えたら、足を踏み外すことなく、安定したペースを維持する必要があります。ダイヤルを下げます(低い pp)。「体全体をバランスよく、滑らかに保て」と言います。これにより、過剰な修正や転倒を防ぎます。

HölderPO は、トレーニングが進むにつれて、ダイヤルを「高い」状態から「低い」状態へ自動的に移動させます。 最初は「ひらめき」の瞬間を積極的に探求し、最後は安定したフィニッシュのために全体を滑らかにします。

4. 結果:レースに勝利

著者たちは、この「ダイヤル付き教師」を 2 種類の課題でテストしました。

  • 数学コンテスト(AIME、MATH など): 動的な手法は54.9% の平均正解率を達成し、従来の最良の手法を大幅に凌駕しました。稀で正しい推論ステップを成功裡に増幅させることで、最も難しい数学問題(AIME)の記録を破りました。
  • ロボット/エージェントタスク(ALFWorld): 物体を見つけ、清掃し、加熱する必要があるシミュレーション世界において、この手法は93.8% の成功率を達成しました。これは非常に大きく、エージェントが長く多段階のタスク中に迷ったり混乱したりすることが稀であることを意味します。

まとめ

HölderPOを、いつ生徒に特定のブレイクスルーに集中するよう叫び、いつ間違いを犯さないよう落ち着かせるべきかを知っている、賢いトレーニングコーチと考えてください。この 2 つのモードを自動的に切り替えることで、AI モデルがこれまで以上に速く、かつ確実に難しい問題を解決することを教えることができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →