← 最新の論文
🤖 machine learning

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

本論文は、数学およびコーディングのベンチマークにおいて既存のヒューリスティック介入を上回る性能を発揮し、トークンレベルのエントロピー変化に関する理論的枠組みを導出するとともにトークンを適応的に再重み付けすることでエントロピーの崩壊に対処する、検証可能な報酬を伴う強化学習(RLVR)のための原理的なエントロピー変調手法であるSTEERを提案する。

原著者: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いロボットに複雑な数学の問題を解かせたり、コードを書かせたりすると想像してみてください。ここでは「検証可能な報酬を用いた強化学習(RLVR)」という手法を使用します。これは、ロボットがさまざまな解決策を試み、正解すれば「金の星(報酬)」を獲得し、間違えれば何も得られないというゲームのようなものです。時間とともに、ロボットはより多くの金の星を獲得するように学習します。

しかし、この論文の研究者たちは、この訓練プロセスに「エントロピーの崩壊」と呼ばれる重大な欠陥を発見しました。

問題:ロボットが過度に自信を持ち(そして行き詰まる)

「エントロピー」を理解するために、ロボットの思考を答えの可能な選択肢が詰まった広大な図書館だと想像してください。

  • 高エントロピー: 図書館には多様で異なるアイデアが満ちています。ロボットは探索しており、多くの異なる経路を試み、新しい可能性に開かれています。
  • 低エントロピー(崩壊): 図書館が突然縮小します。ロボットは探索を止め、自分が最善だと考える「たった一つの経路」のみを選びます。それは硬直し、反復的になります。

RLVRにおいて、ロボットはしばしばこの「低エントロピー」状態にあまりにも早く陥ってしまいます。間違いを恐れるあまり、新しいことを試さなくなります。そして、同じ「推論」を繰り返し生成し始めます。もしそのたった一つの経路が間違っていれば、ロボットは失敗し、より良い解決策を発見できないため訓練は停止してしまいます。

従来の解決策:推測と検証

この論文以前、科学者たちはこの問題を修正するために「ヒューリスティック」な手法、つまり何が機能する可能性があるかを推測する手法を用いていました。

  • 「クリップ・ハイ」法: ロボットの自信の変化の度合いを制限するルールを緩め、ロボットにさらに多くのことを試させることを期待しました。
  • 「再重み付け」法: 稀な答えに追加の点数を与え、一般的な答えから点数を差し引くことを試みました。

これらの従来の手法の問題点は、他の穴を無視して穴のあいたボートの穴の一つだけを塞ごうとするようなものであったことです。彼らはロボットがなぜ崩壊するのかを完全に理解していなかったため、その修正は当たり外れがありました。

新しい洞察:数学的な地図

この論文の著者たちは、内部を詳しく調べることにしました。彼らは、学習の各ステップごとにロボットの「多様性(エントロピー)」がどのように変化するかを正確に追跡するための精密な数式(「厳密な解析近似」)を作成しました。

彼らは、多様性の変化が4 つの特定の要因によって制御されていることを発見しました。

  1. クリッピング規則: 訓練アルゴリズムが大きな変化をどの程度制限するか。
  2. アドバンテージ・スコア: 特定の答えが平均と比較してどの程度優れているか。
  3. 確率: ロボットが最初にその答えを選ぶ可能性。
  4. 現在のエントロピー: その瞬間におけるロボットの思考の多様性。

彼らはこれを4 つの象限を持つ地図として可視化しました。答えが「正解/不正解」かつ「確実/不確実」であるかによって、ロボットは多様性を「増やす」か「減らす」かのどちらかになります。彼らは、従来の手法がこの地図の 1 つまたは 2 つの象限しか見ておらず、全体像を見逃していたことに気づきました。

解決策:STEER

この地図に基づき、彼らはSTEER(Stabilizing Token-level Entropy-changE via Reweighting:再重み付けによるトークンレベルのエントロピー変化の安定化)と呼ばれる新しいツールを構築しました。

STEER をロボットの学習プロセスのためのスマートな交通整理員だと考えてください。

  • 推測するのではなく、STEER はロボットが生成するすべての単語(トークン)について、多様性がどの程度変化するかを正確に計算します。
  • ロボットが多様性の急激な低下(エントロピー崩壊)を引き起こすような動きをしようとしている場合、STEER はその特定の動きに対して優しくブレーキをかけます。
  • それはロボットが学習することを止めさせるのではなく、学習のうち過度に攻撃的な部分を減速させ、ロボットの思考を開放的で多様な状態に保つだけです。

結果

チームは、STEER を 6 つの異なる数学ベンチマークと 3 つのコーディング課題でテストしました。

  • 結果: STEER は訓練を通じてロボットの「思考」を多様で探索的な状態に保ちました。
  • スコア: 他のすべてのトップ手法を一貫して上回り、より多くの数学問題を解き、より優れたコードを作成しました。
  • 汎用性: 異なるサイズのロボット(小規模から大規模モデルまで)や異なる種類の訓練アルゴリズムにおいても効果的に機能しました。

まとめ

この論文は、AI により優れた推論を教えるためには、創造性を維持する方法を単に推測するだけでは不十分であると主張しています。AI がどのようにして創造性を失うのか、その正確な数学を理解する必要があります。これらの変化の精密な地図を作成することにより、彼らはSTEERを構築しました。これは微調整された調整器として機能し、AI が硬直したループに陥るのではなく、好奇心旺盛で探索的な状態にとどまることを保証します。これにより、より賢く、能力の高い AI モデルが実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →