← 最新の論文
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

本論文は、自動生成、検証、および GRPO ベースのスクリーニングを通じて報酬関数の仕様が反復的に最適化される探索駆動型強化学習フレームワークを提案し、静的またはランダムな報酬アンサンブルと比較して、GSM8K における数学的推論性能を大幅に向上させるランク付けフィードバックループを実証する。

原著者: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

公開日 2026-05-05
📖 1 分で読めます☕ さくっと読める

原著者: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に頭の良い学生(大規模言語モデル)がいると想像してください。この学生は会話には長けているものの、数学の問題ではときどきつまずきます。この学生に数学の問題をよりよく解く方法を教えたいとします。通常であれば、宿題を採点するために教師を雇うでしょう。しかし、この論文の著者たちは、異なる問いを投げかけます。「もし宿題を完璧に採点する方法が正確に分からなかったらどうでしょう?もし AI に最高の採点基準を考案させることを許したらどうなるでしょうか?」

彼らがどのように行ったか、その物語を簡単に説明します。

1. 問題:「採点基準」の謎

AI の世界において、モデルによりよく考えさせるためには、「強化学習」と呼ばれるシステムを使用します。これは犬を訓練するようなものです。

  • 犬: AI モデル。
  • おやつ: 「報酬」(ポジティブなスコア)。
  • 芸: 数学の問題を正しく解くこと。

問題は、「おやつ」(報酬関数)を設計することが難しいことです。「正解が出せたら良い仕事だ」と伝えても、AI は実際に考えずに推測したりパターンを模倣したりして不正をする可能性があります。もしその「手順」に対して報酬を与えようとすれば、複雑なルールを書く必要があり、そのルール自体に間違いを犯しやすいのです。

2. 解決策:「採点基準ファクトリー」

著者たちは、採点基準そのものを最適化の対象とするシステムを構築しました。彼らは手動でルールを書いたのではなく、AI(Kimi K2 という「最先端」モデル)をルール発明者として機能させるファクトリーを設置しました。

このファクトリーがどのように機能するか、ステップごとに説明します。

  • ラウンド 1: ルール発明者 AI に 20 問の数学問題を与え、それらを採点する 10 の新しい方法を記述するよう求めます。これらのルールは、レシピのような単純なコンピュータコードとして記述されます。
  • セキュリティチェック: これらのルールが使用される前に、「セキュリティスキャナ」を通し、危険なものや破損していないかを確認します。
  • テストドライブ: 研究者たちは、小さな数学の学生(30 億パラメータの AI モデル)を連れてきて、これらの新しいルールのうちの 1 つを使って、短い期間(500 ステップ)問題解決の練習をさせます。
  • 成績表: 新しいルールを使って学生がテストでどの程度うまくいったかを確認します。新しいルールが学生のスコア向上に貢献したなら、そのルールは高い評価を得ます。もしルールが学生を混乱させたなら、低い評価となります。
  • フィードバックループ: 高性能なルールを要約し、ルール発明者 AI に戻します。AI には、「ねえ、思考ステップの数を数えるルールはうまくいったよ。単に最終答えだけを見るルールはあまりうまくいかなかったよ。それを基に新しいルールを考案してみて」と伝えます。

彼らはこのサイクルを5 回繰り返し、50 個の異なる候補ルールを生成しました。

3. 結果:「黄金のルール」の発見

5 ラウンドの後、いくつかの勝者が見つかりました。

  • 最優秀単一ルール: thinking_steps_count という名前の 1 つのルールがチャンピオンでした。このルールは、AI が少なくとも 3 つの異なる行に思考プロセスを書き出した場合に追加ポイントを与えるものでした。正解かどうかはチェックしませんでした(ベースシステムがそれを担当します);単に AI に自分の作業過程を示すことを促すだけでした。
  • チームワークの力(アンサンブル): 1 つのルールだけでは不十分だと気づきました。そこで、最も優れた 5 つのルールを取り出し、「スーパー採点チーム」に組み合わせました。
    • 結果: このルールチームは、AI の成功率を(基本的なルールのみを使用した場合の)**60%から79.5%**へと引き上げました。
    • 「魔法」のチェック: それが単なる偶然やルールの数の多さによるものではないことを証明するために、山からランダムに選ばれた 5 つのルールで構成された「ランダムチーム」を試しました。そのランダムチームは失敗し、AI はほぼすべてで失敗しました。これは、フィードバックループ(どのルールが機能したかを学び、それを発明者にフィードバックすること)が、単にルールを多く持つことではなく、秘密のソースであることを証明しました。

4. AI は不正をしましたか?(「報酬ハッキング」監査)

「思考の行数を多くして」と AI に指示すると、点数を取るために単にページを無意味な内容で埋め尽くすのではないかという一般的な懸念があります。

  • 監査: 著者たちは AI の回答を確認しました。その結果、AI が答えを正解したとき、不正解だったときよりも、実際により多くの行を書き、より多くの数学記号を使用していたことが分かりました。
  • 結論: AI は空のスペースを埋めることで不正をしていたのではなく、ルールがそれを促したため、本格的により深く考えていたのです。

5. なぜこれが重要なのか

  • アクセスしやすい: スーパーコンピュータは必要ありません。彼らは、ゲーマーが使用するような単一のハイエンドなコンシューマー向けグラフィックカードで、約 40 時間かけてこの実験全体を実行しました。
  • 自動化されている: 人間の専門家が完璧な採点基準がどのようなものか推測するために数週間を費やす代わりに、このシステムはこれらのルールの発見を自動化します。
  • 透明性がある: ルールはブラックボックスではなく、人間が読み、理解し、調整できる単純な Python コードです。

要約すると: この論文は、AI に他の AI の採点システムを設計させることを許し、学生の成績に基づいてこれらのルールを絶えず洗練させていくことで、静的で人間が書いたルールセットを与えるだけの場合よりも、はるかに良く学生に考えさせることができることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →