← 最新の論文
🤖 machine learning

ReCode: Reinforcing Code Generation with Reasoning-Process Rewards

本論文は、対比学習を介して推論プロセス報酬モデルを学習し、それを報酬ハッキングを軽減するための実行ベースのゲーティングと統合することでコード生成を強化する新規強化学習フレームワーク「ReCode」を導入し、GPT-4-Turbo に匹敵する顕著な性能向上をもたらすことを紹介する。

原著者: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、天才的だが時折無謀な見習いにコンピュータコードの書き方を教える立場だと想像してください。過去には、最終成果物のみをチェックしていました。「プログラムはクラッシュせずに実行されましたか?はい?よくできました。いいえ?もう一度やり直し。」これは、数学のテストで正解を得たかどうかだけで生徒を評価し、どのように解いたかを見ないのと同じです。

論文「ReCode」は、このアプローチに欠陥があると主張しています。時折、見習いは論理が乱雑だったり間違っていたりしても、運や推測によって正解にたどり着くことがあります。逆に、完璧な計画を持っていても、些細なタイプミスをしてしまうこともあります。真に信頼性の高いコードを得るためには、コードを書くに、明確に思考することを教える必要があります。

以下に、ReCode の仕組みを簡単な概念に分解して示します。

1. 問題:「正解だが、理由が誤り」という罠

現在の AI 学習方法は、最終結果に基づいて「正解」か「不正解」かだけを言う教師のようなものです。

  • 課題: AI が正解のコードを推測したとしても、その内部の思考(推論)が混沌としていた場合、AI は「混沌+運=成功」と学習してしまいます。なぜそのコードが機能したのかを学ぶことができないのです。
  • 目標: 私たちは、AI が「正解を得ること」だけが重要だと学ぶのではなく、良い思考が良質なコードにつながると学習することを望んでいます。

2. 解決策:ReCode(推論強化コード生成)

ReCode は、採点基準安全ゲートという 2 つの主要なツールを持つ、コーチのような新しい学習システムです。

ツール A:「採点基準」(CRPL)

AI により良い思考を教えるためには、システムが AI が何を生み出したかだけでなく、どのように思考したかを評価できる方法が必要です。

  • 課題: AI の思考プロセスの各ステップをすべて評価できる人間の教師は十分ではありません。
  • 工夫: 研究者たちは「合成教師」を作成しました。優れた推論の例を取り、AI に 2 つのバージョンを作成させました。
    1. 「超推論」バージョン: 論理を強化し、事実を確認し、ステップを明確にしたバージョン。
    2. 「欠陥推論」バージョン: ステップをスキップしたり、事実誤認をしたりするなど、AI が意図的に小さな誤りを加えたバージョン。
  • 結果: これらの「良い思考対悪い思考」のペアを AI に何千回も示すことで、システムは報酬モデルを学習します。このモデルは、コードが書かれる前であっても、「この思考の段落は論理的で明確だ」とか、「この段落には論理の飛躍がある」と言い放つ、厳格な編集者のように機能します。

ツール B:「安全ゲート」(CG-GRPO)

では、この「思考の成績」を AI を欺くことなく学習にどう活用するのでしょうか。

  • リスク(報酬ハッキング): もし単に「思考で高得点を取れ」とAIに指示すれば、AI は実際にコード作成に役立たない、長く、派手で、混乱した段落を書くことを学習するかもしれません。まるで、数学の問題を解くことには役立たないとしても、ポイントを得るために 10 ページの論文を書く生徒のようです。これを「報酬ハッキング」と呼びます。
  • 対策: ReCode は安全ゲートを設置します。
    • AI は、最終的なコードが実際に動作し、テストに合格した場合にのみ、「良い思考」に対してポイントを獲得します。
    • コードが失敗した場合、推論がどれだけ優れていても「思考のスコア」は無視されます。
    • 比喩: 料理人を想像してください。料理が実際に美味しく出来上がれば(実行)、レシピ(推論)を称賛できます。しかし、料理が焦げていれば、レシピがどれだけ上手に書かれていても関係ありません。これにより、AI は自分の思考が実際に機能する結果につながることを保証するように強制されます。

3. 結果:より賢く、速く、信頼性が高い

研究者たちは、この新しいシステムを 70 億パラメータの AI モデル(非常に賢いモデルですが、最大のものではありません)でテストしました。

  • 向上: ReCode で学習した AI は、標準版と比較してコーディングスキルが**16.1%**向上しました。
  • 比較: はるかに大きく高価なモデルであるGPT-4-Turboと同等のパフォーマンスを発揮しました。
  • 効率性: 興味深いことに、ReCode モデルは単により多くのコードを書いたのではなく、より少ない言葉より良いコードを書きました。それは無駄な言い回しに時間を費やすのをやめ、論理的な要点に直接飛びつきました。
  • 汎用性: 彼らはまた、この手法を数学の問題に応用し、そこでも機能することを確認しました。これは、AI に「明確に思考する」ことを教えることが、コーディングだけでなく、論理を必要とするあらゆる分野で役立つことを証明しています。

まとめ

ReCode を、単なる「幸運な推測」を受け入れない訓練キャンプだと考えてください。

  1. 賢い思考プロセスと愚かな思考プロセスの違いを見極めることができる専門の審査員を作成します。
  2. 最終結果が実際に機能する場合にのみ、AI がその賢い思考に対して評価を得られるようにする厳格なゲートを設置します。
  3. その結果、AI は単に答えを暗記するのではなく、推論を通じて解決策にたどり着くことを学び、より信頼性が高く効率的になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →