← 最新の論文
🤖 AI

MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation

本論文は、成功した改善からの報酬をより初期の有益な試行へと伝播させることで自己修正型コード生成を大幅に向上させるために、フィードバック条件付きロールアウト木と回顧的クレジット割り当てを活用するグループ相対方策最適化(GRPO)のマルチターン拡張であるMURPHYを導入する。

原著者: Chanakya Ekbote, Vijay Lingam, Sujay Sanghavi, Jun Huan, Behrooz Omidvar-Tehrani, Anoop Deoras, Stefano Soatto

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Chanakya Ekbote, Vijay Lingam, Sujay Sanghavi, Jun Huan, Behrooz Omidvar-Tehrani, Anoop Deoras, Stefano Soatto

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑なパズル、例えばコンピュータプログラムの作成をロボットに教える状況を想像してください。

従来の方法(「ワンショット」の誤り)
従来、ロボットにパズルを解くよう指示すると、間違えた場合、単に「もう一度試せ」と言い、最初から全く新しい解を推測させるだけでした。あるいは、より高度な設定では、ロボットが自分のミスを認識し、テスト中に修正を試みますが、ロボット自体は将来、ミスをより上手に修正する方法を学習することはありません。まるで、テストを受けて問題に赤い「バツ」をつけられ、次のテストの前にその教訓をすぐに忘れる生徒のようです。

現在の「学習」手法の問題点
新しい手法では、ロボットが試行し、失敗し、エラーメッセージを見て、再挑戦することを可能にします。これは機能しますが、「教師」(トレーニングアルゴリズム)は少し不器用です。それは、試行全体を単一の単位として扱います。

  • シナリオ: ロボットが解を試み、失敗し、エラーメッセージが失敗の「理由」を正確に伝えます(例:「負の数の処理を忘れました」)。ロボットはその手がかりを使ってコードを修正し、成功します。
  • 不器用な教師: 従来のトレーニング手法は、「最終的な成功は素晴らしい!」と言いますが、最初の失敗した試行には全く評価を与えません。最初の失敗が、問題を解決するために必要な具体的な手がかりを提供したため、実際には「有益」だったことに気づいていないのです。それは、失敗を時間の無駄とみなします。

登場する MURPHY:「賢い探偵」のような教師
この論文は、これらのロボットを訓練する新しい方法としてMURPHYを紹介しています。MURPHY を、結末だけでなく、物語全体を見る探偵だと考えてください。

  1. 「試行の樹」の構築: 単一の試行ではなく、MURPHY はロボットに枝分かれさせます。

    • 枝 A: ロボットが解を試みます。失敗します。
    • 転換点: MURPHY はその失敗、エラーメッセージ、そして元の質問を取り、そのエラーを修正するために「具体的に」再挑戦するようロボットに求めます。
    • 枝 B: ロボットはエラーの手がかりを使ってコードを修正し、成功します。
  2. テープの巻き戻し(回顧的評価): これが魔法の部分です。ロボットが枝 B で成功すると、MURPHY は時間を遡って戻ります。「待てよ!枝 B が成功したのは、枝 A がその特定のエラーの手がかりを提供してくれたからだ。だから、枝 A も評価に値する!」と言います。

    • これは、容疑者の最初の過ち(指紋を残したこと)が、逮捕につながった決定的な証拠だったことに気づく探偵のようなものです。指紋は「悪い」動きではなく、解決に至るための必要なステップでした。
  3. 評価を与える 2 つの方法:

    • MARS(楽観主義者): ロボットの追試のいずれかが成功すれば、MARS はその連鎖を開始した初期の失敗に完全な評価を与えます。「もし最終的に宝を見つけられたなら、迷っていた時に描いた地図は価値があった」と言うようなものです。
    • MERS(現実主義者): この手法は、すべての追試の平均的な成功に基づいて評価を与えます。少し慎重で、評価を分散させます。
  4. 死んだ枝の切断(剪定): 時には、ロボットがあまりにも多くのバリエーションを試すため、「樹」が大きくなりすぎて処理が遅くなります。MURPHY には賢い「庭師」ツールがあります。それは枝を見て、すべて同じことをしている(何も新しいことを学んでいない)枝を切り落とします。最も多様性と学習の潜在性がある枝を維持し、時間と計算資源を節約します。

結果
著者らは、2 つの異なるロボット「脳」(モデル)を使用して、3 つの異なるコーディング課題でこれをテストしました。

  • 結果: MURPHY は、ロボットが自分のコードを修正する能力を大幅に向上させました。
  • 絶妙なバランス: 改善は難しい問題で最も顕著でした。簡単な問題では、ロボットはもともと上手でした。しかし、ロボットが失敗し、エラーから学び、再挑戦しなければならなかった難しい問題では、MURPHY は以前の手法よりも約6% 多く成功するのを助けました。

要約すると
MURPHY は AI に失敗はデータであることを教えます。失敗した試行を「悪い」結果として扱うのをやめ、その失敗が最終的な成功に必要な情報を提供したのであれば、「必要なステップ」として扱うようにします。それは AI を、単なる最終回答だけでなく、自己修正の「プロセス」を価値あるものとして評価するように再配線します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →