← 最新の論文
🤖 AI

Credit Assignment with Resets in Language Model Reasoning

本論文は、中間状態へのリセットと継続の再サンプリングを通じて正確なクレジット割り当てを可能にすることで言語モデルの推論を改善するランダム・リセットおよび自己リセット方策最適化(RRPO および SRPO)を提案し、SRPO は外部監督なしで誤ったステップを自律的に特定し修正することで優れた性能を達成する。

原著者: Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Daniel Jiang, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Daniel Jiang, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な数学の問題を解くことや、コードを書くことを学生に教える場面を想像してください。従来の方法では、学生が最終的な答えを間違えた場合、教師は「不合格だ」と言い、学生に最初から解答をすべて書き直すよう命じ、次回に正解することを期待します。このアプローチの問題点は、学生がどの特定のステップで失敗したのかがわからないことです。最初の一文で間違えたのでしょうか?それとも、3段落先で迷い込んだのでしょうか?

この論文は、AI モデル(特に大規模言語モデル)に推論を教えるより賢明な方法を紹介しています。これはリセットを伴うクレジット割当と呼ばれます。

彼らのアイデアを簡単なアナロジーを用いて以下に分解します。

1. 問題:「均一な罰則」

現在、AI が多段階の推論タスクで失敗した場合、標準的なトレーニング手法は、AI が生成したすべての単語を、失敗に対して同様に責任があるとみなします。

  • アナロジー: 3 走目の選手がバトンを落としてチームが敗れたリレーを想像してください。しかし、コーチはチーム全体を叱り、1 走目、2 走目、4 走目の選手全員に追加の周回を走らせます。1 走目の選手は何も間違っていませんが、それでも罰せられます。これは非効率的で混乱を招きます。

2. 解決策:「リセットボタン」

著者たちは、リセットと呼ばれるメカニズムを提案しています。最初からやり直すのではなく、AI は失敗した試行の途中の特定の地点に戻されます。その地点から、異なる選択が成功につながるかどうかを確認するために、新しい終わり方(「反事実的」な継続)を生成しようとします。

  • アナロジー: 運転中に間違った方向へ曲がり、道に迷ったと想像してください。家まで戻って最初からやり直すのではなく、間違った地点となった交差点で車を止めます。「よし、ここで左折するべきではなかった;右折してみよう」と言います。重要なのは、旅程の必要な部分だけを再走行することです。

3. 間違いを見つける 2 つの方法

この論文では、どこでリセットボタンを押すかを決定する 2 つの方法を提案しています。

  • RRPO(ランダム・リセット): これは推測のようなものです。AI は失敗した連鎖内のランダムなステップを選び、そこから再試行します。
    • アナロジー: 教師が学生の失敗した論文のページをランダムに選び、「ここから書き直そう」と言うようなものです。うまくいくかもしれませんが、ほとんどは運次第です。
  • SRPO(自己リセット): これはこの手法の目玉です。AI は自身の失敗した試行を振り返り、「私はどこで間違ったのか?」と自問します。論理が破綻した特定の思考やステップを特定し、その場所でリセットします。
    • アナロジー: 学生が自身の論文を読み、論理が曖昧になった正確な文を見つけ、「あ、問題がわかった。その文から書き直そう」と言うようなものです。これは外部の助けを必要とせず、AI 自身が行います。

4. なぜこれがよりうまくいくのか(「クレジット割当」)

特定の誤り点にリセットし、複数の新しい終わり方を試すことで、AI は明確に理解できます。「この特定の瞬間に、パス B ではなくパス A を選んでいれば、成功していたはずだ」と。

  • 結果: AI は、全体の解答を単に暗記するのではなく、特定の悪い習慣を修正することを学びます。これは、四肢を切断するのではなく、腫瘍を切除する外科医のようなものです。

5. 結果:より速く、より賢く

研究者たちは、この手法を数学の問題、科学の質問、コーディングタスクでテストしました。

  • 発見: SRPO手法(AI 自身が間違いを見つける方法)は、標準的な手法や「ランダムな推測」手法を一貫して凌駕しました。
  • 速度: コーディングタスクにおいて、SRPO は標準的な手法よりも2 倍から 3 倍速く学習しました。すでに正しいとわかっているステップを再学習する時間を無駄にしなかったため、高い成功率に達しました。
  • 自己修正: この論文は、AI が誤りを正しく特定した場合(「クリーンな」プレフィックス)、間違った場所を推測した場合に比べて、問題をほぼ 2 倍の頻度で修正できることを発見しました。これは、どこでリセットするかを知ることが成功の鍵であることを証明しています。

まとめ

この論文は、AI に自らの最高の批評家になることを教えるものだと考えてください。タスク全体を盲目的に再試行するのではなく、AI は自分が軌道から外れた正確な瞬間を特定し、「リセット」ボタンを押し、その特定の瞬間から異なる経路を試すことを学びます。これにより、数学やコーディングのような複雑なタスクにおいて、学習がはるかに効率的で、精密で、効果的になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →