← 最新の論文
🤖 machine learning

STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

STRIDE は、生成器と生成検証器を結果に基づく報酬のみで共同学習させる新たなトレーニング枠組みであり、これによりスカラースコアを学習可能な段階的言語フィードバックに置き換え、失敗を明示的に局所化し推論経路を再誘導することで、大規模言語モデルの推論能力を強化する。

原著者: Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、少し混乱しているが非常に優秀な学生に、複雑な迷路の解き方を教えると想像してください。過去において、これらの AI「学生」(大規模言語モデル)を訓練する方法は、彼らにテストを受けさせ、最終的なスコアのみを伝えるようなものでした。「不正解です」という具合に。

これが、論文「STRIDE」が解決しようとしている問題です。ここでは、日常の比喩を用いてその仕組みを簡単に解説します。

問題:「沈黙する」スコアカード

現在、ほとんどの AI 訓練には「強化学習」と呼ばれる方法が用いられています。これは、AI がゲームのレベルをプレイし、最後に「ゲームオーバー」または「クリア」のメッセージを受け取るようなビデオゲームだと考えてください。

  • 問題点: もし AI が 10 段階ある数学の問題の 3 段階目でミスを犯した場合、教師(コンピュータ)は「3 段階目で数字の足し算を間違えたよ」とは言いません。単に「不正解」と言うだけです。
  • 結果: AI は自分がどこで間違えたのかを推測しなければなりません。これは、車のエンジンが掛からないという事実しか知らされず、どの部品が緩んでいるかもメカニックに教えてもらえない状態で、壊れたエンジンを修理しようとするようなものです。これは「情報ボトルネック」と呼ばれます。教師が特定の誤りを修正するための情報が少なすぎるのです。

以前のいくつかの方法では、段階ごとのスコア(例:「ステップ 1:良、ステップ 2:不良」)を与える試みもありましたが、これらのスコアは単なる数値(0 または 1)に過ぎません。それでも、なぜそのステップが悪かったのかを説明するものではありません。

解決策:STRIDE(「おしゃべりな」コーチ)

著者たちは、Stepwise Trajectory Redirection with In-context Deep Evaluation の頭文字を取った STRIDE を提案しています。

沈黙するスコアカードの代わりに、STRIDE は「生成型検証器(Generative Verifier)」を導入します。これは、学生が隣に座り、リアルタイムで問題について語りかける「コーチングアシスタント」だと考えてください。

STRIDE は、トレーニングキャンプのような 3 つのフェーズで機能します。

フェーズ 1:ウォーミングアップ(ベースポリシー)

AI 学生は、自分で問題を解こうとします。最終的に、単純な「正解/不正解」のスコアが与えられます。これはゲームのルールを学ぶようなもので、基本的な土台を築きます。

フェーズ 2:コーチの訓練(検証器)

次に、システムは 2 番目の AI(検証器)をコーチとして訓練します。

  • 魔法: コーチは、人間がすべての段階の正解/不正解のリストを与えて教えられるわけではありません(それは高価で遅すぎるため)。代わりに、コーチは学生が問題を解く様子を見て、最終的な答えが合っていたかどうかを確認することで学びます。
  • スキル: 時間とともに、コーチは学生の乱雑な作業を見て、「待てよ、3 段階目で繰り上げを忘れたぞ」とか、「ここでは論理的なステップを飛ばしているぞ」と言うことができるようになります。これは、単純な「不正解」というスコアを、詳細な書面による批評へと変えることを学ぶのです。

フェーズ 3:指導付きの「やり直し」(軌道の再誘導)

これが核心的な革新です。学生が問題を失敗した場合:

  1. 最初のミスを特定: コーチ(検証器)は学生の作業をスキャンし、「最初の失敗点(FPF)」を見つけます。論理が破綻した場所を正確に特定します。
  2. 「再誘導」: 学生に最初から整个问题をやり直させる(これは無駄です)のではなく、システムはこう言います。「さて、2 段階目まではよくできていました。そこで止めましょう。3 段階目が失敗した理由を説明したメモはこちらです。さて、私の助言を使って、2 段階目から始めて残りの問題をもう一度解いてみてください。」
  3. 多ポイント戦略: 時には、3 段階目のミスは、その時点では正しく見えた 1 段階目での「悪い選択」が原因だったこともあります。STRIDE は賢く、「1 段階目と 2 段階目の両方からやり直してみよう」と言い、学生により良い道を見つけるための複数の機会を与えます。

これが重要な理由

この論文は、このアプローチが 2 つの主要な問題を解決すると主張しています。

  1. 「沈黙」の打破: 数値(スカラー報酬)だけでなく、言語フィードバック(言葉) を使用することで、AI ははるかに豊かな説明を得られます。これは、教師が「F(不合格)」と言うのと、「負の符号の分配を忘れました」と言うのとの違いです。
  2. 「解決不能」の解決: 著者たちは、AI が通常 0% の正解率しか出せない非常に難しい問題において、標準的な手法は有用なシグナルを得られないため諦めてしまうことを発見しました。しかし、STRIDE はそれでも学ぶことができます。AI が失敗しても、コーチは誤りを指摘し、AI はその特定の地点から異なる道筋を試すことができ、最終的にコードを解き明かすことができます。

比喩のまとめ

  • 旧来の方法: テストを受ける。「0/100」のスコアが出る。何を勉強すべきか分からない。
  • 以前の「段階」方式: 「ステップ 1:10/10、ステップ 2:0/10」というテストを受ける。「どこ」で失敗したかは分かるが、「なぜ」失敗したかは分からない。
  • STRIDE: テストを受ける。「0/100」のスコアが出るが、教師はさらに書面によるメモを渡す。「2 段階目でつまずいたのは、間違った公式を使ったからだ。1 段階目に戻って、このメモを見て、異なるアプローチを試してみよう」という具合だ。

結果

この論文は、難しい数学と論理パズルでこれをテストしました。

  • STRIDE は、以前の最先端を含む、他のすべての既存の方法を凌駕しました。
  • 数学の問題、コーディング課題、論理パズルで機能しました。
  • 最も重要なのは、以前はこれらのモデルにとって「不可能」と考えられていた問題を解決し、0% の成功率を学習の機会へと変えたことです。

要約すれば、STRIDE は AI に、盲目的に推測するのではなく、自分自身と会話することで間違いから学ぶことを教えます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →