← 最新の論文
💬 NLP

Process Reward Informed Tree Rollout for Effective Multi-Turn RL

本論文は、有望な中間状態から選択的に分岐し、共有されるプレフィックスを再利用することで、LLMエージェントのマルチターン強化学習を最適化する、プロセス報酬ガイド型の適応的ツリー・ロールアウト・フレームワークであるPATRを紹介するものであり、これにより、従来の均一な軌跡サンプリング手法と比較して、SWE-BenchやFrozenLakeといったベンチマークにおける性能を大幅に向上させている。

原著者: Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにミステリーを解く方法を教えているところを想像してみてください。人工知能の世界では、これは**強化学習(Reinforcement Learning: RL)**と呼ばれます。これは犬の訓練に似ています。ロボットがタスクを実行し、正解すれば「ご褒美(報酬)」をもらい、失敗すれば何ももらえないというものです。時間をかけて、ロボットはどの行動がご褒美につながるのかを学んでいきます。しかし、ここが難しいところです。ロボットがご褒美に出会うまでに、多くのステップを伴う長く曲がりくねった道を歩かなければならないことがあります。もしロボットがランダムに推測するだけなら、正しい道を見つけることなく、何時間も円を描いて歩き回ったり、穴に落ちたりして時間を無駄にしてしまうかもしれません。これは、コンピューターやウェブサイトのようなツールとやり取りする「エージェント(AIプログラム)」にとって特に困難なことです。なぜなら、問題を解決するために、一つひとつ順番に意思決定を行う必要があるからです。科学者たちが問いかけている大きな疑問は、「どうすれば、デッドエンド(行き止まり)で時間を浪費することなく、エージェントに『正しい』経路を探索するように教えられるのか?」ということです。

ここで、PATRと呼ばれる新しいアイデアが登場します。UCサンディエゴ、Amazon、MITの研究者たちは、現在のAIエージェントの訓練手法が、少し「散弾銃によるアプローチ」のようなものであることに気づきました。現在の手法は、AIに対して同じタスクを毎回ゼロから何度もやり直すよう指示しています。もしAIがループに陥ったり、早い段階で悪い動きをしたりすると、たとえ最初の数ステップが実はかなり良かったとしても、その試行全体が捨てられてしまいます。これは、ピザの耳を焦がしたというだけで、中のチーズやソースが完璧だったとしても、ピザを丸ごと捨ててしまうようなものです。

著者らは、このエージェントを訓練するためのよりスマートな方法を提案しており、それを**Process-Scorer Guided Adaptive Tree Rollout(PATR)**と呼んでいます。毎回ゼロから始める代わりに、PATRは可能性の「木(ツリー)」を構築します。AIが分かれ道に立つハイカーだと想像してください。10人のハイカーをそれぞれ全く異なるランダムな経路に送り出すのではなく、PATRはまず最も有望なトレイルへと彼らを送り出します。もしそのトレイルを進むハイカーが美しい景色(「良い」中間ステップ)を見つけたなら、システムはさらに多くのハイカーを同じ経路に送り込み、異なる枝分かれを探索させます。もしトレイルが崖に向かっているように見える(「悪い」ステップ)なら、エネルギーを節約するために、システムは早い段階でそこへ人を送るのを止めます。極めて重要なのは、崖から落ちたハイカーの記録も保持しておくことです。なぜなら、何をすべきかを知ることと同じくらい、何をすべきでないかを知ることも重要だからです。

この論文は、この「木」を用いた手法がはるかに効率的であることを示唆しています。「スコアラー(評価者)」、つまりハイカーの進捗を数ステップごとにチェックする賢い審判を使うことで、システムはどの経路を拡張し、どの経路を刈り取る(プルーニングする)かを決定できます。彼らはこの手法を、2つの非常に異なる課題でテストしました。一つは、エージェントが穴に落ちることなく凍った池をナビゲートしなければならないFrozenLakeというシンプルなグリッドワールドゲームであり、もう一つは、エージェントがソフトウェアのバグを修正しなければならないSWE-Benchという、より困難な実世界のコーディングタスクです。

結果は有望なものでした。コーディングタスクにおいて、PATRは標準的な手法と比較してエージェントの成功率を最大5.0ポイント向上させました。よりシンプルなゲームでは、成功率を9.3ポイント高めました。著者らは、この手法が単にAIを賢くしただけでなく、より高速化し、反復的なループに陥りにくくすることも発見しました。彼らは、これがすべてを一瞬で解決する魔法の杖ではないことを強調していますが、「プロセス・スコアラー」を用いて探索を導くことは、AIエージェントが時間を無駄にすることなく、長く複雑なタスクに取り組む方法を教えるための強力な手段であることを示唆しています。鍵となる教訓は、私たちの「探索者」をどこに送るかを厳選することで、より少ない労力でより多くを学ぶことができるということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →