← 最新の論文
🤖 machine learning

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

TRACEは、対数比状態価値の時間差変化からターンごとの報酬を導出することで、長期的なホライゾンを持つエージェントに対して高密度かつクリティックフリーなクレジット割り当て手法を導入し、教師あり微調整やライブウェブデータを必要とせずに、純粋な強化学習によって複雑な検索ベンチマークにおけるツール使用性能を大幅に向上させる。

原著者: Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに巨大で多段階のミステリーを解く方法を教えていると考えてください。これは人工知能の世界では「エージェンティック強化学習(agentic reinforcement learning)」と呼ばれます。このロボットを、単に答えを一度推測するだけでなく、図書館を探索し、ファイルを閲覧し、質問を投げかけ、手がかりを集めるために何時間も費やしてから、最後に「犯人を見つけたぞ!」と叫ぶ探偵だと想像してください。難しいのは、その探偵をどう教えるかです。もし探偵が最後に答えを間違えた場合、単純な教師なら「ダメだ」と言ってゼロ点を与えるかもしれません。しかし、それは不公平です!もしかしたら、探偵は最初の1時間で正しい手がかりを見つけていたのに、最後の1分で床板の緩みに躓いてしまっただけかもしれません。最後のミスという理由だけで、その1時間の懸命な努力すべてに罰を与えてしまうと、探偵は混乱し、手がかりを集めることをやめてしまいます。これが「クレジット割り当て(credit assignment)」の問題です。つまり、報酬が最後にしか得られない場合に、どのようにして良いステップには称賛を、悪いステップには非難を与えるかという問題です。

TRACE と題されたこの論文は、問題を解決するために多くのターンを必要とするAIエージェントにおける、まさにこの頭痛の種に取り組んでいます。研究者たちは、探偵に対して、最後まで待つのではなく、あらゆるステップ(検索やファイルの閲覧など)のたびに「グッドジョブ」または「バッドジョブ」を与える巧妙な方法を提案しています。彼らは、すべてのステップに人間が採点したり、映画全体を見守る超スマートな審判を必要としたりすることなく、これを行っています。代わりに、彼らは「凍結された参照モデル(frozen reference model)」、つまり、答えを知っている冷静で変わることのない司書のようなものを使用します。ロボットが動きを作るたびに、司書はこうチェックします。「この新しい手がかりによって、最終的な答えを推測しやすくなったか?」もしそうなら、探偵には小さな報酬が与えられます。もしそうでなければ、小さなペナルティが課されます。TRACEと呼ばれるこの手法は、AIが最終的な成績を待つよりも、はるかに速く、より良く学習することを可能にします。

探偵のジレンマ

あなたが、架空の著者である「エレナ・クルス」の出生地を見つけるようにロボットを訓練していると想像してください。ロボットはブラウザを使用して、検索し、ページを開き、テキストを読み取る必要があります。そこに到達するまでに20回のクリックが必要かもしれません。従来の訓練方法(「結果のみ」の訓練と呼ばれます)では、ロボットは20回のクリックをすべて行い、おそらく答えを間違え、その後コンピュータは「失敗」と言います。ロボットはやり直しますが、その20回のクリックのうち、どれが役に立ったのかを知る術はありません。もしかしたら、最初の15回のクリックで正しい本を見つけたのに、16回目のクリックで別のエレナに関するページを開いてしまい、誤った答えに導かれたのかもしれません。従来のメソッドは、役に立った最初の15回のクリックと、役に立たなかった16回目のクリックを同じように扱います。つまり、両方に罰を与えてしまうのです。これは、数学のテストで、難しい代数計算は正しく解いたのに、最後に小さな算数のミスをしたという理由で、テスト全体の成績が悪くなるようなものです。

研究者たちは、この「全か無か」のアプローチが、ロボットに複雑で長いタスクを学習させることを非常に困難にしていることを見出しました。ロボットは混乱し、訓練には膨大な時間がかかり、最後にミスをすることを恐れて、新しいアイデアを探索することを諦めてしまうことがよくあります。

TRACE ソリューション:各ステップへのスコアカード

論文の著者たちは、TRACE(Turn-level Reward Assignment via Credit Estimation)を考案しました。ロボットに最終的な答えが出るまで待って採点する代わりに、TRACEは、ツール呼び出し(すべての検索、すべてのオープン、すべてのクリック)のたびにロボットにスコアを与えます。

探偵の比喩を用いて、その仕組みを説明します:

  1. 凍結された司書: システムは「凍結された参照モデル」を使用します。答えの鍵をすでに読んでおり、決して考えを変えない司書を想像してください。この司書は「凍結」されています。つまり、学習したり混乱したりすることはありません。彼らは単に、安定した物差しとして機能します。
  2. 進捗チェック: ロボットが動き(「エレナ・クルス」を検索するなど)を作った後、司書はロボットの現在のメモをチェックします。司書はこう尋ねます。「ロボットがこれまでに発見した内容に基づくと、正しい答えを推測することはどれくらい容易か?」
  3. スコアの変化: もしロボットの新しい検索によって答えが推測しやすくなれば、ロボットにはプラスのスコアが与えられます。もし検索が行き止まりや混乱を招くページにつながった場合、スコアは下がります。
  4. 「テレスコーピング(望遠鏡的構造)」の魔法: 論文では、「時間差(Temporal-Difference: TD)」と呼ばれる数学的なトリックを使用しています。これは梯子(はしご)のようなものだと考えてください。一段登れば、その段に対してクレジットを得られます。もし登った後に誤って滑り落ちてしまったら、その滑り落ちた分についてクレジットを失います。システムはこれらの微細な変化を合算します。もしロボットが10ターンの間、良い手がかりを集め、その後に一度だけ悪い動きをした場合、システムは10回の良いステップをプラスとして、1回の悪いステップをマイナスとして認識します。最終的な答えが間違っていたとしても、システムは最初の10回の良いステップを罰することはありません。

この手法が特別なのは、ステップごとに「よくやった」と書き留める人間を必要とせず、また、ロボットを見守って採点する第二の超スマートなAIを必要としない点です。それは単に、「凍結された司書」を使用して、ロボットが真実に近づいているかどうかを確認するだけです。

彼らが発見したこと

研究者たちは、非常に困難なタスク、すなわち膨大な文書コレクションの奥深くに隠された特定の事実を見つけ出すタスク(「クローズド・ウェブ」検索)でTRACEをテストしました。彼らは2つの異なるサイズのAIモデルを使用しました(小型のQwen3-4Bと、大型のQwen3-30B-A3B)。

結果は目覚ましいものでした。TRACEを使用する前、小型モデルは難しい検索問題の約**7.2%しか解決できませんでした。TRACEを用いた訓練の後、それは35.6%へと跳ね上がりました。大型モデルは8.4%から42.6%**へと向上しました。これらは、彼らが「コールドスタート」訓練(完璧な例を使って最初に教え込む方法)やライブインターネットデータを使用しなかったことを考えると、極めて大きな改善です。彼らは単に、生のモデルに対してTRACEメソッドを使用しただけなのです。

また、論文は、ロボットが訓練で使用した練習用のライブラリではなく、オープンなインターネット上でテストされた場合でも、TRACEが機能することを示しました。ロボットは、検索して読むための一般的なスキルを学習し、それが新しい場所にも転移しました。例えば、大型モデルはBrowseCompというベンチマークで12.9、GAIAで52.0、そして中国のディープサーチテストで45.0を記録しました。

なぜ重要であり、何ができないのか

この論文は、この手法が学習をより速くすることを提案しています。実験において、TRACEで訓練されたロボットは、従来の「最後まで待つ」方法で訓練されたロボットよりも、はるかに早い段階で改善し始め、ピークパフォーマンスに到達しました。学習曲線は、ロボットが証拠を集めるための探索をより効果的に行えるようになっていることを示していました。

しかし、著者たちは自らの研究の限界についても注意深く指摘しています。この手法が最も効果を発揮するのは、最終的な答えが名前、日付、数字のように短く明確な場合です。もしロボットの仕事が、長く複雑な物語を書いたり、壊れたコンピュータープログラムを修理したりすることであり、「正しい」答えがオープンエンドで定義しにくいものである場合、この手法はうまく機能しない可能性があります。「凍結された司書」は、チェックするための明確な答えの鍵を必要とします。答えが曖昧な場合、司書はロボットが真実に近づいているかどうかを判断できないのです。

要約すると、TRACEはAIエージェントに優れた探偵になる方法を教えるための新しい方法です。事件の最後まで待って「良かった」あるいは「悪かった」と言う代わりに、手がかりが見つかるたびにスコアカードを与えます。これにより、AIは、最終的な推測が完璧でなくても、証拠を集めること自体に価値があることを理解できるようになり、よりスマートで、速く、信頼性の高い検索エージェントへとつながるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →