← 最新の論文
🤖 AI

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMPは、支持する文書をそれらを表出させたアクションへと遡及させるプロベナンス(由来)誘導型のクレジット割り当てメカニズムを導入し、符号を保持した変調を通じてアドバンテージを再分配することにより、ディープサーチエージェントにおける報酬とクレジットのミスマッチに対処し、複数のベンチマークにおいてGRPOベースラインを大幅に上回る性能を実現する。

原著者: Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、インターネット上の難解な謎を解くために、超スマートなデジタル探偵を訓練していると想像してください。この探偵は「ディープサーチ・エージェント」と呼ばれ、単に推測するのではなく、手がかりを探し、ウェブページを読み、証拠を組み合わせて疑問に答えます。長い間、これらの探偵を教える方法は、映画全体を最終シーンだけで採点するようなものでした。もし探偵が最後に正しい答えに辿り着けば、映画全体に金メダルが与えられました。もし間違った答えを出せば、全体に赤い「F(不可)」がつきました。

しかし、ここに問題があります。探偵が物語の途中で素晴らしい手がかりを見つけたとしても、その後に混乱して最終的な答えを間違えてしまうことがあります。逆に、真の証拠を一度も見つけることなく、運良く正解に辿り着いてしまうこともあります。古い手法では、この違いを判別できませんでした。それは、何の意味も持たない退屈な動きに対してさえ、すべての動きに同じ報酬(または罰)を与えてしまうのです。著者たちはこれを「報酬・クレジットの不一致(reward-credit mismatch)」と呼んでいます。これは、学生が途中の3つの段落で完璧なリサーチを行っていたとしても、結論が間違っているという理由だけで、レポート全体に不合格を出す教師のようなものです。

大きなアイデア:STAMP
研究者たちは、STAMP(Step-level Trace-guided Advantage Modulation with Provenance)と呼ばれる新しい訓練方法を提案しています。STAMPを、探偵の映画をフレームごとに観察する、非常に観察眼の鋭い映画批評家だと考えてください。

単に最終的な答えを見るのではなく、STAMPは次の2つの具体的な質問を投げかけます。

  1. 探偵は実際に正しい証拠を見つけたのか?(探っていた特定の人物や事実を見つけたのか?)
  2. どの特定の動きが、その証拠を最初に明らかにしたのか?(検索クエリを入力したときか、それともリンクをクリックしたときか?)

STAMPは「参照ベースの検証器(reference-based verifier)」を使用します。これは、いわばスマートなチェッカーであり、探偵が見つけた文書を調べ、「この文書は本当に必要な事実を証明しているか?」と問いかけます。もし証明しているならば、STAMPはその文書を、探偵が最初に目にした正確な瞬間まで遡ります。その特定の瞬間に「クレジットのブースト(加点)」が行われます。

映画を壊すことなく機能させる方法
ここが巧妙な部分です。STAMPは映画の最終的な成績を変えることはしません。もし探偵が依然として最終回答を間違えたなら、その映画は失敗のままです。しかし、STAMPは「符号保存型アドバンテージ変調(sign-preserving advantage modulation)」を使用して、訓練を微調整します。

探偵がジェットコースターに乗っていると考えてみてください。もし乗り物が成功(ポジティブなアドバンテージ)であれば、STAMPは良い手がかりを見つけた特定の瞬間に少し余分なブーストを与え、それらの動きをより報酬に値するものと感じさせます。もし乗り物が墜落(ネガティブなアドバンテージ)した場合、STAMPは良い動きを厳しく罰することはありません。「なるほど、ミッションには失敗したが、あの検索クエリは実は素晴らしかった。その教訓を消し去ってはいけない」と言うのです。これにより、探偵は、最終的な結果と教訓を混同することなく、どの検索の動きが有効であるかを正確に学ぶことができます。

この論文が「ではない」と述べていること
著者たちは、この手法が何では「ない」かを明確に述べています。彼らは、検索の各ステップに対して複雑な新しい報酬システムを発明する必要はないと主張しています。また、証拠なしにどの動きが良いかを推測する必要はないとも断じています。STAMPは「証明された」証拠に基づいています。もし文書が存在しない、あるいは検証器がその事実を支持していないと判断した場合、クレジットは与えられません。彼らは、ステップにランダムなボーナスを加えるだけではうまくいかないと明言しています。なぜなら、古いシステムではそれらが結局平均化されてしまうからです。

結果:効果はあるのか?
チームは、BrowseCompBrowseComp-ZH(中国語版)、およびxbench-DSという3つのチャレンジセットでSTAMPをテストしました。彼らは、全く同じ開始モデル、訓練データ、および検索ツールを使用して、標準的な訓練方法であるGRPOと比較しました。

結果は、STAMPが探偵のパフォーマンスを一貫して向上させたことを示しました。

  • BrowseCompでは、精度が +2.0 ポイント向上しました。
  • BrowseComp-ZHでは、+5.5 ポイント跳ね上がりました。
  • xbench-DSでは、+3.0 ポイント改善しました。

論文は、これらの利得が起こる理由について、STAMPが「隠れた宝石(hidden gems)」――つまり、失敗した試行の中でも有用な証拠を見つけたステップ――を捉えているからだと示唆しています。古い方法ではこれらは無視されていました。実際、正解の試行において、83.5% のステップは実際には有用な証拠を全く生み出していませんでした。一方で、不正解の試行においても、7.0% のステップが有用な手がかりを見つけていました。STAMPは、最終的な結果に関わらず、有用なステップに報酬を与えることでこれを解決します。

どれほどの確信があるのか?
著者たちは、訓練方法以外はすべて同一の制御実験を行ったため、これらの数値に自信を持っています。また、彼らは「アブレーション・スタディ(構成要素を分解して各パーツの役割を確認する実験)」も実施し、STAMPのあらゆる部分――検証器、最初の露出の追跡、そして特殊な変調――が成功に貢献していることを明らかにしました。

しかし、彼らは一つの限界についても述べています。彼らはこのテストを一つのモデルサイズ(Qwen3-30B)でのみ実施しました。彼らは、この方法がそこでうまく機能することは示しているものの、より大規模なモデル(70B以上など)でも同様にうまく機能するかどうかはまだ証明されていないと指摘しています。したがって、実行されたテストについては結果は堅実ですが、より大きな脳に対する全潜在能力は、まだ開かれた問いとなっています。

要約すると、STAMPは、特定の動きがどのように真実を明らかにしたかにクレジットを与えることで、AI探偵に「目的地だけでなく、その過程(旅路)も大切にする」ことを教えているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →