← 最新の論文
🤖 AI

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMasterは、ローカル環境内でタスクを生成・解決することによりLLMベースの検索エージェントを訓練するセルフプレイフレームワークであり、高品質で根拠に基づいたデータを確保するためにEvidence-Chain Generator、Search-Depth Reward、およびOver-Opening Penaltyを活用することで、人間によるラベル付きの例に頼ることなく、ディープサーチのベンチマークにおける性能を大幅に向上させます。

原著者: Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータがただチャットをするだけでなく、まるで図書館で手がかりを探す探偵のように、インターネットに出て答えを見つけ出す世界を想像してみてください。これは「サーチエージェント(探索エージェント)」の領域です。これらは大規模言語モデル(LLM)に基づいた賢いプログラムであり、ウェブページを読み、リンクをクリックし、情報を組み合わせて複雑なパズルを解くことができます。長い間、こうしたデジタル探偵に仕事をうまくこなす方法を教えることは、頭の痛い問題でした。通常、検索の完璧な例を書き出すための高価な人間の教師や、手本を示すためのより強力なAIモデルが必要でした。しかし、もしAIが自分自身で教えることができたらどうでしょう?それが「セルフプレイ(自己対戦)」という概念の夢です。これは、AIが自ら課題を生成し、それを解決することで学習していくというコンセプトです。まるで、ビデオゲームのキャラクターが自らレベル(ステージ)を作成し、それをプレイして上達していくようなものです。しかし、大きな疑問があります。もしAIが近道をしてしまったらどうなるでしょうか?もしAIが、一見難しそうに見えて実はトリックであるようなパズルを作ったり、深く掘り下げる代わりに表面をなぞるだけで問題を解決したりしたらどうなるでしょうか?この論文はまさにその問題に取り組み、人間の手を一切借りずに、いかにして検索エージェントを誠実で、徹底的で、真に賢くなるよう訓練できるかを問いかけています。

ここで、AIのセルフプレイにおける「近道をする」問題を解決するために設計された、巧妙で新しいフレームワークであるSearchMasterが登場します。SearchMasterを、AI探偵チームの厳格だが公平なコーチだと考えてください。AIが目的もなく彷徨うのを許すのではなく、SearchMasterは、生成される学習データが実際に有用なものになるよう、従うべき3つの特定のルールを課します。

第一に、AIは**エビデンス・チェーン(証拠の連鎖)**を構築しなければなりません。AIが謎を解こうとしている場面を想像してください。一つのページを読んだだけで答えを推測するのではなく、地図上の点を結ぶように、異なる文書から手がかりを物理的に繋ぎ合わせなければなりません。もし、ある文書から別の文書へと明確な証拠の経路を示すことができなければ、そのタスクは拒否されます。これにより、AIが「実際には一瞥するだけで答えが出るような」偽りの難問を作り出すことを防ぎます。

第二に、AIには**サーチ・デプス・リワード(探索深度への報酬)**が与えられます。以前は、AIが問題を解決すれば、どれほど苦労したかにかかわらず「金メダル」をもらっていました。SearchMasterはゲームのルールを変えます。AIが大きな報酬を得られるのは、実際に深く掘り下げた場合のみです。もしAIがたった一ページを流し読みするだけでパズルを解いたなら、低いスコアを与えられます。しかし、答えを見つけるために多くのページを探索しなければならなかった場合は、称賛されます。これにより、浅い推測ではなく、真の多段階の調査を必要とするタスクをAIに作成させ、解決させるよう促します。

第三に、**オーバー・オープニング・ペナルティ(過剰開封への罰則)**があります。時として、AIは非効率であったり混乱したりして、答えに偶然辿り着こうと、実際には読んでいない膨大な数の文書を開いてしまうことがあります。SearchMasterはこの行動を罰します。これは、「家中のすべてのドアを開けていいわけではない。正しい鍵を探さなければならない」とコーチが言うようなものです。これにより、AIに効率性を強制し、本当に新しい情報が必要な場合にのみ文書を開くようにさせます。

この厳格な訓練の結果は目覚ましいものです。研究者が標準的なAIモデル(具体的にはQwen3.5-9Bバックボーン)を用いてこの手法をテストしたところ、深い検索問題を解決する能力は平均で**38.19%から51.52%**へと跳ね上がりました。特に困難なテストであるBrowseComp-Plusにおいて、その向上は劇的で、30.1ポイント(30.12%から60.24%へ)も上昇しました。最も素晴らしい点は、AIがこれらすべてを、人間が書いた例示やエキスパートによるデモンストレーションを一切使用せず、ローカルな検索環境を用いて自律的に学んだことです。エビデンス・チェーンにAIの学習を根ざさせ、その行動を規制することで、SearchMasterは、ルールに従うように教えられれば、AIが自分自身をより優れた探偵へと教え導けることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →