← 最新の論文
💬 NLP

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

本論文は、キュレーションされた 1 万件の SFT データセットを通じて、深層研究エージェントを検索中心の推論から構成中心の推論へと転換させるデータ合成パイプライン「WebAggregator」を導入し、32B モデルがベンチマークでトップクラスのシステムを上回る性能を発揮することを可能にし、次世代の研究エージェントにおける主要なボトルネックは検索ではなく、むしろ構成的推論であることを実証する。

原著者: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

公開日 2026-04-30
📖 1 分で読めます☕ さくっと読める

原著者: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

WebAggregatorという論文について、簡単な言葉と創造的な比喩を用いて説明します。

大きな問題:「グーグル使い」と「探偵」

あなたが研究助手を雇う場面を想像してください。

  • 古い方法(現在の AI エージェント): あなたが「2024 年の受賞者は誰ですか?」と尋ねると、彼らはすぐにブラウザを開き、Google に質問を入力してリストを見つけ、トップの名前を指し示します。これは情報探索です。速いですが、聞こえたことを繰り返すオウムのようなものです。もし答えが、パズルを解くために 3 つの異なるウェブサイトから 3 つの異なる事実を結びつける必要がある場合、そのオウムは混乱してしまいます。
  • 新しい目標(深層研究): あなたが「200 万平方キロメートルより大きい国の中で、2010 年から 2020 年の間に最も経済が不安定だった国はどれか?」と尋ねたとします。これに答えるために、エージェントは単に答えを「見つける」だけでは足りません。次のような作業が必要です:
    1. 大きな国のリストを見つける。
    2. 各国の経済データを見つける。
    3. 「不安定性」を計算するために複雑な数学を行う。
    4. 結果を比較する。
      これは構成的推論です。見出しを読むだけでなく、謎を解くために手がかりを組み立てる探偵のようなものです。

この論文は、現在の AI エージェントは「グーグル使い」としては優れているが、「探偵」としてはひどいと主張しています。彼らは正しいリンクを見つけることには頼りすぎており、見つかったものについて深く考えることには不十分です。

解決策:WebAggregator(「トレーニングジム」)

これを修正するために、研究者たちはWebAggregatorと呼ばれるシステムを構築しました。これは新しい AI というよりも、「グーグル使い」を「探偵」へと変えるために設計された専門的なトレーニングキャンプと考えるべきです。

このシステムは、難しい試験を作成する 2 人のチームのように、主に 2 つのフェーズで機能します。

  1. 能動的な探索者(収集屋):
    1 冊の本を持って巨大な図書館へ送り込まれたロボットを想像してください。その仕事は、その本を開き、他の本への参照を見つけ、その本へ移動し、写真を見つけ、ファイルをダウンロードし、隠されたボタンをクリックすることです。それはウェブ全体から散らばり、無秩序な大量の情報を収集します。

    • 論文内では: このエージェントは実際のウェブサイトを訪問し、ファイルをダウンロードし、複雑なページをナビゲートして生データを収集します。
  2. 構成的論理提案者(パズルの達人):
    収集屋がデータの山を手に入れたら、パズルの達人はそれを見て、「さて、このごちゃごちゃしたものを基に、1 ページを見るだけで答えられないような質問を作ろう」と言います。

    • 彼らは厳格なルールセット(12 種類の論理)を使用して、その質問が数学、フィルタリング、比較、そして時間旅行(時間的推論)を必要とするように強制します。
    • 例: 「中国の GDP は何か?」と尋ねる代わりに、「過去 10 年間の中国の GDP 成長率と都市化率を比較した標準偏差を計算せよ」と尋ねます。

結果:新しいデータセットと賢くなった AI

チームはこのシステムを用いて、約 1 万問の極めて難しい質問からなるWebAggregatorQAというデータセットを作成しました。その後、彼らはこれらの質問を用いて新しい AI モデル(WebAggregatorと命名)を訓練しました。

彼らがこの新しいモデルをテストした際に何が起きたかを示します。

  • 「検索の罠」: 研究者たちは、これらの難しい質問に対してトップクラスの AI モデル(GPT-4.1 や Claude-3.7 など)をテストしました。問題解決に必要なすべての正しいウェブサイトとドキュメントをモデルに与えたにもかかわらず、モデルは依然として失敗しました。

    • 比喩: 学生に正解がハイライトされた教科書を与えても、計算のやり方を理解していないため、数学の問題を解けないようなものです。
    • 発見: ボトルネックは情報を見つけることではなく、それを用いた推論にあります。
  • 変容: 彼らが WebAggregator データセットでモデルを訓練すると、エージェントの行動は変化しました。

    • 以前: 彼らはボタンを連打し、リンクを必死に開いていました(ツール使用は高いが思考は低い)。
    • 以後: 彼らはボタンをあまり押さず、代わりにドットを繋ぐために「思考」(内部推論)に多くの時間を費やすようになりました。
    • パフォーマンス: 新しいWebAggregator-32Bモデルは、これらの難しい推論タスクにおいて既存の最良のモデルを上回り、「探偵仕事」での訓練が AI をより賢くすることを証明しました。

結論

この論文は、AI が科学的発見を可能にする真の「深層研究」エージェントとなるためには、ウェブをどれだけ上手に検索できるかに焦点を当てるのをやめる必要があると結論付けています。代わりに、論理的な結論を形成するために散らばった情報の断片を縫い合わせる能力に焦点を当てる必要があります。

要約: この論文は、AI エージェントが実際のウェブデータを用いて複雑なパズルを解く練習をするジムを構築しました。その結果、パニックを起こすようにウェブを徘徊するエージェントではなく、思慮深く論理的な研究者のようなエージェントが生まれました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →