← 最新の論文
🤖 AI

Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis

本論文は、検索の意思決定と情報の統合を分離することで、制御可能な統合パイプラインとDelegSearchBenchベンチマークによって現在のエンドツーエンドの正確性指標における限界を明らかにする、ディープサーチエージェントを評価するための解きほぐされたフレームワークとしての「Delegation Intelligence」を導入するものである。

原著者: Xinhao Yao, Yuanzhuo Liu, Changhao Wang, Yunfei Yu, Haoran Tan, Yuyao Zhang, Ruifeng Ren, Minlong Peng, Yong Liu

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Xinhao Yao, Yuanzhuo Liu, Changhao Wang, Yunfei Yu, Haoran Tan, Yuyao Zhang, Ruifeng Ren, Minlong Peng, Yong Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、目の前にすべてのピースが揃っていない、巨大でトリッキーなパズルを解こうとしているところだと想像してください。人工知能の世界では、「大規模言語モデル」と呼ばれるコンピュータプログラムが質問に答えようとする際、まさにこのようなことが起きています。長い間、私たちはこれらのモデルを、教科書を暗記すればテストで満点が取れる「非常に賢い学生」のように扱ってきました。もし答えが記憶の中にあれば、彼らはテストに合格します。しかし、現実の世界はクローズドブック形式の試験ではありません。答えが教科書の中にはなく、図書館やニュースアーカイブ、あるいは日々変化するウェブサイトの中に隠されていることもあります。ここで「ディープサーチ(深層検索)」が登場します。これは、AIが「おや、私はこれを知らない」と気づき、外へ出て適切な情報を見つけ出し、それらのピースを組み立てる能力のことです。

しかし、現在私たちがこれらの「AI探偵」をテストする方法には大きな問題があります。通常、私たちは最終的な答えだけを見て、「正解したか?」を確認します。正解していれば金メダルを与え、間違っていれば赤い「×」をつけます。しかし、これは数学のテストで、実際に計算を行ったのか、それとも単に勘で当たったのかを確認せずに、結果だけで生徒を採点するようなものです。もしかしたら、以前のレッスンで覚えたことを思い出して正解したのかもしれませんし、あるいは偶然当たっただけかもしれません。私たちは、彼らが「どのようにして」そこに辿り着いたのかを知りません。彼らは、推測をやめて探し始めるべきタイミングを知っていたのでしょうか? どの情報源を信頼すべきだと判断できたのでしょうか? それとも、ただ運が良かっただけなのでしょうか? 本論文は、単に最終スコアを見るのではなく、探偵としての仕事そのものを観察する必要があると主張しています。

この論文の背後にいる研究者たち(テンセントと人民大学のチーム)は、AIエージェントの「委任知能(Delegation Intelligence)」と呼ばれる能力をテストするための特別な「訓練場」を構築することにしました。これは、AIがいつ一人で問題を解決するのをやめて、検索エンジンに仕事を任せるべきかを判断する能力だと考えてください。彼らは、優れた「ディープサーチ」ができることは、単一の超能力ではなく、実際には2つの異なるスキルが組み合わさったものであることに気づきました。

第一のスキルは「検索意思決定(Search Decision-Making)」です。これは「気づき」の瞬間です。AIが「行き詰まった。もっと情報が必要だ」と言うか、逆に「十分な情報が集まった。これ以上探す必要はない」と判断することです。これは、壁に頭をぶつけ続ける探偵と、研究所に助けを求めるべきタイミングを知っている探偵の違いのようなものです。第二のスキルは「情報の統合と検証(Information Synthesis & Verification)」です。一度AIが外に出て多くの文書を見つけてきたとき、それらが真実か偽物かを見分けることができるでしょうか? ニュース記事の中にある嘘を見抜けるでしょうか? 3つの異なるウェブサイトからの手がかりを組み合わせて謎を解くことができるでしょうか? これは「読解力」ですが、少しひねりが加えられています。AIはノイズ、嘘、そして混乱を招く情報に対処しなければならないのです。

これらのスキルを適切にテストするために、チームはインターネット上のランダムな質問を使うことはできませんでした。それではあまりにも無秩序になってしまうからです。代わりに、彼らは「制御可能な合成パイプライン(Controllable Synthesis Pipeline)」を構築しました。彼らがスパイ映画の監督であると想像してください。俳優に即興をさせるのではなく、脚本を逆向きに書いていくのです。まず「真実」(高品質な文書)から始め、次にその文書がなければ答えられないような質問を作成します。そして、「ディストラクタ(紛らわしい要素)」、つまり本物と非常によく似ているものの、日付が間違っていたり著者が偽物であったりと、極めて小さな致命的な誤りを含む偽の文書を作成します。さらに「ノイズ」、つまりAIを混乱させる可能性はあるものの、全く無関係な文書も作成します。こうすることで、彼らはAIが何を求めているべきか、そしてどのような罠を仕掛けたのかを正確に把握できるのです。

彼らはこのパイプラインを用いて、「DelegSearchBench」という429のトリッキーな質問を含む新しいテストを作成しました。そして、AIのパフォーマンスを確認するために、2つの異なる方法でテストを実施しました。

まず、AIに「すべての文書」(本物、偽物、およびノイズ)を与えましたが、「検索ツール」はオフにしました。これは、第二のスキルである「統合と検証」をテストするためのものです。彼らは、AIが自ら探しに行く必要がない状態で、目の前にすべての答えがあるときに、その中の真実を見つけ出せるかどうかを調べました。その結果、驚くべきことが判明しました。たとえ目の前に正しい答えがあっても、AIはしばしば失敗したのです。それは、まるで机の上に教科書が開かれているのに、正しいページを見つけられない学生のようでした。AIは情報の配置によって混乱が生じていました。もし正解が長い文書リストの真ん中にあった場合、AIはそれを見落としがちでした(これは「Lost in the Middle」として知られる問題です)。また、AIは一貫性に欠けていました。同じ質問を3回投げかけたとき、1回は正解しても他の2回は間違えることがあり、これは推論しているのではなく、勘で答えていることを示唆していました。

次に、AIに「わずかな文書」だけを与え(重要な文書を除外した状態)、かつ「検索ツール」をオンにしました。これは、第一のスキルである「検索意思決定」をテストするためのものです。彼らは、AIが情報の欠如に気づき、検索を行う決断を下すかどうかを調べました。ここでの結果は、評価が分かれるものでした。一部のモデルは自信過剰であり、事実を手に入れていないにもかかわらず回答しようとし、「早すぎる回答(premature answering)」を招いていました。また、熱心すぎるモデルもあり、積極的に検索はするものの、何を検索すべきか分からなかったり、得られた新しい情報を既存の情報と組み合わせることができなかったりしました。

この研究からの大きな教訓は、「正しい答えを得ることだけでは不十分である」ということです。真にスマートなAIエージェントには、その答えを「どのように得るか」を知る必要があります。知らないことを認める謙虚さを持ち、正しい問いを立てる賢さを持ち、そして情報を見つけたときにそれが嘘であることを見抜く鋭さを持たなければなりません。著者たちは、あるモデルが正しい答えを出せるからといって、それが優れた「ディープサーチ」エージェントであるとは限らないと指摘しています。それは単に運が良かっただけかもしれないし、調査ではなく記憶に頼っているだけかもしれません。

要約すると、本論文は、現在のAIモデルがいまだに優れた探偵になる方法を学習している最中であることを示しています。彼らは、すべてのピースが手渡された状態であればパズルを解くのが得意ですが、自分でピースを探しに行かなければならない場合、特にそのピースの箱が偽物で満たされている場合には、苦戦します。スキルを分解し、それぞれを個別にテストすることで、研究者たちは、単に正解を推測するだけでなく、まさにどのようにしてその答えを見つけるべきかを理解しているAIを構築したいと考えています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →