← 最新の論文
🤖 AI

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

本論文は、リサーチ・ギャップ推論(Research Gap Inference)と呼ばれる新しいプロセスレベルのフィードバック手法を用いた、ディープ・リサーチ・エージェントのためのマルチターン評価フレームワークを導入しており、単一回の的を絞ったフィードバックはレポートの品質を大幅に向上させる一方で、その後のターンではエージェントが以前に満たされた基準へと退行してしまうため、改善が累積されないことを明らかにしており、これは信頼性の高いマルチターンでの改善が現在のアーキテクチャにおいては未だ到達圏外であることを示している。

原著者: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、複雑なトピック(例えば「ディープフェイク技術の歴史」や「特定の企業の財務健全性」など)について詳細なレポートを作成するために、非常に優秀なリサーチアシスタント(ディープ・リサーチ・エージェントと呼ばれます)を雇ったと想像してください。

通常、私たちはこれらのアシスタントをテストする際、質問を与え、ドラフトを一つ書かせ、その単一のドラフトを採点するという方法をとります。しかし、現実の世界で人間のリサーチャーからドラフトを受け取った場合、そのまま受け入れることは滅多にありません。「重要な法律を見落としていますよ」とか「情報源が曖昧すぎます」といったフィードバックを与え、書き直しを依頼します。

この論文は、次のような問いを投げかけています:これらのAIアシスタントは、フィードバックを与えられたときに実際に改善されるのでしょうか?それとも、自分の仕事を修正しようとして事態をめちゃくちゃにしてしまうのでしょうか?

研究者たちは、2つの異なるフィードバック方法を用いてこれをテストしました。

1. 「自己反省」テスト(目隠しをした編集者)

このシナリオでは、AIに対して「自分のレポートを見て、自分の間違いを見つけ、それを修正せよ」と指示します。外部からの助けは一切与えられません。

  • 結果: これは、教師の解答解説なしに、生徒に自分のエッセイを採点させるようなものでした。AIは一生懸命に努力し、ウェブをより多く検索し、より多くの情報源を読み込みましたが、「何が実際に間違っているのか」を判断することができませんでした。
  • 比喩: 目隠しをした状態で、浸水しているボートを修理しようとしている場面を想像してください。あなたは木を叩いたり、新しい板を追加したり(作業量自体は増やして)しますが、穴がどこにあるかが見えないため、別の場所に穴を開けてしまうかもしれません。その結果、ボートは依然として浸水しているか、あるいは以前よりもひどい状況になります。AIのスコアはほとんど変化しないか、時には悪化することさえありました。

2. 「プロセスレベル・フィードバック」テスト(戦略的なコーチ)

ここでは、研究者は単に「修正せよ」と言うのではなく、RGI(Research Gap Inference:リサーチ・ギャップ推論)と呼ばれる特別なツールを使用しました。このツールは、AIのレポートと採点基準(ルーブリック)を照らし合わせ、AIが「どのように失敗したか」を特定します。

「Xに関する事実を追加せよ」と言う代わりに、フィードバックはもっとコーチのようなものでした。「あなたは間違った種類の情報源を探しています」「このトピックを広範に捉えすぎています。もっと具体的な詳細に踏み込む必要があります」「最も重要な法的文書を見落としています」といった具合です。

  • 結果: これは、最初の修正ラウンドにおいて驚異的な効果を発揮しました。AIは戦略を理解し、図書館に戻り、正しい本を見つけ、より優れたレポートを書き上げました。彼らのスコアは大幅に上昇しました(約8から15ポイント)。
  • 比喩: これは、ランナーに対してコーチが「君はエネルギー切れで走れないのではない。靴のサイズが合っていないんだ」と伝えるようなものです。一度AIが正しい靴(正しいリサーチ戦略)を手に入れると、彼らははるかに速く、より良く走れるようになりました。

落とし穴:「書き直し」の問題

研究者たちは、AIにさらにもう一度(3回目のターン)実行させました。彼らはスコアが上が 계속していくことを期待していました。

  • 結果: ほとんどのAIモデルにおいて、改善は止まってしまいました。実際、残された小さな問題を修正しようとしたとき、彼らはすでに機能していた部分を誤って壊してしまったのです。
  • 比喩: 素晴らしいスープを作ったシェフを想像してください。コーチが「塩をひとつまみ加えて」と言います。シェフは塩を加え、完璧な味になります。しかしその後、コーチが「次は飾り付けを直して」と言います。完璧を目指そうとするシェフは、鍋ごと捨てて最初から作り直すという決断を下します。その過程で、新しく作った鍋に、先ほど加えたはずの塩を入れ忘れたり、最初に正しかった野菜の扱いを台無しにしたりしてしまうのです。
  • なぜか?: この研究で使用されたAIモデルは、修正のたびに「レポート全体をゼロから書き直す」という仕組みで動いています。彼らには「前回何が良かったのか」という記憶がありません。そのため、何かを修正しようとすると、すでに修正済みの部分まで失ってしまうのです。

たった一つの例外:「慎重な」モデル

ある特定のAIモデル(DeepSeek-V4-Flash)は、異なる挙動を示しました。このモデルは、鍋ごと捨ててしまうことはありませんでした。既存の良い部分を維持したまま、新しい材料を追加したのです。これにより、3回目でもスコアを再び向上させることができました。

  • コスト: しかし、この「慎重な」モデルは、信じられないほど高価で低速でした。他のモデルよりも約4倍の計算能力を消費し、考える時間も長くかかりました。それは、何も捨てようとせず、あらゆる材料を細かくチェックし続けるシェフのようで、膨大な時間と費用がかかるものでした。

まとめ

  1. AIは自分自身を直せない: AIに「自分の間違いを直せ」と言っても、全体像が見えていないため、通常は事態を悪化させるか、変化なしに終わります。
  2. 戦略的なフィードバックは有効である: AIに「どのようにリサーチすべきか」(例:「ブログ記事ではなく、公式文書を探せ」)を教えると、彼らははるかに優れたレポートを書くことができます。
  3. 「フル・リライト(全書き換え)」の欠陥: 現在のAIリサーチツールは、新しい筆致を加えたいときに、キャンバス全体を消しゴムで消してしまう芸術家のようなものです。これにより、ステップごとにレポートを改善しようとしても、良くなった部分を誤って削除してしまうことが非常に困難になっています。真に信頼できる、多段階の改善を実現するためには、毎回最初からやり直すのではなく、何が正しかったのかを記憶し、修正が必要な箇所だけを変更できるAIが必要なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →