← 最新の論文
🤖 AI

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

本論文は、検索対象について明示的に推論し、KnowledgeMapを通じて探索空間を構造化することで、検索拡張生成を向上させるマルチモーダル・エージェント・フレームワークであるMM-R2を提案しており、これは新たな軌跡データセットと2段階の事後学習戦略に支えられ、ベンチマーク・データセットにおいて優れた正確性と解釈可能性を実現している。

原著者: Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは謎解きに挑んでいるところだと想像してください。ただし、単一の手がかりがあるのではなく、本や写真、地図が巨大な箱の中に一気に投げ込まれた、ひどく散らかった山を前にしているのです。これが「マルチモーダル検索増強生成(mRAG)」の世界です。これは、コンピュータが写真に関する事実を膨大なライブラリから探し出すことで、質問に答えられるようにしたいという、もっともらしい方法を意味しています。通常、コンピュータがこれを行おうとすると、巨大なスーパーマーケットの中で慌てふためく買い物客のような振る舞いをします。質問を掴み取り、店全体に向かって叫び、最初に見つけた数少ないアイテムが正解であることを祈るのです。問題は、コンピュータが「何を」探しているのか、あるいは「どこに」そのアイテムが隠されているのかを本当には理解していないため、しばしば間違ったものを掴んでしまうことです。それは、「赤い車」と頼んだのに、コンピュータが単に「赤」という言葉を見て、最初に見つけた赤いものを掴んでしまい、結果として「赤いリンゴ」の写真を手に入れてしまうようなものです。

ここで新しい論文が登場します。研究者たちは、検索を開始する前に、立ち止まって考える必要があることに気づきました。彼らはこの新しいシステムを、MM-R2(「検索する前に推論せよ(Reason Before You Retrieve)」の略)と呼んでいます。闇雲に虚空に向かって叫ぶ代わりに、MM-R2は賢い探偵のように振る舞います。まず、画像と質問を一緒に見て、正確に何が「手がかり」(写真の中の特定の物体)であり、どのような種類の情報が必要なのかを突き止めます。そして、バラバラな箱全体を検索する代わりに、「知識マップ(KnowledgeMap)」と呼ばれる、特別に整理された図書館の地図を参照します。正しい通路を選び、正しい本を手に取り、それを読み、他の場所を見る必要があるかどうかを判断します。この論文は、この「まず考える」ステップを踏むことで、コンピュータはより正確に正解を見つけ出すことができ、さらにはどのように謎を解いたかを証明するために、そのプロセスを示すことさえできると示唆しています。

探偵の新しい戦略

この論文の核心となるアイデアは、現在のコンピュータは行動に移すのが早すぎるということです。あなたが写真を見せながら「この写真に写っている鳥の種類は何ですか?」と質問したとき、現在のシステムは単に言葉と画像を無理やり混ぜ合わせ、一度にすべてを検索し始めてしまいます。著者たちは、これが間違いであると主張しています。彼らは、これらのシステムが、どの部分の画像が重要なのか、あるいは具体的にどのような事実が必要なのかが分からないために混乱していることを発見しました。それは、図書館中のあらゆる本に対して「ケーキ」という言葉で検索して特定のレシピを探すよりも、直接「製菓」のセクションへ行く方が早いのに、わざわざ全館を検索しているようなものです。

これを修正するために、チームはMM-R2を構築しました。これは、コンピュータに検索する前に立ち止まって計画を立てるよう強制するシステムです。彼らはプロセスを、3つの楽しいステップに分解しています。

  1. 「何」と「どこ」の計画: 検索を行う前に、システムは「検索状態(retrieval state)」を作成します。これは、完璧な買い物リストを書くことだと考えてください。システムは、情報ニーズ(何を知る必要があるか?)、接地された指示対象(Grounded Referent)(写真の中のどの特定の物体について話しているのか?)、および制約(日付が必要か? 場所か? 学術的な名称か?)を特定します。これにより、コンピュータが無関係な詳細に気を取られるのを防ぎます。
  2. 整理された地図(KnowledgeMap): 研究者たちは、平坦で散らかった事実のリストを検索するのは非効率であることに気づきました。そこで、彼らはライブラリをKnowledgeMapへと整理しました。ライブラリが単なる本の山ではなく、ラベル付けされた一連のビン(箱)であると考えてください。「鳥用」、「車用」、「歴史用」といった具合です。コンピュータは買い物リストを手にしたとき、ライブラリ全体を検索するのではなく、まずどのビンを開けるかを決定します。これは「ルーティング(経路選択)」と呼ばれます。
  3. 探偵のループ: コンピュータが正しいビン(検索ユニット)を選んだら、そのビンの中で具体的な答えを探します。もし答えが見つかれば、成功です! もし見つからなければ、別のビンを選ぶか、より具体的な質問を投げ直すことができます。コンピュータは、事件を解決するための証拠が集まるまで、これを繰り返します。

彼らはどのようにコンピュータに考え方を教えたのか

「コンピュータはどうやって探偵のように計画することを学ぶのか?」と疑問に思うかもしれません。著者たちは、単にコンピュータに「賢くなれ」と言ったわけではありません。代わりに、彼らはMM-R2-Trajと呼ばれる、膨大なトレーニングデータセットを作成しました。このデータセットには、90万件の「思考プロセス」の例が含まれています。

先生が学生にパズルの解き方を教えている場面を想像してください。先生は単に答えを与えるのではなく、手順を示します。「まず、角のピースを見て。次に、色ごとに分ける。それから、これら2つを組み合わせてみて」。研究者たちは、「先生」となるAIを使用して、学生となるAIのために、これらのステップ・バイ・ステップの物語を生成しました。彼らは学生に対し、以下を教えました。

  • 画像と質問を分析して計画を立てること。
  • 正しい「ビン」(KnowledgeMapユニット)を選択すること。
  • そのビンの中で具体的な質問をすること。
  • 見つけた内容を要約すること。
  • 完了したのか、それとも再度調べる必要があるのかを判断すること。

彼らは、コンピュータを2段階で訓練しました。まず、**教師あり微調整(Supervised Fine-Tuning: SFT)**を用いました。これは、学生が基本ルールを学ぶために先生のノートを書き写すようなものです。次に、**グループ相対方策最適化(Group Relative Policy Optimization: GRPO)**を用いました。これは、学生がさまざまな戦略を試し、正解すれば高得点を得られ、間違えれば次は別の道を通るように学習するゲームのようなものです。これにより、コンピュータは正しい選択を行うことに非常に長けてようになりました。

結果:より賢く、より明快に

彼らが2つの大きな課題――InfoSeek(130万組の画像と質問のペアを含むデータセット)と、百科事典的VQA(百科事典形式の知識テスト)――でMM-R2をテストしたところ、結果は目覚ましいものでした。

InfoSeekのテストにおいて、MM-R2は全体で**54.3%の確率で正解を得ました。これは、通常46〜47%程度にとどまる他のスマートなシステムと比較して、大きな飛躍です。さらに、コンピュータが未経験の質問に対処しなければならない「未知の質問(Unseen-Question)」の部分において、MM-R2は56.0%を記録し、これまでの最高スコアを確実に上回りました。百科事典的VQAのテストにおいても39.4%**に達しており、質問が非常に具体的で困難な場合でも機能することを示しました。

しかし、この論文が示唆しているのは、単にスコアを上げることよりもさらに重要なこと、すなわち透明性です。MM-R2はステップを計画するため、私たちはそれがどのように問題を解決したのかを実際に見ることができます。

  • 優れたルーティング: システムは、古いシステムがわずか**23%**であったのに対し、**74%**の割合で正しい「ビン」(KnowledgeMapユニット)を正しく選択しました。これにより、間違った場所を探して時間を浪費することがなくなりました。
  • より明確な説明: システムが回答を説明する際、より簡潔で焦点が絞られていました。「忠実度(Fidelity)」スコア(回答が実際に発見された証拠に基づいているかを確認するもの)は0.90であり、これは回答が単なる推測ではなく、ほぼ完全に発見された事実に基づいていることを意味します。

これが何を意味するか

この論文は、単に「すべてを検索する」という古い手法が限界に達していることを示唆しています。コンピュータに検索する前に推論させることを強制することで、より賢く、かつより信頼できるシステムを構築できます。彼らは単に推測するのではなく、論理的な経路に従い、自らの仕事をチェックし、どのように答えを見つけたのかを正確に示すことができます。それは、混沌としたスカベンジャーハント(宝探し)と、よく計画された探偵の任務との違いです。研究者たちは、これはマルチモーダルAIにおける特定のアプローチであり、世界のあらゆる問題を解決するものではないと述べていますが、その結果は、行動する前に一呼吸置いて考えることが、スマートなコンピュータの未来における強力な戦略であることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →