InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
本論文は、能動的探索、制御されたオフライン探索、およびオープンウェブ探索のシナリオにわたってテキストと視覚的証拠を動的に統合するシステムの能力における顕著な現在の限界を浮き彫りにする、インターリーブ型マルチモーダルエージェント検索のための包括的なベンチマークおよび評価フレームワークである InterLV-Search を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
複雑な謎を解こうとしていると想像してください。例えば、一連の手がかりに基づいて特定の人物を見つけるようなものです。
従来の方法(以前のベンチマーク):
現在のほとんどの AI「探偵」は、以下のように訓練されています。容疑者の写真を与え、「これは誰ですか?」や「その帽子の色は何ですか?」と尋ねると、AI は写真を見て答えます。写真だけでは不十分な場合、AI はその人物に関するテキストをインターネットで検索するかもしれませんが、写真を検索の「出発点」または「最終的な答え」としてしか扱いません。調査の「途中」で見つけた写真を使って方向転換することはめったにありません。これは、犯罪現場の写真を見てから、ただ新聞記事を読むだけで、3 ページ目に載っている新しい写真が実は全く異なる都市への手がかりだと気づかない探偵のようなものです。
新しい方法(InterLV-Search):
この論文「InterLV-Search」の著者たちは、AI がはるかに難しいことができるかどうかをテストするための新しい訓練場(ベンチマーク)を構築しました。それは「インターリーブ型マルチモーダル・エージェンティック・サーチ」です。
これは、事件を解決するために地図(テキスト)と写真(画像)を絶え間なく行き来しなければならない探偵だと考えてください。
- ひねり: AI は写真を見つけ、それを見て、「あっ!この写真の建物のロゴから、特定のブランド名を検索する必要があると気づいた」と考えます。その後、そのブランドを検索し、新しい車の写真を見つけ、その車のナンバープレートを見て、そのプレートが特定の都市を検索するよう指示していると判断します。
- 目標: 写真は単なる答えではなく、ハンドルです。それは AI に次にどこへ進むべきかを指示します。
難易度の 3 レベル
この論文は、難易度が上がるビデオゲームのように、AI を 3 つのレベルでテストします。
レベル 1:「写真を見つける」チャレンジ。
- タスク: AI には「この海賊船が登場するゲームを見つけてください」といったテキストの説明が与えられます。AI は船が何かを特定し、それを検索して画像を見つけ、その後その画像に関する質問(例:「この船はどのエンジンを使用していますか?」)に答える必要があります。
- 比喩: 隠された物体に関するなぞなぞが与えられます。なぞなぞに答える前に、まずその物体を見つけなければなりません。
レベル 2:「制御された迷路」チャレンジ。
- タスク: AI は地図がある閉ざされた部屋(制御されたオフラインデータベース)の中にいます。テキストの手がかりから始まり、写真を見つけ、その写真が新しい手がかりを与え、さらに別の写真を見つけ、というように続きます。
- 比喩: 赤いドアの写真を見つけることが青い車に関するテキストの手がかりにつながり、それが黄色い鳥の写真につながるような宝探しを想像してください。AI はドアの写真を活用して車を探すかどうかを決定しなければなりません。もし写真を見捨ててテキストを読み続けるだけであれば、迷子になってしまいます。
レベル 3:「荒れたインターネット」チャレンジ。
- タスク: 今度は AI は現実の、ごちゃごちゃしたインターネット上にいます。手がかりを検索し、写真を見つけ、いくつかの写真が偽物か無関係だと気づき、異なる経路を比較(例:「この映画は 60 分ですか、90 分ですか?」)し、続けるべき正しい経路を選択する必要があります。
- 比喩: これは、インターネット全体を使って事件を解決しようとする探偵のようなものです。彼らは何百万ものウェブサイトを精査しなければなりません。中には悪い写真があるサイトもあれば、間違った日付があるサイトもあり、画像で何を見ているかに基づいてどの経路をたどるべきか判断する必要があります。
彼らが発見したこと
著者たちは、GPT-5、Gemini、Claude などの最も賢い AI モデルの多くを、この新しいテストで試しました。
- 結果: AI モデルは現在、この分野で非常に苦手です。最も優れたモデルでも、正解率は 50% 未満でした。
- 問題点: AI モデルはテキストを読むことや単一の画像を見ることは得意ですが、検索の途中で見つかった写真が検索計画全体を変更する必要がある場合、点と点を結びつけることに苦労します。写真を見るべきときにテキストを探し続けてしまったり、写真を「新しい手がかり」ではなく単なる「最終確認」として扱ってしまったりすることがよくあります。
ツールキット(InterLV-Agent)
全員が同じルールでプレイしていることを確認するために、著者たちは「InterLV-Agent」という標準的な「ゲームコントローラー」を構築しました。このツールにより、AI はウェブブラウザを使用し、画像を検索し、画像を切り取り、これまでの発見を記録する「ノートブック」(メモリ)を保持できます。これにより、AI が失敗した場合は、ツールが不足していたからではなく、パズルを解けなかったからだと判断できます。
まとめ
簡単に言えば、この論文はこう述べています。「私たちは AI 探偵のために、より難しく新しいテストを構築しました。その結果、AI は賢くなりつつあるものの、検索の「途中」で見つけた写真を活用して考えを変え、次の手がかりを見つけることはまだ効果的に行えていないことがわかりました。これは、地図を読んだり写真を見たりはできるが、その写真が実際には別の道を進むよう指示していることに気づけない探偵のようなものです。」
著者たちは、このテストとツールを公開し、他の研究者がこのような「インターリーブ型」の思考に優れた AI を構築できるようになっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。