From Web to Pixels: Bringing Agentic Search into Visual Perception
本論文は、対象の局所化に先立って外部知識を通じて対象を同定する必要がある新たなオープンワールド視覚認識課題「Perception Deep Research」を導入し、検索に基づくグラウンディング、セグメンテーション、および VQA において最先端のオープンソース性能を実証する WebEye ベンチマークと Pixel-Searcher エージェントフレームワークを用いてこれに対処する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
「ウォーリーを探せ!」(または「ウォリーを探せ!」)というゲームを想像してみてください。ただし、少しひねりを加えたバージョンです。
古典的なゲームでは、混雑した絵を見て、ウォーリーの外見——赤と白の縞模様のシャツ、帽子、そして眼鏡——に基づいて彼を見つけます。ウォーリーが「誰」であるかを知らなくても構いません。視覚的なパターンを特定するだけで十分なのです。
この論文は、現在のほとんどの AI 視覚システムが、この古典的なゲームに囚われていると主張しています。 これらのシステムは、「赤い車」や「青いシャツを着た人」のように、外見が似ているものを見つけるのは得意です。しかし、何が「見えるか」ではなく、写真からは見えない事実に基づいて「誰」であるかを問われると、苦戦します。
新しい課題:「謎のゲスト」
著者たちは、**「知覚深層調査(Perception Deep Research)」**と呼ばれる、より困難なゲームの新しいバージョンを導入しました。
混雑したパーティーの写真があると想像してください。質問は「赤いシャツを着た人を見つけなさい」ではありません。代わりに、以下のような質問が出ます。
「2026 年 1 月に、ある会社が 27 億ドルでそのブランドを買収した後、スキンケアブランドのグローバルアンバサダーになった人物を見つけなさい。」
この問題は、写真を見るだけでは解決できません。写真には買収の価格タグも、アンバサダー発表の日付も表示されていません。正しい人物を見つけるには、AI は以下の手順を踏む必要があります。
- ウェブ探索へ出かける: どのブランドが買収され、いつ、誰がアンバサダーだったのかを調べるためにインターネットを検索します。
- 謎を解く: 「ああ、写真の中の『ウィンター』という名前の人物が、私たちが探している人物だ」と気づきます。
- ピクセルを指し示す: 最後に、写真に戻り、ウィンターの周りに枠を描きます。
この論文では、これを**「ウェブからピクセルへ(From Web to Pixels)」**と呼んでいます。これは、インターネット上の事実を画像内の特定の場所と結びつけることを意味します。
彼らが開発したツール
AI がこれを実行できるかどうかをテストするために、チームは主に 2 つのものを構築しました。
1. WebEyes(テストコース)
これは AI 向けの専門的な障害物コースだと考えてください。これには 120 枚の複雑な画像と、数百の難問が含まれています。
- ひねり: どの質問も、画像のどこを見るかを推測する前に、AI が有名人の最近の役職、製品の発売日、キャラクターの背景話などの隠された事実を調べることを要求します。
- 目標: AI は単に質問に答えるだけでなく、その答えに一致する人物や物体を写真の正確な位置に指し示さなければなりません。
2. Pixel-Searcher(賢い探偵)
これは、このテストを受けるために著者たちが作成した新しい AI エージェントです。単に画像をじっと見つめて推測するのではなく、Pixel-Searcher は拡大鏡とラップトップを持った探偵のように行動します。
- ステップ 1:検索: 質問を分解します。「アンバサダーは誰だったか?」「取引はいつ行われたか?」ウェブを検索し、結果を読み取ります。
- ステップ 2:推論: 情報を結びつけます。「よし、取引は 1 月にあり、アンバサダーはウィンターだ。」
- ステップ 3:探索: 画像に戻ります。検索で言及された特定の服や特徴など、ウィンターに「似ている」人物を探し、その周りに枠を描きます。
彼らが発見したこと
研究者たちは、Pixel-Searcher を他の賢い AI モデルと比較してテストしました。その結果は以下の通りです。
- 古い AI モデル: これらの「謎のゲスト」の質問に直面すると、標準的な AI モデルは混乱しました。彼らは写真で見えたものや、トレーニングからすでに「知っていた」ものに基づいて推測しようとしました。隠された事実を見つけられなかったため、間違った人物を選ぶことがよくありました。
- Pixel-Searcher: この新しいエージェントは、オープンソースモデルの中で最も良いパフォーマンスを発揮しました。実際にウェブを検索し、手がかりを推論することで、はるかに高い頻度で正しいターゲットを特定することに成功しました。
依然として苦労している点:
この論文は、AI が失敗するのは人物を完璧な枠で囲めないからではないと指摘しています。失敗はプロセスのより早い段階で起こります。
- 不適切な検索: 間違ったものを検索したり、重要な事実を見逃したりすることがあります。
- 誤った同一性: 正しい事実を突き止めても、写真の中の間違った人物を選んでしまいます(例:アンバサダーが「ウィンター」だと分かっても、名前の同じ間違った人物を指し示す)。
- 結合: 「事実(ウィンター)」と「視覚(写真の中の人物)」を結びつけることに苦労します。
全体像
この論文は、AI が真に世界を理解するためには、単に形を見る「カメラ」であってはならないと結論付けています。情報を調べ、謎を解き、その知識を使って写真の中の正しいものを指し示すことができる「研究者」である必要があります。彼らはこの新しい分野を**「知覚深層調査(Perception Deep Research)」**と呼び、他の科学者がより優れた「探偵」AI を構築できるよう、ツール(WebEyes と Pixel-Searcher)を提供しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。