← 最新の論文
🤖 AI

VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

本論文は、最先端の視覚言語モデルが、スケーリングや推論介入、明示的な指示によっても解消されない根本的な局所的外乱への耐性の欠如により、視覚経路追従に苦慮していることを明らかにする。

原著者: Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

公開日 2026-05-18
📖 1 分で読めます☕ さくっと読める

原著者: Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いロボットと「点と点を結ぶ」ゲームをしていると想像してください。あなたは特定の赤い点を指さして、「このジグザグの線に沿って端まで進み、通ったすべての点の色を教えてください」と言います。

ロボットはこれを簡単にこなすだろうと期待します。しかし、この論文によると、最も高度なAIモデル(ビジョン・ランゲージモデル、またはVLM)さえも、この単純なタスクが苦手です。彼らは単にランダムな間違いをするのではなく、注意が逸れて、指示された線とほぼ同じに見える別の線に切り替わってしまいます。

以下に、研究者たちが発見した内容を、簡単なアナロジーを用いて解説します。

1. 「混雑した駅」の問題

研究者たちは、これらのAIがどのように線をたどるかを調べるため、2つの主要なテストを作成しました。

  • 回路テスト: 多くの同色の配線が並行して走る、ごちゃごちゃした電気基板を想像してください。AIに「ポート7」に接続されている配線を追うよう指示します。
  • 渦巻きテスト: 色付きの点が乗った、1本の螺旋階段(キャンディケインのような形)を想像してください。AIに、階段の底から上まで登るよう指示します。

結果: AIは正しく開始しますが、ほぼ即座に混乱します。追うべき線のすぐ隣に、もう1本の配線や螺旋の曲がり角がある場合、AIはしばしばその隣に「ジャンプ」してしまいます。まるで、森の中を単一の道筋を追って歩くハイカーが、数フィート並行して走る2つの道があるところで、うっかり間違った道に足を踏み入れてしまい、そのまま歩き続けてしまうようなものです。

2. 「双子」の気晴らし

この論文は、AIが失敗するのはタスクが難しすぎるからでも、「見る」ことができないからでもないと発見しました。失敗の原因は局所的な競合にあります。

次のように考えてみてください。静かな部屋で友人の話を聞こうとしています。簡単です。次に、友人が話しているが、そのすぐ隣に、全く同じ服を着て、全く同じ声で、全く同じ言葉を話している双子がいると想像してください。友人が誰かを知っていても、あなたの脳は混乱し、双子の話を聞き始めてしまうかもしれません。

研究者たちは、隣接する線がターゲットの線と非常に似ている場合(同じ色、同じ角度、同じ形状)、AIの注意が隣に引き寄せられることを発見しました。AIは霧の中のように「見失う」のではなく、間違った道が局所的にあまりにも魅力的に見えるため、積極的に間違った道を選択します。

3. なぜ「一生懸命考える」ことが役立たないのか

研究者たちは、AIに「ステップバイステップで考える」よう指示することで(推論と呼ばれる技術)、これを修正しようと試みました。AIが一時停止し、より詳しく見て、「待て、あれは間違った線だ」と言うことを期待しました。

アナロジー: 道に迷った観光客に「どの方向に行くか、もっと一生懸命考えろ」と言うようなものです。観光客は地図(視覚的な線)を見る代わりに、「通常、道路はこう曲がる」「太陽が左にあるから、右に行こう」といった一般的なルールに基づいて推測し始めます。

論文は以下のことを発見しました。

  • 推論は視覚を修正しなかった: AIは線を正しくたどり始めませんでした。代わりに、「ショートカット」や推測を使い始めました。例えば、渦巻きテストでは、一部のAIは線をたどるのをやめ、渦巻きの形に基づいて点の順序を推測しました(例:「内側の円は赤だから、次は青に違いない」)。
  • コストが増大した: AIが「考える」ようになると、膨大な計算資源を消費しました(人間が「赤、青、緑」と言うために10分間独り言を言い続けるようなもの)が、それでも答えは間違っていました。
  • 指示は機能しなかった: 研究者たちが「似ていても線を変えてはならない」という厳格なルールブックをAIに与えても、AIはルールを無視し、間違った線にジャンプし続けました。

4. 「大脳」神話

通常、AIが間違いを犯すとき、それはモデルが小さすぎるからだと思われます。「脳を大きくすれば、正しくなるはずだ」と考えます。

研究者たちは、小規模から大規模(最大2,350億パラメータ)までのモデルを使ってこれをテストしました。

  • 結果: より大きなモデルはわずかに良い結果を出しましたが、その差は微々たるものでした。最も大きく、最も高価なモデルさえも、「混雑した駅」で迷子になりました。脳を大きくしても、絡み合ったごちゃごちゃの中で単一の糸を保持する能力は向上しませんでした。

5. 現実世界の混沌

最後に、研究者たちは、工場の絡み合ったケーブルや複雑な地下鉄の路線図などの現実世界の画像でこれをテストしました。

  • 発見: 同じ問題が発生しました。AIが3つの路線が交差する駅を通過する地下鉄の路線を追ったり、ノットを通るケーブルを追ったりしようとすると、間違った線に切り替わり続けました。「ジャンプ」する行動は、彼らの架空のテストにおける単なる不具合ではなく、現実の厄介な状況でも起こります。

結論

この論文は、現在のAIモデルは「何が何か」を認識すること(例:「あれは地下鉄の路線図だ」)においては優れているが、「何かを追跡すること」(例:「この特定の線をAからBまでたどれ」)においては驚くほど苦手であると結論付けています。

彼らは、非常に似たような道がすぐ隣にある場合、注意を1つの道に固定し続けるための特定の「筋肉」を欠いています。これらの「視覚的な双子」を無視する専用のメカニズムを持つAIが構築されるまで、彼らは最も単純な線追跡ゲームで迷い続けるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →