← 最新の論文
💻 computer science

Towards Spatial Supersensing in the Wild

本論文は、空間的な超感覚能力を評価するために設計された実世界の長尺動画による大規模ベンチマークであるVSI-Super-Wildを紹介し、現在のマルチモーダルモデルが空間的崩壊や更新不足といった問題により、時間の経過に伴う一貫した世界状態の追跡において根本的に失敗していることを明らかにしている。

原著者: Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、活気ある街を歩いているところだと想像してみてください。あなたは単にバラバラの写真を眺めているのではありません。頭の中にメンタルマップ(精神的な地図)を構築しているのです。コーヒーショップは左側にあり、銀行の角で右に曲がり、同じ赤い自転車を3回通り過ぎたことを理解しています。このように、目に見えるもの、自分がどこにいるか、そして自分が何をしたかを一つの連続した物語へと編み上げる能力こそが、人間が世界をナビゲートする方法です。科学者たちはこれを「ワールドモデリング(世界モデルの構築)」と呼んでいます。長い間、コンピュータプログラムは猫や車の単一の写真を認識することには長けてきました。しかし、長い動画を視聴して、その物語を把握し続けること――例えば、一日中歩き回った後に、鍵をどこに置いたかを正確に思い出すようなこと――に関しては、コンピュータは苦戦してきました。コンピュータは物語を見失ったり、登場人物を混同したりしてしまう傾向があります。この論文は、その具体的な苦闘について掘り下げています。人工知能は、ビデオストリームを見ている間に、実際に信頼できる内部的な世界の地図を構築できるのでしょうか? それとも、現在のフレームがどのように見えるかに基づいて推測しているだけなのでしょうか?

この研究の背後にある研究者たち(清華大学、NVIDIA、スタンフォード大学のチーム)は、世界で最も賢いビデオ読解AIモデルに対して、非常に厳しいテストを課すことにしました。彼らは、VSI-SUPER-WILDという新しいベンチマークを作成しました。これは、AIにとっての「サバイバル・チャレンジ」だと考えてください。これまでのテストは、静かで空っぽの部屋で特定の芸をいくつか教え込む犬の訓練のようなものでした。しかし、この新しいテストは、AIを、インターネットから集めた、編集されていない、混沌とした現実世界の荒野へと放り込みます。彼らは、賑やかな通りやショッピングモールから、病院、オフィスビルに至るまで、あらゆるものを網羅する442本の現実世界のビデオを集めました。これらは、断片的なクリップを繋ぎ合わせたものではなく、人生の雑多で連続的な流れを捉えた、4時間以上に及ぶものもあります。

目的は、これらのAIモデルが真の「メンタルマップ」を必要とする質問に答えられるかどうかを確認することでした。彼らは、人間の記憶に基づいた4種類のチャレンジを設計しました。

  1. 「どちらの方向?」テスト: ビデオを見た後、AIはカメラ(カメラを持っている人)が前進、後退、左、または右に動いていたかを判断できるか?
  2. 「どこにいた?」テスト: カメラが回転して同じ場所を異なる角度から見たとしても、AIは訪れた場所の順序を記憶できるか?
  3. 「いつ起きた?」テスト: 青いバックパックのような特定の物体が、最初にいつ現れ、いつ消えたかをAIは正確に記憶できるか?
  4. 「いくつあった?」テスト: AIは、同じものを二重にカウントすることなく、ユニークなアイテム(例:「何個の異なる消火栓を通り過ぎたか?」)を数えることができるか?

結果は、一種の警鐘となりました。非常に高度であるにもかかわらず、テストされた13種類のAIモデル(Googleのトップティアのモデルやオープンソースのプロジェクトを含む)は、振る舞いが芳しくありませんでした。最高のモデルでさえ、全体で約**44%**の正解率しか出せず、これは偶然当たるレベルとほとんど変わりません。論文は、これらのモデルが「ショートカット(近道)」に頼っているために失敗しているのだと示唆しています。3Dマップを構築する代わりに、彼らは単一のフレームを見て推測しているのです。例えば、道路が見えると、彼らは実際には後退していても、「通常そうなるから」という理由で「前進」していると仮定してしまいます。

研究者たちは、AIモデルが「崩壊」する4つの具体的な方法を特定しました。

  • 空間的崩壊(Spatial Collapse): カメラの視点を回転させると、AIはその場所が同じであることを忘れてしまいます。回転した視点を完全に新しい場所として扱い、空間感覚を失います。
  • 意味的ショートカット(Semantic Shortcuts): AIは、物事がどのように動いているかではなく、それらがどのように「見えるか」に基づいて推測します。道路を見ると、実際の動きを追跡することなく「前進運動」を仮定します。
  • 更新不足(Insufficient Update): AIはビデオの序盤を覚えることは得意ですが、新しい情報が入ってくるにつれて記憶を更新することに失敗します。最初の印象に固執し、後の証拠を無視してしまいます。
  • インスタンスの混乱(Instance Confusion): AIは現実世界の乱雑さに混乱します。物体がぼやけていたり、一部が隠れていたりすると、それを以前見たものと同じ物体ではなく、新しい物体だと勘違いしてしまいます。

また、研究ではビデオが長くなるほど、AIのパフォーマンスが悪化することも判明しました。ビデオが長くなるにつれ(10分から2時間以上にわたって)、モデルの一貫した物語を維持する能力は著しく低下しました。これは、AIが単一の瞬間を理解することには長けていても、空間と時間の整合性のある長期的な記憶を維持する能力がいまだ欠けていることを示唆しています。論文は、AIが人間のように世界を真に理解するためには、単に写真を認識することを超えて、空間と時間の安定し、更新されるマップを構築することを学ぶ必要があると結論付けています。それまでは、もしあなたが長い一日の後に「どこに鍵を置いたか」とAIに尋ねても、AIはもっともらしく聞こえるけれど真実ではない物語を語るだけかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →