← 最新の論文
💻 computer science

AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation

AdaGeoVLNは、異なる深さにおける階層的な幾何学基盤モデルの表現を選択的に融合し、かつ有界メモリメカニズムを通じてナビゲーションを意識した履歴的な幾何学的証拠を保持することにより、性能を向上させるストリーミング・ビジョン・ランゲージ・ナビゲーション・フレームワークである。

原著者: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

公開日 2026-09-17
📖 1 分で読めます☕ さくっと読める

原著者: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが、一度も見たことがない家の中を、音声による一連の指示に従って進もうとしている場面を想像してみてください。成功するためには、ロボットは単に椅子が椅子であることや、ドアがドアであることを認識するだけでは不十分です。物体が空間の中で互いにどのように関係しているのか、自身の視点が移動に伴ってどのように変化するのか、そして自分が歩いている経路が耳にしている指示とどのように結びついているのかを理解しなければなりません。ビジョン・ランゲージ・ナビゲーション(Vision-Language Navigation)として知られるこの課題は、エージェントがカメラと音声コマンドのみを使用して、リアルタイムで世界のメンタルマップを構築することを要求します。長年、研究者たちは膨大な量の視覚データを機械に与えることでこのスキルを教えようとしてきましたが、ある決定的な問いが未解決のまま残されていました。それは、「現代のAIモデルが持つ深い層状の幾何学的理解を、ロボットはいかにして活用すべきか」、そして「将来の意思決定を適切に行うために、過去の情報をどの程度記憶しておくべきか」という問いです。

研究チームは、ロボットの世界の見方と記憶の保存方法を変えることで、これらの問いに答える「AdaGeoVLN」と呼ばれる新しいシステムを導入しました。このシステムは、周囲の状況を単一の最終的なスナップショットに頼るのではなく、自身の思考プロセスの複数の段階から有用な幾何学的情報を引き出すことを学習します。さらに、これまで見たすべてのフレームを記憶しようとするのではなく、記憶容量をすぐに使い果たしてしまうようなことはしません。その代わりに、慎重なアーキビスト(記録保管係)のように振る舞い、自分がどこにいて次にどこへ行くべきかを理解するのに役立つ、最も重要な歴史的瞬間だけを保持します。このアプローチにより、ロボットは深度カメラや既製のマップのような追加のセンサーを使用することなく、標準的なビデオフィードのみを用いて、複雑で未知の環境をナビゲートすることが可能になります。

この新しい手法の核心は、ロボットが視覚情報をどのように処理するかという点にあります。幾何学を理解する現代の人工知能モデルは、各層が画像を少しずつ異なる形で処理する、深いスタック構造のように構築されています。初期の層は単純な形状やエッジを捉え、より深い層は複雑な構造や空間的な関係を理解します。従来のシステムは通常、これらの初期の層を無視し、プロセスの最後の方で単一の最終的なシーンの要約を使用するまで待ち続けていました。しかし、研究者たちはこれが間違いであることを見出しました。ロボットの意思決定ステップを、幾何学モデルの複数の層(初期、中期、および後期のステージを同時に使用)に接続することで、ロボットは周囲の環境をより豊かな理解を得ることができました。この多層的なアプローチは、単に最終的な要約を繰り返し注入することよりもはるかに効果的であり、ロボットが異なる「レンズ」を通して同時に世界を見ることによって恩恵を受けることを示唆しています。

二つ目の主要な革新は、メモリの問題に対処するものです。ロボットが家の中を歩き回ると、連続的な視覚データのストリームが生成されます。このデータのすべてを保存することは、特に長い旅路においては、不可能に近い量のメモリを必要とします。従来の手法は、直前に起きたことが最も重要であると仮定して、最も新しいフレームや固定数の過去のビューを保持することがよくありました。しかし、研究者たちは、もし特定のランドマークが含まれていたり、あるいは独特な曲がり角を示していたりする場合、古いビューが極めて重要になり得ることに気づきました。AdaGeoVL𝙩は、現在の指示に対する関連性、そのビューの幾何学的な詳細に対するロボットの確信度、そしてそのビューがこれまでに見たものとどれほど異なっているかという3つの特定の基準に基づいて、どの記憶を保持するかを選択することで、この問題を解決します。これにより、ロボットは冗長な情報を破棄しながら、後のナビゲーションに役立つ特定の瞬間を保持することができるのです。

これらのアイデアをテストするために、研究者たちは数千件のシミュレーションによるナビゲーションタスクでシステムを訓練し、科学界で使用されている2つの標準的なベンチマークで評価を行いました。結果は、新しいシステムが従来の手法を大幅に上回る性能を示したことを証明しました。あるテストセットにおいて、システムは55.7パーセントの確率で目的地に到達することに成功しましたが、これは外部データを使用しない既存の最高水準のシステムと比較しても顕著な改善です。さらに重要なことに、このシステムは、大量の履歴を保存しようとする他のアプローチよりもはるかに少ないコンピュータメモリを使用しながら、この高いレベルのパフォーマンスを達成しました。研究者たちは、記憶することを選択的に行うことで、ロボットが不要なデータに足を取られることなく、空間的な認識能力を維持できることを実証しました。

チームはコンピュータ・シミュレーションに留まりませんでした。彼らは訓練されたポリシーを、標準的なカメラを備えた人間サイズの物理的なロボットに展開しました。現実世界での試行において、ロボットは「暖炉から離れる」「湾曲した階段を登る」「特定のドアの前で止まる」といった、複数のステップを含む指示に従うことに成功しました。ロボットは植物を正しい側で通り過ぎ、無関係なドアを回避することに成功し、選択的なメモリと多層的な幾何学的推論が、仮想世界だけでなく現実世界でも機能することを証明しました。研究者たちは、システムは非常に効果的であるものの、異なるメモリ信号をどのようにバランスさせるかを洗練させる余地がまだあると指摘していますが、異なる深さと時間の幾何学を選択するという根本的なアプローチは、機械に世界の中を移動する方法を教えるための強力な手法であることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →