← 最新の論文
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

本論文では、将来のマップ表現とナビゲーション・ウェイポイントを予測することで、能動的な探索と意味論的ナビゲーションの向上を可能にする、グローバルな時空間メモリ上で学習されたゴール条件付き潜在世界モデルであるGLAMを提案しており、GLAM NAVシステムがHM3D-ObjectNavタスクにおいてBSC-Navベースラインを上回ることを示している。

原著者: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

公開日 2026-09-16
📖 1 分で読めます☕ さくっと読める

原著者: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが、一度も見たことがない部屋に入り、目の前には見えていない特定の物体(例えば赤い椅子)を探すという任務を与えられた場面を想像してみてください。成功するためには、ロボットは単にカメラの目の前にあるものに反応するだけでは不十分です。移動しながら空間のメンタルイメージを構築し、自分がどこにいたかを記憶し、次の角を曲がった先に何があるかを予測しなければなりません。この「メモリの中に地図を保持し、前進するにつれてその地図がどのように変化するかを予期し、その予期を利用して次のステップを計画する」という能力こそが、能動的な探索(アクティブ・エクスプロレーション)の核心となる課題です。長年、研究者たちは、世界を高精細なピクセル単位で再構成させるか、あるいは既製の地図に頼らせることで、機械にこのスキルを教えようとしてきました。しかし、新しいアプローチは、ロボットがナビゲーションを行うために、すべてのレンガや影を見る必要はないことを示唆しています。ロボットに必要なのは、空間の構造と、目標への可能性の高い経路を理解することなのです。

研究チームは、GLAMと呼ばれるシステムを開発しました。これは「goal-conditioned latent world model trained over global spatiotemporal memory(全域的な時空間メモリ上で学習された目標条件付き潜在世界モデル)」の略称です。簡単に言えば、これは、完璧な詳細さで視覚的な世界を再現する必要なく、部屋の将来のレイアウトと目的地への最善の経路を学習するナビゲーションシステムです。次に秒単位で部屋がどのように見えるかという新しいビデオフレームを生成しようとする代わりに、このシステムは、マップの圧縮された抽象的な表現と、次にどこへ行くべきかという隠れた計画を予測します。このアプローチは、生物学的な脳、特に海馬がどのように空間メモリを整理し、将来のシナリオをシミュレートするために使用しているかに着想を得ています。研究者たちは、このモデルを中心に、オンラインマッピング、メモリ検索、および予測プランニングを一つのループに統合した「GLAM NAV」という完全なナビゲーションシステムを構築しました。

このシステムは、ロボットが移動するにつれて、環境の疎なデジタルメモリを絶えず更新することで機能します。このメモリは完全な3D写真ではなく、主要なランドマークと空間的関係の集合体です。ロボットがターゲットを見つける必要があるとき、現在の位置とすでに見たもののメモリを使用して、「もしこの方向に進んだら、マップはどう見えるか、そして目標に近づけるか?」という単純な問いを投げかけます。GLAMモデルは、これら2つのことを同時に予測することで答えます。第一に、ロボットが探索を進めるにつれて、マップトークン(メモリの抽象的な構成要素)がどのように進化するかを予測します。第二に、次に取るべきステップの隠れた表現である「潜在的なウェイポイント(latent waypoint)」を予測します。これらの予測は共有された空間で行われるため、モデルは変化するマップを必要な動きに直接結びつけることを学習します。これらはすべて、将来の生の視覚画像を再構成しようとすることなく実現されます。

このシステムを訓練するために、研究者はロボットを現実の世界に送り出して失敗を経験させることはしませんでした。代わりに、アパートやオフィスなどの実在する屋内環境の数百の詳細な3Dスキャンを含む、Habitatという高忠実度のシミュレーターを使用しました。彼らは、オブジェクトの場所を正確に知っている完璧なコンピュータ制御のエージェントが辿った軌跡(エキスパート・トラジェクトリー)を再生し、これらの経路を数千の訓練サンプルに分割しました。モデルは、マップトークンの履歴と目標を見て、将来のマップと次のウェイポイントを予測することを学習しました。決定的なことに、システムは視覚的な世界を再現するというタスクを無視するように教えられました。それは、空間の構造とナビゲーションのための計画を予測することに完全に集中しました。メインモデルを訓練する前に、研究者は、これらの隠れたウェイポイントの計画を実際の物理的な動きへと翻訳する方法を理解させるために、別のコンポーネントを事前学習させ、予測が実際のコマンドに変換されることを確実にしました。

シミュレーターでのテストにおいて、結果は、異なる種類のメモリ構造に依存する従来の手法よりも、この予測的アプローチが優れていることを示しました。テストシーンの50%の特定のセットにおいて、新しいシステムであるGLAM NAVは、86.89%の試行でターゲットオブジェクトを見つけることに成功しました。これは、比較対象となったベースラインシステムの成功率78.50%と比較して大幅な向上です。また、Success weighted by Path Length(経路長による成功重み付け)という指標が47.70%から48.35%に上昇したことから、より効率的にターゲットに到達できたことも分かりました。これらの数値は、マップの将来の構造と経路を同時に予測することで、ターゲットが最初は視界に入っていなくても、ロボットが道を見つける信頼性が高まったことを示唆しています。システムは単にルートを暗記したのではなく、環境のレイアウトを予測し、その予期に基づいて計画を調整することを学んだのです。

これが単にシミュレーターの結果によるものではないことを証明するために、研究者はこのシステムを、実世界のオフィス環境において、デュアルアームを備えた車輪駆動の人型ロボットに展開しました。最初の実世界テストでは、ロボットは事前に構築されたマップなしで、見たことがない部屋の中で鉢植えの植物を見つけるよう求められました。移動しながら、ロボットは空間のメモリを構築し、新しい視覚的観察を成長するマップへと結びつけました。ロボットは植物へと正常にナビゲートすることに成功し、システムが現実の物理的な設定において、ゼロから有用な空間メモリを構築できることを実証しました。2番目のテストでは、ロボットは植物が見えなくなった後、どこでそれを見たかを思い出すよう求められました。システムは、メモリから保存された位置を検索し、その場所へと正常に戻りました。これらのデモンストレーションは、モデルによる抽象的な予測が、現実の環境において、メモリを使用して「見えているもの」と「必要なもの」の間の溝を埋めることで、実際のロボットを導くことができることを確認しました。

これらの成功にもかかわらず、研究者は自らの研究の限界についても注意深く述べています。このシステムはシミュレーター内のエキスパートエージェントが辿った経路から学習するため、ロボットの行動が訓練中に見たパターンの中に留まっている場合に最も効果を発揮します。これは、あらゆるランダムなアクションの結果を予測できる汎用的なシミュレーターではなく、特定の目的のために最も可能性の高いマップと経路を推定する、目標指向のツールです。また、モデルは範囲としての可能性ではなく、単一の確定的な予測を生成するため、推測の不確実性を明示的に計算することはありません。もしロボットが学習したものとは大きく異なるレイアウトに遭遇したり、センサーのドリフトによって位置を見失ったりした場合、システムは苦戦する可能性があります。研究者は、ロボットは依然として、現在地を確認し衝突を回避するためにリアルタイムの観察に依存しており、予測はあくまで探索をガイドするためにのみ使用していることを強調しています。

この研究は、ロボットのナビゲーションに関する考え方に転換をもたらしています。コンピュータの中に世界の完璧で高解像度な複製を構築しようとする代わりに、このシステムは、計画に十分な、機能的で抽象的なバージョンのマップを用いて作業することを学びます。将来のマップの予測と次の動きの計画を一つの連結したタスクとして扱うことで、研究者たちは、より信頼性が高く、実世界の環境でも動作可能なシステムを作り上げました。この知見は、ロボットが効果的に探索するためには、すべてを見る必要はなく、次に何が起こるかを想像できる程度に空間の構造を理解していればよいということを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →