← 最新の論文
💻 computer science

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLNは、階層型メモリシステムを導入することで、オープンソースのゼロショット視覚言語ナビゲーションにおける「ナビゲーション・アムネジア(航行性健忘)」の問題に対処し、長期的なローカライゼーションと視覚的想起を大幅に強化し、既存の最先端のオープンソース手法のほぼ2倍の性能を達成しています。

原著者: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの声を理解し、あなたと同じように世界を見ることができるロボットを想像してみてください。これは「Embodied AI(身体性AI)」という分野の夢です。そこでは、コンピュータは単にチャットをしたり計算したりするだけでなく、部屋の中を物理的に移動し、「キッチンに行ってコップを取ってきて」といった指示に従い、壁にぶつかることなく複雑な空間をナビゲートします。長い間、これらのロボットが動き方を学ぶには、人間が作成した膨大な量のトレーニングデータが必要であり、それが新しい家やオフィスに適応するのを遅らせる原因となっていました。最近、科学者たちはロボットに常識を与えるために、大規模言語モデル(LLM)と呼ばれる巨大な「脳」モデルを使い始めました。これにより、事前のトレーニングなしに、その場でナビゲーションを判断できるようになりました。しかし、そこには落とし穴があります。最も賢い脳は、使用料がかかり、自宅のビデオフィードをサーバーに送信するためプライバシーの懸念が生じる、高価なクラウドベースの扉の向こう側に閉じ込められているのです。オープンソースのモデル(無料のローカルな脳)も存在しますが、それらはしばしば混乱したり、自分の居場所を忘れたり、あるいは円を描くように歩き回ったりしてしまい、できることと、高価でクローズドソースなモデルができることとの間に大きな隔たりがあります。

そこで登場するのが、オープンソースのロボットの脳に、自分がどこにいたのか、そしてどこに向かっているのかを記憶させる方法であるHiMemVLNです。これは、実質的に彼らの「ナビゲーション健忘症」を治療するものです。研究者たちは、オープンソースのロボットが2種類の物忘れを起こしていることを発見しました。それは、周囲の状況を見失ってループ状に歩いてしまう短期的な健忘症と、元の目標を見失って数歩進んだ後にコースから外れてしまう長期的な健忘症です。これを解決するために、チームは人間の脳の仕組みに触発された「階層的メモリシステム」を構築しました。彼らは、視覚的なスケッチブックのように機能し、直前に訪れた部屋の地図を常に描き続けることで、自分が円を描いて歩いていないかを察知する**Short-Term Localer(短期局所記憶)を作りました。また、コンパスやミッションコントローラーのように機能し、「あなたは寝室から出発しました。キッチンに行く必要があります。そして、現在は間違った方向に進んでいます」と、ロボットに大局的な状況を常に思い出させるLong-Term Globaler(長期全域記憶)**も構築しました。

これら2つのメモリシステムを組み合わせることで、HiMemVLNは、以前は高価なクローズドソースのモデルにしか見られなかったレベルの信頼性で、オープンソースのロボットをナビゲートさせることを可能にします。テストにおいて、この手法は単にロボットがループを回避するのを助けるだけでなく、従来の最高のオープンソース手法と比較して成功率をほぼ倍増させました。シミュレーション環境において、この新システムは成功率30%、成功重み付き経路長(SPL)26.85を達成し、わずか**16%の成功率しか記録できなかった従来のオープンソースのリーダーであるOpenNavを大幅に上回りました。研究者たちは実際の部屋の中で車輪型のロボットを用いて実世界でのテストも行いましたが、そこでも競合を打ち破り、OpenNavの18%に対して32%**の成功率を達成しました。この研究は、ロボットに目の前の視覚的な周囲の状況と長期的な目標の両方を記憶させる構造化された方法を与えることで、クラウドに依存することなく、安全でプライベートかつ非常に有能なナビゲーションエージェントを構築できることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →