← 最新の論文
💻 computer science

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLNは、効率的な長期的履歴保持のためのピラミッド型エピソードメモリと、自己回帰的デコーディングのレイテンシを回避するための原子的な中間レベルのアクションを用いたプロシージャルメモリを統合することで、最先端の性能と14 FPSの推論を実現するリアルタイムな視覚・言語ナビゲーションフレームワークである。

原著者: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに、一度も見たことがない家の中を歩く方法を教えようとしている場面を想像してみてください。ガイドとなるのは、「キッチンへ行き、青い花瓶のところで左に曲がり、冷蔵庫のそばで止まってください」という音声だけです。これがVision-and-Language Navigation (VLN)の世界です。これは、コンピュータ・エージェントが音声指示を理解し、カメラを通して世界を見ながら、次にどこへ移動すべきかを判断しなければならない、ロボティクスと人工知能の一分野です。難しい点は、ロボットはビデオゲームのようにある場所から別の場所へジャンプできるわけではなく、連続的な空間の中で、実際の一歩一歩の動作を行わなければならないということです。これを上手に行うためには、ロボットには2つの超能力が必要です。一つは、自分がどこから始まり、どこへ向かっているのかを記憶しておくための長期記憶(迷わないため)、そしてもう一つは、今見ているものに対して即座に反応するための素早い反射神経です。ロボットが考えるのに時間がかかりすぎると壁にぶつかり、過去を忘れてしまうと円を描くように彷徨ってしまいます。科学者たちは、これら両方を同時にこなせるロボットを構築しようと試みてきましたが、通常、賢さ(知能)と速さのどちらかを選択しなければなりませんでした。

そこで、両方のいいとこ取りができる新しいロボットの脳、MemVLNが登場しました。このプロジェクトの背後にいる研究者たちは、現在のロボットが苦戦している理由は、あらゆる旅の詳細を同じ高い品質で記憶しようとするため、動作が極端に遅くなってしまうことにあると気づきました。MemVLNは、人間の記憶の仕組みを模倣することで、この問題を解決します。これは、記憶を**エピソード記憶(Episodic Memory)手続き型記憶(Procedural Memory)**という2つの特別なタイプに分割します。エピソード記憶は、直近の写真がハイデフィニション(高解像度)である一方で、古い写真は小さなサムネイルに縮小されているフォトアルバムのようなものです。これにより、ロボットは膨大なデータに足を取られることなく、今自分がどこにいるかを鮮明に把握しながら、数時間前に通った道の全体的な形状を記憶し続けることができます。次に、手続き型記憶は、運転やタイピングにおける「筋肉の記憶」のようなものです。ロボットが「今から左に曲がって前方に進みます」といった長い文章を丁寧に打ち込む代わりに、あらかじめ用意された「アクション・トークン」というショートカット用の語彙を使用します。これにより、遅延の原因となる低速なステップ・バイ・ステップの思考プロセスをスキップし、一瞬の閃きで意思決定を行うことができるのです。

本論文では、これら2つの記憶スタイルを組み合わせることで、連続的な環境を14 FPS(フレーム毎秒)の速度でナビゲートすることに成功したフレームワークとしてMemVLNを紹介しています。これは、以前の手法が、長い視覚的履歴の保持とリアルタイム制御のバランスを取るのに苦労していたことを踏まえると、大幅なスピードアップです。ピラミッド型の解像度戦略を用いることで、システムは直近の視界をフル解像度の512 × 512で処理し、短期的な視界を256 × 256、長期的な履歴を圧縮された128 × 128で処理します。これにより、ロボットは目の前のものに集中しながら、過去の要約を保持することができます。手続き型記憶については、チームは標準的な低速なアクション生成方法(シーケンスに300ms以上を要する)を、複雑な動きを単一のトークンで表現する「高速アクション」メカニメントに置き換え、時間を約70msに短縮しました。

標準的なナビゲーション・ベンチマーク、具体的にはR2R-CEおよびRxR-CEを用いたテスト結果は、このアプローチが非常に有効であることを示唆しています。著者らは、彼らのモデルであるMemVLN-4Bが、R2RデータセットにおいてベースラインであるQwen3-VL-4Bアーキテクチャを成功率で5.8%、RxRデータセットで9.7%上回ったことを明らかにしました。おそらく最も印象的なのは、新しいシステムが推論レイテンシにおいて7倍の高速化を達成し、リアルタイムでの動作を可能にしたことです。論文では、トークン・マージング(データを圧縮するために他のシステムで使用される手法)が最善の解決策であるという考えに対し、それが高度なポジショニングに必要な空間グリッドを破壊してしまうと明示的に反論しています。代わりに、彼らのピラミッド型解像度は、データの構造を維持したまま圧縮を行います。また、記憶のピラミッドの異なる「形状」についてもテストを行い、直近の視界に最も高い解像度を与える「アセンディング(上昇型)」のデザインが最適であることを発見しました。このモデルは、深度カメラのような追加のセンサーを使わず、標準的なRGBビデオ(人間の目と同じ)と自然言語のみに依存していますが、これはスマートな記憶システムが限られた視覚データによる不足を補えることを示唆しています。この研究は、高精細な直近の観察と圧縮された履歴のバランスを取ること、そして高速アクションの語彙を使用することで、ロボットがかつてないほど効果的かつ迅速に、未知の複雑な空間をナビゲートできることを裏付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →