← 最新の論文
💻 computer science

SC2^{2}-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments

本論文では、状態レベルの計画精緻化のための内部フィードバックと、モデルレベルの修正のための条件付きワールド・アウェア適応を利用することで、連続環境における視覚と言語によるナビゲーションを強化する自己修正型ワールドモデルフレームワークであるSC2^{2}-WMを提案し、それによってナビゲーションの堅牢性と汎用性を向上させる。

原著者: Xuan Yao, Yuze Zhu, Junyu Gao, Zongmeng Wang, Changsheng Xu

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Xuan Yao, Yuze Zhu, Junyu Gao, Zongmeng Wang, Changsheng Xu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、巨大で目に見えない迷路の中で、ロボットにツアーガイドを教えています。ロボットにはカメラがあり、あなたの声を聞くことができますが、マップ全体を見ることはできません。見えるのは、レンズの正面にある範囲だけです。これが「視覚と言語によるナビゲーション(Vision-and-Language Navigation: VLN)」の世界です。ロボットは、「赤いソファの横を通り過ぎ、廊下で左に曲がり、ランプの前で止まって」といった文章を聞き取り、そのランプを見つけるために実際に体を動かさなければなりません。難しいのは、ロボットが「部分観測(partially observable)」の状態であることです。つまり、懐中電灯を持って暗い家の中を歩いているようなもので、自分がどこにいるかを知るためには、自分がどこを通ってきたかを記憶しておく必要があります。

今日のほとんどのロボットは、計画を立ててから、一歩ずつ実行していくことでこれを解決しようとします。しかし、振り返って自分がまだ正しい軌道に乗っているかを確認することはありません。それは、フロントガラスを覗き込んで壁にぶつかるまで確認することなく、紙の地図を見つめながら車を運転するようなものです。もしロボットが早い段階で小さなミス(例えば、少し左に曲がりすぎたなど)を犯すと、そのまま間違った方向に進み続け、エラーが積み重なって、最終的には救いようのないほど迷ってしまうのです。この論文は、ロボットに新しい考え方を導入しています。ただ盲目的に歩くのではなく、「次に何が起こるか」を「空想(デイドリーム)」し、その空想が現在の感覚と一致しているかを確認し、実際に一歩を踏み出す前に進路を修正することを学ぶのです。


道に迷わないために空想するロボット

SC2-WMという、新しいロボットの脳をご紹介しましょう。これは、複雑な連続的3D世界をナビゲートするために設計されました。著者たちは、ほとんどのロボットが、答え合わせをせずにテストを受けている学生のようだと気づきました。指示を読み、推測し、動く。もし推測を間違えても、壁にぶつかったり行き詰まったりするまで、それに気づきません。研究者たちは、ロボットに、自分自身の頭の中に住む「もう一つの目」を与えたいと考えました。

SC2-WMを、一種の超能力を持つロボットだと考えてください。その能力とは「先見の明(foresight)」です。ロボットは実際に足を動かす前に、立ち止まって自問自します。「もしこのステップを踏んだら、1秒後の世界はどう見えるだろうか?」と。これは「ワールドモデル(世界モデル)」と呼ばれる、未来のメンタルムービー(心の映画)を作成することです。それは、単に駒を動かすだけでなく、相手の次の手やその後の盤面の状態を想像するチェスプレイヤーのようなものです。

ここで魔法が起こります。ロボットは、自分の「未来のメンタルムービー」を現在の現実と比較します。

  • 「ステート・レベル(状態レベル)」の修正: あなたが歩いていて、「キッチンが見えるはずだ」と空想しているのに、目にはまだ寝室が見えている状況を想像してください。あなたの脳は「待て、何かがおかしい!」と言います。SC2-CMもまさにこれを行います。予測と現在の状態の間の不一致に気づくのです。そして、実際にステップを踏む前に、内部マップを優しく調整してエラーを修正します。それは、曲がり角を間違えたことに気づき、間違った通りに入ってしまう前に即座にルートを再計算するGPSのようなものです。
  • 「モデル・レベル(モデルレベル)」の修正: 時には、ロボットの空想能力が、見たこともない奇妙な部屋に対して十分でない場合があります。壁の色が違っていたり、家具の配置が変だったりする場合です。このような場合、ロボットは「自分の内部マップが古くなっている!」と気づきます。そして、特別な「適応モード」を起動します。この特定の新しい環境をより良く理解するために、自分の脳のルールを素早く更新するのです。それは、自分の学習ガイドが特定のテストには合っていないと気づいた学生が、新しい問題に合わせてノートを素早く書き直すようなものです。

この論文は、外部からの報酬(例えば、最後に人間が「よくできました!」と言うこと)に頼るのは、遅すぎて稀なすぎる現象であると主張しています。代わりに、SC2-WMは内部フィードバックを使用します。期待していたことと実際に見ていることの差(直感的な感覚)を聞き、リアルタイムで自分自身を修正するのです。

実験結果が示したこと

研究者たちは、この「空想する」ロボットを、家具や廊下、複雑な指示が詰まった複雑な3D環境であるR2R-CERxR-CEという2つの主要なデジタル世界でテストしました。彼らは、この自己修正能力を持たない他のトップクラスのロボットと比較しました。

結果は非常に有望でした。R2R-CEデータセットにおいて、ロボットが未知の部屋(訪れたことのない新しい家など)をナビゲートしなければならない際、SC2-WMは、従来の手法と比較して**成功率(SR)7.1%**向上させ、経路長で重み付けされた成功率(SPL)をほぼ7.8%向上させました。また、移動距離も平均して5メートル短く、他のロボットよりも彷徨うことが少なかったことを意味します。

さらに難易度の高い、より長く複雑な指示が含まれるRxR-CEデータセットでは、成功率は9.1%、経路効率は7.1%向上しました。研究者たちはまた、実世界の物理的なロボットである、カメラを備えたUnitree GO2 四足歩行ロボット(犬のような形のロボット)でもテストを行いました。実世界において、SC2-WMは85%の成功率を達成し、標準的なロボットの**70%**を上回りました。これは、「空想」のテクニックがコンピュータ上のシミュレーションだけでなく、乱雑な現実世界の部屋でも機能することを示唆しています。

なぜこれが重要なのか

この論文は、ロボットに自身の内部予測をチェックする能力を与えることで、ロボットをより信頼できるものにできると示唆しています。台本に従って動き、少しでも状況が変わると失敗してしまう硬直した機械ではなく、常にコンパスを確認しながら進む慎重な探検家のように振る舞うことができます。SC2-WMは、人間から間違いを指摘される必要はありません。自分の「空想」が現実と一致しないことに気づくことで、自力で判断するのです。

著者たちは、これがすべてを一瞬で解決する魔法の杖ではないことにも注意を払っています。彼らは、ロボットが最近の数ステップ(約4ステップ前まで)の記憶を持ち、本当に必要な時にだけ脳のルールを更新する場合に最もよく機能することを発見しました。また、他の手法が巨大で重いAIモデルを使用しているのに対し、SC2-WMは「軽量」であり、単一のグラフィックスカードで効率的に動作することも指摘しています。これは、クラウド上のスーパーコンピュータを必要とせず、私たちの家庭内をナビゲートできる小型の実世界のロボットに、将来的に搭載できる可能性があることを意味します。

要約すると、SC2-WMはロボットに「自己認識」を教えています。先を見通して考えることで、起こる前にミスを修正させることで、私たちはようやく、最初の廊下で迷うことなく、複雑で乱雑な世界をナビゲートできるロボットを手に入れられるかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →