← 最新の論文
💻 computer science

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

本論文は、ウェブスケールの動画を用いたオフライン事前学習と、インタラクティブな推論と安全性を向上させるためのシミュレーションにおける強化学習を組み合わせることでナビゲーション基盤モデルを強化する、Seeing-to-Experiencing (S2E) フレームワークを導入し、新たな評価ベンチマークである NavBench-GS によってこれをサポートするものである。

原著者: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

公開日 2026-06-12
📖 1 分で読めます☕ さくっと読める

原著者: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題:「観光客」対「地元住民」

想像してみてください。あなたはロボットに、賑やかな街の中を歩く方法を教えようとしています。

従来の方法(ただ「見る」だけ):
現在、ほとんどのナビゲーションロボットは、街を歩いている動画を何千時間も視聴した「観光客」のように訓練されています。彼らは画面上であらゆる種類の通り、人混み、障害物を見てきました。これは**オフライン事前学習(Offline Pre-training)**と呼ばれます。

  • 欠点: スケートボーダーを避けている人の動画を見るのと、実際にスケートボーダーを避けることは全く別物です。ロボットは衝突がどのように「見える」かは知っていますが、転倒する際の「物理学」や、止まるために必要なコンマ数秒のタイミングまでは理解していません。もしロボットが現実世界で歩こうとすると、間違った方向へ曲がった時の「結果」を実際に「感じた」ことがないため、立ち往生したり衝突したりする可能性があります。ロボットには**因果関係(原因と結果)**が欠けているのです。

新しい方法(「S2E」フレームワーク):
著者らは、**S2E(Seeing-to-Experiencing:見ることから体験することへ)**と呼ばれる新しい手法を提案しています。これは、その観光客を、非常にリアルで安全なビデオゲーム・シミュレーターに送り込み、怪我をすることなく、実際に歩き、つまずき、失敗から学ぶプロセスだと考えてください。

目標は、動画を視聴して得た幅広い知識と、現実世界で実際に練習して得た**「街の勘(ストリートスマート)」**を組み合わせることです。


その仕組み:2つのステップのレシピ

S2Eフレームワークは、これを効率的に実現するために2つの主要な「トリック」を使用しています。

1. 「アンカー」システム(動画フェーズにおいて)

課題: ロボットが動画を見ているとき、ある時は人が真っ直理に進み、ある時は犬を避けるために左に曲がり、またある時は赤信号で止まるのを目にします。これらすべての行動は、同じ状況において有効なものです。もしロボットが、ただ一つの「平均的な経路」を予測しようとすると、失敗してしまいます。

解決策: 著者らは、**アンカー誘導型分布マッチング(Anchor-Guided Distribution Matching)**と呼ばれるものを使用しています。

  • 比喩: ロボットがレシピを予想しようとしているシェフだと想像してください。単一の味を予想するのではなく、テーブルの上にいくつかの「アンカー」(例えば、「スパイシー」「甘口」「塩味」といった特定の味のプロファイル)を置きます。
  • どのように役立つか: ロボットは、特定の状況に対して、答えが「スパイシー(直進)」である可能性もあれば、「塩味(左折)」である可能性もあることを学びます。これらのアンカーを使用することで、ロボットは単なる一つの平均的な推測ではなく、起こりうる「良質なアクションのメニュー」を予測することを学びます。これにより、ロボットはより柔軟になり、さまざまなシナリオに備えることができます。

2. 「残差(レジデュアル)」の脳(練習フェーズにおいて)

課題: 一度ロボットがシミュレーターの中で練習を始めたら、新しいテクニック(動いている歩行者を避けるなど)を学ばせたいと考えています。しかし、もしロボットに最初からすべてを学び直させようとすると、真っ直ぐ歩いたり歩道を認識したりする方法を忘れてしまうかもしれません。これは「破滅的忘却(catastrophic forgetting)」と呼ばれます。また、シミュレーターは現実世界とは少し異なる(照明やテクスチャが違う)ため、ロボットを混乱させる可能性があります。

解決策: 彼らは**残差注意モジュール(Residual-Attention Module)**を使用しています。

  • 比喩: ロボットには、通りを認識することに長けた「ベースとなる脳(動画で訓練された部分)」があると想像してください。シミュレーターに入るとき、私たちはこのベースとなる脳を置き換えることはしません。代わりに、その上に小さくて軽量な「追加の脳(残差モジュール)」を取り付けます。
  • どのように役立つか: ベースとなる脳は凍結(固定)されたまま、一般的な知識を守ります。追加の脳だけが学習を行います。それは、新しいインタラクティブな要素だけに集中します。「おっと、あの人が動いている、速度を落とさなければ」といった具合です。
  • メリット: これは、連絡先を削除することなく、スマートフォンに新しいアプリを追加するようなものです。ロボットは、元の一般的な知識(道路の認識など)を失うことなく、新しい反応的なスキル(回避や停止)を獲得します。

テスト走行:NavBench-GS

この手法を証明するために、著者らはNavBench-GSと呼ばれる新しいテスト場を構築しました。

  • それは何か?: 単なる2D画像(通りの写真を見ている状態)でテストするのではなく、現実世界と全く同じ見た目で、かつ現実の物理法則を持つ3D世界を構築しました。ロボットに向かってボールを投げると、ロボットはそれに反応します。
  • 結果:
    • 動画のみで訓練されたロボット(「観光客」)は、動いている人々や障害物に直面すると頻繁に衝突しました。
    • S2Eメソッドで訓練されたロボット(「地元住民」)は、はるかに優れた性能を示しました。目的地に到達する確率が高く、衝突も大幅に減少しました。
    • 効率性の驚き: S2Eで訓練されたロボットは、より少ないデータでより速く学習しました。わずか100時間のデータとシミュレーターでの練習で訓練されたロボットは、2,000時間を超える動画データで訓練された他のロボットよりも優れた性能を発揮しました。これは、**「インタラクティブな練習は、単に動画をより多く見るよりも価値がある」**ということを証明しています。

現実世界での証明

チームはシミュレーションに留まりませんでした。彼らは作成したモデルを2つの実機に搭載しました。

  1. 車輪型ロボット(配送ロボットのようなもの)。
  2. 四足歩行ロボット(犬のようなロボット)。

彼らはこれらのロボットを、実際の街の通りで、本物の障害物や人々がいる環境でテストしました。S2Eロボットは、それらの特定の通りに関する事前の個別訓練なしに(ゼロショット汎化)、複雑な環境を正常にナビゲートできました。彼らは歩道を維持し、歩行者を避けることができ、シミュレーターで学んだスキルが現実世界に完璧に転移できることを証明しました。

まとめ

この論文は、ロボットを真に賢いナビゲーターにするためには、単に動画を大量に流し込むだけでは不十分であると主張しています。私たちは、彼らに**「練習」**させなければなりません。安定した「動画ベース」の基盤と、元の知識を上書きしない「練習ベース」の学習モジュールを組み合わせることで、ロボットは混沌とした現実世界を安全かつ効率的にナビゲートする方法を学ぶことができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →