Robostral Navigate
Robostral Navigateは、240万件のシミュレーション軌跡を用いたスケーラブルな学習レシピ、プレフィックス・キャッシングによる効率化、および深度センサーや事前構築された地図を不要にする画像空間でのウェイポイント予測を活用することで、多様なロボットの形態にわたる最先端の単眼ナビゲーションを実現する8B(80億パラメータ)の視覚言語モデルです。
原著者: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにツアーガイドとしての役割を教える場面を想像してみてください。ロボット工学の世界では、これを「エンボディド・ナビゲーション(身体化されたナビゲーション)」と呼びます。これは、「キッチンへ行って」という音声コマンドを理解し、壁にぶつかることなく実際にそこまで歩いていく能力のことです。長い間、優れたツアーガイドといえば、高級な宇宙飛行士のようなものでした。彼らは仕事をこなすために、高価で重厚な装備を必要としたのです。特殊な3Dグラス(深度センサー)を装着したり、警備チームのように複数のカメラを携えたり、あるいは建物全体のあらかじめ描かれた地図に頼ったりしていました。これらのロボットは優秀でしたが、高価で壊れやすく、シンプルな配送用ドローンや小さな倉庫用車輪に搭載するのは困難でした。科学者たちが問い続けてきた大きな疑問は、「これほどまでにシンプルで一般的なツールだけを使って、同じくらい賢いロボットを作れるのか?」ということでした。その答えは、今日ほぼすべてのスマートフォンやロボットに搭載されているような、たった一つの標準的なカメラと、残りの部分を解明できるほど強力な「脳」の中にあります。
本論文では、その単一の標準的なカメラのみを使用してナビゲーションのパズルを解決するように設計された、新しい種類のロボットの脳、「Robostral Navigate」を紹介します。これは、3Dマップやレーザースキャナーを必要とせず、代わりに写真を見るだけで旅の次のステップを「指さす」方法を学ぶロボットだと考えてください。研究者たちは、80億パラメータを持つ「ビジョン・ランゲージ・モデル」(読み書きと視覚の両方が可能な超スマートなAI)を構築し、ビデオゲームのようなシミュレーションの中で何百万もの例を見せることで、ナビゲーションの方法を教え込みました。このモデルは、何メートル移動するかといった複雑な数学的計算を行う代わりに、画面上の次に進むべき場所を単に指さします。もし目的地が角の向方向に隠れている場合は、一定の距離だけ前進するというバックアッププランに切り替えます。
チームはこのシンプルなアプローチが非常に強力であることを発見しました。35万もの異なるシーンにわたる240万回のシミュレーション上の旅を通じてモデルを訓練することで、安価で構築が容易なだけでなく、豪華なセンサーを備えたロボットよりも賢いシステムを作り上げました。標準的なテストにおいて、Robostral Navigateは目的地に到達する成功率77.4%を達成し、単一カメラを使用する従来の最高水準のロボットを大きく引き離しただけでなく、深度センサーや複数のカメラを使用する一部のロボットをも凌駕しました。その「秘伝のソース」は、単なる「指さし」ではありませんでした。学習プロセスを22倍高速化させた新しいトレーニングのトリックと、迷った時のリカバリー方法を教え込む強化学習のフェーズです。その結果、このロボットは、車輪付きのカートから歩行マシン、あるいは飛行ドローンへと、再学習を必要とせずに移行できることが証明されました。つまり、真に汎用的なロボットを作るために、100万ドルのセンサー群は必要ないということを証明したのです。
技術要約: Robostral Navigate
問題提起
具現化されたナビゲーション・システム(embodied navigation systems)を大規模に展開するには、大きな障壁が存在する。現在の最先端の手法は、多くの場合、特権的なセンシング・モダリティ(深度センサー、LiDAR、マルチカメラ・リグ)や、あらかじめ構築された地図に依存している。これらの依存関係はハードウェアコストを増大させ、多様なロボットの形態(車輪型、脚式、飛行型)への互換性を制限し、環境ごとのキャリブレーションを必要とする。さらに、これらのシステムを訓練するには、広範かつコストのかかる実世界でのデータ収集が必要となる。課題は、センサーへの仮定を最小限に抑え、異なるロボットの形態間で汎用性を持ち、シミュレーションのみを用いて効率的に学習できるナビゲーションのレシピを開発することである。
手法
Robostral Navigateは、単一のモノキュラーRGB画像ストリームのみを使用して具現化されたナビゲーションを解決するために設計された、80億パラメータのビジョン・ランゲージ・モデル(VLM)である。このシステムは、ナビゲーションを、VLMによる高レベルのプランニングと、拡散ポリシー(diffusion policy)による低レベルの制御という、2つの明確なステージに分解する。
1. モデル・アーキテクチャ
- ビジョン・ランゲージ・プランナー (8B VLM): コアとなるモデルは、空間的なグラウンディング(ポインティング、計数、ローカライゼーション)のために設計された高密度なVLMから初期化されている。これは、自然言語の指示とモノキュラーRGBフレームの履歴を入力として受け取る。
- ポインティングによるナビゲーション: 特定のロボットの幾何学的形状に紐付いたメトリックな変位を予測する代わりに、VLMは現在のカメラビュー内の次なるターゲット位置(画像座標 u,v)と、望ましい方位角の変化(Δθ)を「指し示す(pointing)」ことでウェイポイントを予測する。この画像空間における定式化により、カメラの内部パラメータやシーンのスケールに対する堅牢性が確保される。
- 変位へのフォールバック: 目的地が視野外にある場合(例:旋回が必要な場合)に対処するため、モデルはポインティング座標とともに、メトリックな変位(Δx,Δy,Δθ)を共同で予測する。目的地が見えない場合は、画像座標を省略し、メトリックな変位のみに依存する。
- 拡散ポリシー (121M パラメータ): VLMによって推論されたウェイポイントは、軽量な拡散トランスフォーマーによって低レベルのモーターコマンドへと変換される。このポリシーは、10Hzで相対的な2D変位と1D回転の密な軌跡を出力し、それがモーション・トラッキング・コントローラーによって高周波のアクチュエータ・トルクへと変換される。
2. 学習戦略
学習パイプラインは、シミュレーションのみに完全に依存することで、最大限の効率性とスケーラビリティを実現するように設計されている。
- データ生成: システムは、35万個のシミュレーション・シーン(屋内および屋外)にわたる約240万個のエキスパート・トラジェトリを用いて訓練される。データ生成には、多様なスタート/ゴール位置と、変化に富んだシーンの複雑さを保証するために、最遠点サンプリング(farthest-point sampling)が用いられる。
- プレフィックス・キャッシングとアテンション・マスキング: 標準的な逐次学習(トークンの複雑さが O(T2) でスケールする)の計算効率の問題に対処するため、著者らはプレフィックス・キャッシング技術を採用している。エピソード全体を単一の学習シーケンスにパッキングする。また、訓練中にモデルが過去の正解アクションに条件付けされるのを防ぐために、ツリーベースのアテンション・マスクを使用する。これは、過去の正解アクションが将来のアクションに対して非常に情報量が多い(特に「最も遠くに見えるウェイポイント」のパラダイムにおいて)ためであり、モデルが視覚的にグラウンディングされた予測ではなく、それらに依存してしまうのを防ぐためである。これにより、学習トークン数を22倍削減し、訓練時間を数ヶ月から数日へと短縮した。
- クロスロボットの汎用性: データ生成中、ロボットの構成(高さ、半径、カメラの配置、ピッチ)がランダム化される。これにより、学習されたポリシーは、再学習なしに異なるエンボディメント(形態)へと転移することが可能になる。
- オンライン強化学習 (RL): 教師あり微調整(SFT)に続き、モデルはCISPO(グループ相対アドバンテージ推定法)を用いたオンラインRLを受ける。エージェントは、SFTポリシーが失敗した「困難な」トラジェトリのキュレートされたサブセットを用いてシミュレータと相互作用する。報酬関数は −max(2,dist_to_goal) と定義されており、目標に到達し、目標付近での不要な操縦を避けつつ
STOPアクションを発することを促す。
主な貢献
- 最小限のセンサー依存性: 8B VLMが、深度センサー、LiDAR、またはマルチカメラ・セットアップを必要とせず、単一のRGBカメラのみを使用して、最先端のナビゲーション性能を達成できることを実証した。
- 画像空間でのポインティング: メトリック座標ではなく画像空間で動作するポインティングベースのウェイポイント予測メカニズムを導入し、キャリブレーションなしでのクロスエンボディメントの汎用性を自然に実現した。
- 効率的な学習レシピ: トークン複雑性を22倍削減するプレフィックス・キャッシング学習手法を開発し、シミュレーションデータのみを用いて大規模なナビゲーション・ポリシーを数日以内に訓練することを可能にした。
- 強化学習の統合: オンラインRLを適用して探索能力とリカバリ能力を向上させ、行動クローニングと堅牢な長期的ナビゲーションの間のギャップを埋めることに成功した。
結果
システムは、Room-to-Room in Continuous Environments (R2R-CE) および Room-Across-Room (RxR-CE) ベンチマークで評価された。
- R2R-CE (Validation Unseen): Robostral Navigateは、77.4% の成功率 (SR) と 74.2% の経路長による重み付き成功率 (SPL) を達成した。
- これは、最高の単一カメラ・ベースライン(Qwen-RobotNav-4B, 66.9% SR)を10.5ポイント上回っている。
- また、深度/マルチカメラ・システム(Qwen-RobotNav-8B, 72.1% SR)をも、補助センサーを使用していないにもかかわらず、5.3ポイント上回っている。
- RxR-CE (Validation Unseen): モデルは 75.1% SR と 68.7% SPL を達成し、すべての単一カメラ・ベースラインを凌駕し、深度支援モデルと比較して優れた経路効率性を示した。
- クロスロボット展開: 同一のモデル重みが、異なる形態とカメラ構成を持つ2つの異なるプラットフォーム(Galaxea R1 および Hiwonder JetAuto)に正常にデプロイされ、クロスロボットの汎用性の主張を検証した。
重要性
本論文は、Robostral Navigateが汎用的なロボティクスのためのスケーラブルなレシピを提示していると主張している。大規模なシミュレーション、効率的な学習アルゴリズム(プレフィックス・キャッシング)、および強化学習を組み合わせることで、著者らは、高性能なナビゲーションには特権的なセンシングが不要であることを示した。この研究は、最小限のセンサー・アプローチが、堅牢な学習手法と組み合わされることで、複雑なハードウェアを活用するシステムを凌駕できることを示唆しており、多様なハードウェアや未知の環境における汎用的なエンボディド・エージェントの展開への障壁を低くするものである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。