← 最新の論文
🤖 AI

Robostral Navigate

Robostral Navigateは、240万件のシミュレーション軌跡を用いたスケーラブルな学習レシピ、プレフィックス・キャッシングによる効率化、および深度センサーや事前構築された地図を不要にする画像空間でのウェイポイント予測を活用することで、多様なロボットの形態にわたる最先端の単眼ナビゲーションを実現する8B(80億パラメータ)の視覚言語モデルです。

原著者: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, A
公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにツアーガイドとしての役割を教える場面を想像してみてください。ロボット工学の世界では、これを「エンボディド・ナビゲーション(身体化されたナビゲーション)」と呼びます。これは、「キッチンへ行って」という音声コマンドを理解し、壁にぶつかることなく実際にそこまで歩いていく能力のことです。長い間、優れたツアーガイドといえば、高級な宇宙飛行士のようなものでした。彼らは仕事をこなすために、高価で重厚な装備を必要としたのです。特殊な3Dグラス(深度センサー)を装着したり、警備チームのように複数のカメラを携えたり、あるいは建物全体のあらかじめ描かれた地図に頼ったりしていました。これらのロボットは優秀でしたが、高価で壊れやすく、シンプルな配送用ドローンや小さな倉庫用車輪に搭載するのは困難でした。科学者たちが問い続けてきた大きな疑問は、「これほどまでにシンプルで一般的なツールだけを使って、同じくらい賢いロボットを作れるのか?」ということでした。その答えは、今日ほぼすべてのスマートフォンやロボットに搭載されているような、たった一つの標準的なカメラと、残りの部分を解明できるほど強力な「脳」の中にあります。

本論文では、その単一の標準的なカメラのみを使用してナビゲーションのパズルを解決するように設計された、新しい種類のロボットの脳、「Robostral Navigate」を紹介します。これは、3Dマップやレーザースキャナーを必要とせず、代わりに写真を見るだけで旅の次のステップを「指さす」方法を学ぶロボットだと考えてください。研究者たちは、80億パラメータを持つ「ビジョン・ランゲージ・モデル」(読み書きと視覚の両方が可能な超スマートなAI)を構築し、ビデオゲームのようなシミュレーションの中で何百万もの例を見せることで、ナビゲーションの方法を教え込みました。このモデルは、何メートル移動するかといった複雑な数学的計算を行う代わりに、画面上の次に進むべき場所を単に指さします。もし目的地が角の向方向に隠れている場合は、一定の距離だけ前進するというバックアッププランに切り替えます。

チームはこのシンプルなアプローチが非常に強力であることを発見しました。35万もの異なるシーンにわたる240万回のシミュレーション上の旅を通じてモデルを訓練することで、安価で構築が容易なだけでなく、豪華なセンサーを備えたロボットよりも賢いシステムを作り上げました。標準的なテストにおいて、Robostral Navigateは目的地に到達する成功率77.4%を達成し、単一カメラを使用する従来の最高水準のロボットを大きく引き離しただけでなく、深度センサーや複数のカメラを使用する一部のロボットをも凌駕しました。その「秘伝のソース」は、単なる「指さし」ではありませんでした。学習プロセスを22倍高速化させた新しいトレーニングのトリックと、迷った時のリカバリー方法を教え込む強化学習のフェーズです。その結果、このロボットは、車輪付きのカートから歩行マシン、あるいは飛行ドローンへと、再学習を必要とせずに移行できることが証明されました。つまり、真に汎用的なロボットを作るために、100万ドルのセンサー群は必要ないということを証明したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →