← 最新の論文
💻 computer science

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

CrossTracerは、VLAベースのトレース提案器と、自動化されたCE-RRT*を通じて学習されたエンボディメント条件付き残差アダプターを組み合わせることで、クロスエンボディメントのロボットナビゲーションを可能にし、最先端のベースラインを大幅に上回る物理的に実行可能なピクセル空間のナビゲーション計画を生成する階層的フレームワークである。

原著者: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに、物で溢れた混雑した部屋の中を歩く方法を教えている場面を想像してみてください。あなたはロボットに、「テーブルの上にある赤いカップを取ってきて」と言うかもしれません。非常に賢いロボットの脳(Vision-Language-Actionモデルと呼ばれます)は、この文章を完璧に理解できます。その脳は、「赤いカップ」が何であるか、「テーブル」が通常どこにあるか、そして「取る」ということが何を意味するかを知っています。しかし、ここからが厄介なところです。そのロボットの脳は、自分がよろよろと歩く二足歩行ロボットなのか、滑らかに動く四輪カートなのか、あるいは弾むような犬型の機械なのかを知りません。この賢い脳にとって、段差を一段上がることは単純な経路に見えます。しかし、車輪を持つロボットにとって、その段差は壁であり、脚を持つロボットにとっては楽しいホップになります。もしロボットが自分の体に合わない経路に従おうとすれば、衝突してしまいます。この論文は、まさにこの問題、つまり「スマートで一般的な経路のアイデアを、どのようにして特定のロボットが実際に歩けるように微調整するか」という問題に取り組んでいます。

CrossTracerの開発者たちは、この問題を解決する最善の方法は、賢い脳にすべてのロボットの体を一度に学習させることではないと気づきました。代わりに、彼らは二段階のチームを構築しました。まず、「Vision-Language Trace Proposer」(「夢想家」と呼びましょう)が、部屋と目標を見て、理想的な大まかな経路を紙の上に描きます。この経路は、旅の「概念」としては完璧ですが、ロボットに車輪があるか脚があるかは気にしません。次に、二番目のチームメンバーである「CE-Adapter」(「現実チェッカー」)が、その大まかな図面と特定のロボットの体をチェックします。そして、「おい、夢想家は車輪が階段を登れないことを忘れているぞ」と言い、経路を階段から遠ざけ、平らな床へと導くために小さな赤い矢印を描きます。彼らはこれらの修正を「トレース残差(trace residuals)」と呼んでいます。

人間が何千もの完璧な経路を手作業で描く必要なく、この現実チェッカーにこれを教えるために、チームは「CE-RRT*」と呼ばれる巧妙なトレーニングのトリックを考案しました。仮想のロボットが、瞬時に部屋全体を見渡し、どの床が車輪にとって安全で、どの床が脚にとって安全かを正確に把握している様子を想像してください。この仮想ロボットは、各ロボットタイプにとって最も安全な経路を見つけるために高速なコンピュータ検索を実行し、そのコンピュータ生成された経路を、現実チェッカーに教えるための「正解」として使用します。これは、AIが実際にロボットをクラッシュさせることなく、自分の間違いから学べるように、スーパー高速のシミュレーターが物理法則の難しい計算を行うようなものです。

このシステムをテストしたところ、その結果は非常に印象的なものでした。標準的なテストであるNaviTraceベンチマークにおいて、CrossTracerは45.68ポイントを記録しました。これは、彼らが比較した最も強力な汎用AIモデル(Gemini-2.5-Pro)を大幅に上回り、約10ポイント、つまり28%の向上を見せました。論文は、この大きな飛躍は、現実チェッカーが夢想家のミスを修正する能力によるものであると示唆しています。現実チェッカーを取り除き、夢想家に経路を描かせたままにしたところ、スコアは22.56へと劇的に低下し、「修正(nudging)」のステップが不可欠であることを証明しました。

彼らはコンピュータ上のテストだけでなく、現実世界の実際のロボットでも試しました。彼らはこのシステムを、車輪型ロボットと脚型ロボットの両方に搭載しました。その結果、CrossTracerはロボットが目標に到達する成功率を高め、かつ迅速に到達させることに貢献しました。車輪型ロボットでは成功率が40%から65%に、脚型ロボットでは45%から70%へと上昇しました。論文は、この手法によってロボットがより信頼できるものになり、衝突を回避し、それぞれの体に合ったよりスムーズなルートを見つけられるようになることを示しています。このシステムは依然として、コンピュータが床を正しく「見る」能力に依存していますが(もしコンピュータがラグを壁と誤認すれば、ロボットは混乱する可能性があります)、このアプローチは、「何をすべきか」と「どのように行うか」を切り離すことが、ロボットをより賢く、より安全にする強力な方法であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →