← 最新の論文
💻 computer science

HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness

HarnessVLNは、エージェント・ハーネスを用いて、構造化されたツール・インターフェースを通じて知覚、メモリ、および行動の検証を調整することにより、タスク固有の学習を必要とせずに複数のベンチマークで最先端の性能を達成する、エンボディド・ナビゲーションを統一するゼロショットかつ学習フリーのフレームワークを導入する。

原著者: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

公開日 2026-09-16
📖 1 分で読めます☕ さくっと読める

原著者: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが自律的に世界を移動できることは、長らくサイエンス・フィクションの夢でしたが、エンジニアにとってその課題はより実用的なものです。ナビゲーションを行うには、機械は「何を見ているか」を理解し、「どこにいたか」を記憶し、「次に何をすべきか」を決定するという3つのことを同時に行う必要があります。長年、研究者たちは、成功した移動の例を何千もの事例としてロボットに見せることで、機械がそのパターンを学習することを期待してきましたが、このアプローチは、ロボットが新しい部屋に遭遇したり、少し異なる指示を受けたりすると、しばしば失敗に終わりました。より最近のアイデアは、物語を書いたり質問に答えたりできる大規模な人工知能モデルと同様の、強力な「言語の脳」をロボットに与えることでした。その狙いは、これらのモデルが特定のトレーニングを必要とせずに、建物の中を推論によって進んでいくことにありました。しかし、依然として溝がありました。これらのモデルは計画について話すことはできても、その計画が実際に物理的な世界で可能かどうかを確認することには苦労することが多く、混乱が生じたり、行き詰まったりする原因となっていました。

ある研究チームは、この溝を埋める「HarnessVLN」と呼ばれる新しいシステムを導入しました。単一のモデルにすべてを行わせるのではなく、彼らはロボットの脳に対する厳格な監督者として機能する、中央マネージャー、すなわち「ハーネス(装着具)」を構築しました。このマネージャーは、ロボットに推測させるだけでなく、提案されたすべての動きを、ロボットが実際に目にしているものや記憶しているものと照らし合わせて常にチェックします。このシステムは、複雑なデジタル環境および実物大のフルサイズのヒューマノイドロボットを用いてテストされました。これらのテストにおいて、ロボットは詳細な音声指示に従って特定の物体を見つけたり、特定の場所に到達したりすることに成功し、特定のタスクに関するトレーニングを必要としない従来の手法を上回る成功率を達成しました。鍵となる発見は、ターゲットが視認可能であり、かつ到達可能であることを証明させてから移動するという「検証の層」を加えることで、純粋な推測では到底及ばない信頼性をもって、未知の空間をナビゲートできるということです。

この新しいアプローチの核心は、ロボットには異なる種類のナビゲーションタスクを扱うための統一された方法が必要であるという考えにあります。「キッチンへ歩いて行き、右に曲がれ」であれ、「食洗機を見つけろ」であれ、ロボットは同じ根本的な問題に直面します。それは、言葉を物理的な空間へと結びつけることです。研究者たちは、中央コントローラーである「Harness」がロボットのあらゆるツールを調整するフレームワークを設計しました。これには、画像と深度を捉えるロボットの「目」、見たものを保存する「記憶」、そして前進させる「脚」が含まれます。ロボットの言語の脳が動きを提案すると、Harnessはそれを一時停止して検証します。それはこう問いかけます。「これには証拠があるか?」「経路はクリアか?」「これは現在の目標と一致しているか?」もし答えが「ノー」であれば、ロボットは盲目的に動くのではなく、再考するか、さらなる情報を探すように指示されます。

この検証プロセスは、2つの異なるタイプのメモリが連携することに依存しています。1つ目は、完了したサブゴールや最近失敗した場所など、ロボットの直近の履歴を追跡する「イベントの記録」です。2つ目は、訪れた場所や見た物体を、観察した時間や場所とともに記録する「環境の永続的なマップ」です。このマップにより、ロボットは新鮮な情報と古い、時代遅れのアイデアを区別することができます。もしロボットが以前、ドアを通ろうとして閉まっているのを見つけた場合、このシステムはその失敗を記憶し、ロボットが同じ不可能な経路を再び試そうとするのを防ぎます。ロボットの推論とその物理的な行動を明確に分離することで、システムはすべてのステップが現実に根ざしたものになるよう保証します。

研究者たちは、ナビゲーションスキルを測定するために使用される標準的な課題セットである4つのベンチマークで、このシステムをテストしました。ロボットが言葉で記述されたルートに従う必要があるテストでは、一つの主要なテストで60.8%、もう一つのテストで53.9%のケースで成功しました。椅子やベッドのような特定の物体を見つけるタスクでは、ある環境で76.0%、別の環境で59.3%の試行で成功しました。これらの数値は、特定のトレーニングデータを使用しない他の手法と比較して、大幅な改善を示しています。研究者たちは、システムが言語モデルの自信をただ信じるのではなく、行動を実行する前に目標が到達可能であるという物理的な証拠を要求したため、優れた性能を発揮したと指摘しています。

このシステムがコンピュータ・シミュレーションの外でも機能することを証明するために、チームは身長1.74メートルの実物のヒューマノイドロボットにこれを展開しました。カメラとセンサーを備えたこのロボットは、実際の建物をナビゲートする任務を与えられました。ある実験では、ロボットは交差点まで歩き、左に曲がり、水飲み器の近くにあるゴミ箱のところで止まり、それから冷蔵庫を見つけるよう指示されました。別の実験では、事前にそれがどのような見た目であるかを知らされないまま、赤い消火器を見つける必要がありました。ロボットは、各ステップで視覚的な証拠をチェックしながら、これらのタスクを管理するために同じHarnessシステムを使用しました。ロボットは進捗を追跡し、ランドマークを特定し、実際に見たものに基づいて停止地点を検証することに成功しました。同じソフトウェアが、複雑なルートを案内した後、プログラミングの変更なしに未知の物体を探索するまでガイドできたという事実は、このアプローチの柔軟性を実証しています。

HarnessVLNの成功は、ロボット・ナビゲーションの未来が、あらゆる可能な経路を機械に教え込むことではなく、自身の作業をチェックするための信頼できる方法を与えることにあるのではないか、ということを示唆しています。ロボットの行動を、単一の連続的な推測としてではなく、検証された一連のステップとして扱うことで、システムは迷ったり間違いを繰り返したりするという一般的な落とし穴を回避しています。研究者たちは、強力な言語プランナーと、厳格でエビデンスに基づいたマネージャーの組み合わせによって、ロボットが未経験のタスクを処理できることが分かりました。このシステムは、チェックやメモリの更新方法に関する定義済みのルールに依然として依存していますが、その結果は、この調整方法が、人間界の中で真に動き、働くことができるロボットへの実用的な一歩であることを示しています。プロジェクトはさらなる開発に向けて開かれており、チームはオープンな環境での相互作用を通じて、これらのシステムがいかに学習し適応できるかをさらに探求することを計画しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →