← 最新の論文
💻 computer science

VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

VerNavは、逐ステップの自己回帰的生成をバッチ処理によるアクション検証とエントロピーに基づく適応型ジェネレータに置き換えることで意思決定段階のレイテンシを大幅に削減し、かつR2Rベンチマークにおいて競争力のあるナビゲーション性能を維持するために二段階のアライメントスキームを採用した、Vision-and-Language Navigationのための検証者優先のフレームワークである。

原著者: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

公開日 2026-09-02
📖 1 分で読めます☕ さくっと読める

原著者: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが、一度も見たことがない家の中を進もうとしている場面を想像してみてください。ロボットは、「キッチンへ行き、青い椅子があるところで左に曲がり、止まれ」といった音声による指示だけを頼りにしています。これが、視覚と言語ナビゲーション(Vision-and-Language Navigation)という課題です。ロボットは周囲の状況を観察し、人間の言葉を理解し、次に正確にどこへ動くべきかを判断しなければなりません。長い間、研究者たちは、ロボットに一歩進むごとに自分自身に語りかける強力な「脳」を与えることで、この問題を解決しようとしてきました。移動を行う前に、ロボットは自身の推論を説明し、周囲を確認し、次の回転を計画するという、長い思考のストリームを生成していました。このような明示的な思考は、ロボットが複雑な指示を理解する助けにはなりますが、非常に時間がかかります。一歩歩くごとに手順を口に出して説明する人間が、ただ歩くだけの人よりもずっと遅くなってしまうのと同様に、一歩動くたびに思考の段落を丸ごと生成するロボットは、意思決定に時間がかかりすぎます。スピードが重要となる現実世界において、この遅延は技術を実用性のないものにしてしまいます。

中国電子科技大学の研究チームは、この問題に対する異なる考え方を提案しました。彼らは、ロボットに一歩ごとに長い物語を書かせるのではなく、まず可能な移動のリストを素早くチェックし、その中から最善のものを選ぶべきだと提案しています。彼らはこの新しいシステムを「VerNav」と呼んでいます。核心となるアイデアは、遅くて段階的な思考の生成を、高速な検証プロセスに置き換えることです。ロボットの脳にゼロから新しい経路を考案させるのではなく、システムが「前進」、「左に曲がる」、「止まる」といった利用可能な方向のセットを提示し、脳にそれぞれの選択肢に対して単に「はい」か「否」を答えさせるのです。これにより、ロボットは選択肢を一つずつ検討するのではなく、すべての選択肢を一度に評価できるようになります。これによって、システムは従来の方式と比較して意思決定にかかる時間を10分の1以上に短縮しながら、ロボットを正しい経路に留まらせることに成功しています。

しかし、単に選択肢を素早くチェックするだけでは不十分です。研究者たちは、もしこの高速なチェック方法のみを使用した場合、ロボットが混乱し、特にトリッキーな状況において間違いを犯してしまうことを発見しました。高速チェッカーは悪いアイデアを排除することには長けていますが、選択肢が非常によく似ている場合、唯一の最善のアイデアを選び出すことに苦戦することがあります。これを解決するために、チームはスマートなセーフティネットを追加しました。彼らは、ロボットの「確信度」を監視するシステムを構築したのです。もしロボットが進むべき道に自信を持っているなら、そのまま高速なチェック方法を継続します。しかし、もしロボディが(選択肢の間で)高い混乱状態にある、つまり進むべき道に迷っていることが示された場合、システムは一時停止し、より強力で低速な思考エンジンに対して、状況の簡潔で集中的な要約を提供するよう求めます。この要約は、高速チェッカーが正しい判断を下せるよう、素早いヒントとして機能します。このようにして、ロボットは本当に必要な時にだけ、低速でコストのかかる思考力を使用することで、プロセス全体を高速かつ効率的に保つことができるのです。

この高速なチェックシステムがナビゲーションにおいて実際にうまく機能するように、研究者たちは、どのように移動を正しく判断すべきかを教え込む必要がありました。彼らは2段階のトレーニングプロセスを開発しました。まず、どの即時的な動きが他の動きよりも優れているかを認識するようにシステムを教え、目標に近づく行動を好むように学習させました。次に、システムに経路全体のナビゲーションを練習させ、最終目的地だけでなく、前進に貢献したあらゆる小さなステップに対しても報酬を与えました。このトレーニングにより、高速チェッカーが単にランダムな動きを選ぶのではなく、長い距離にわたって指示に正確に従うことを学習しました。標準的なナビゲーションタスクを用いてテストした結果、この新システムは、重厚で低速な思考を用いる既存の最高峰のロボットと同等の性能を発揮しながら、決定を下す時間はごくわずかでした。これらの結果は、選択肢を素早くチェックし、必要な時にだけ深い思考を呼び出すことで、ロボットが道を見失うことなく、より高速に複雑な環境をナビゲートできることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →