← 最新の論文
💻 computer science

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNavは、VLMと環境の相互作用をツール呼び出しハーネスとして再構築することで、学習済みのウェイポイント予測器を用いることなく、ピクセルベースの直接的なアクション選択、オンデマンドの深度クエリ、および選択的なメモリ検索を可能にし、最先端の性能を実現する、軽量なゼロショット・ビジョン・アンド・ランゲージ・ナビゲーション・フレームワークを導入する。

原著者: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに新しい家の中をナビゲートする方法を教えているところを想像してみてください。あなたは次のような単純なコマンドを与えます。「キッチンへ行き、右に曲がり、ソファのそばで止まって」。これが**視覚と言語によるナビゲーション(Vision-and-Language Navigation: VLN)**の世界です。これは、エージェントが人間の言葉と視覚的な手がかりを理解し、一度も見たことがない3D空間を移動しなければならないロボティクスの分野です。長い間、ロボットは移動方法を学ぶために何千もの特定の家で訓練される必要があり、そのため、別の建物に連れて行かれると迷ってしまうことがありました。しかし最近、私たちは「大規模視覚言語モデル(Large Vision-Language Models: VLMs)」を開発しました。これらは、あらゆるタスクのために再学習する必要なく、画像と言葉をすでに理解できる非常にスマートなAIの脳です。科学者たちの大きな疑問は、「このスマートな脳を、どうやってロボットの足へと接続するか?」ということです。AIが、現実世界の混沌とした連続的な世界の中で混乱することなく、正確にどこに足を踏み出すかを決定できるようにするには、どうすればよいのでしょうか。

ここで、論文AgenticNavが登場します。著者たちは、従来のAIとロボットを接続する方法は、ドライバーに、あらかじめ描かれた3本の道路からしか選べない地図を与えているようなものだと主張しています。もし目的地があらかじめ用意された3本の道のいずれかになければ、ドライバーは立ち往生してしまいます。新しい手法であるAgenticNavは、ゲームのルールを完全に変えます。AIに、限られたリストの中から承認済みの動きを選ばせるのではなく、必要に応じていつでも呼び出せる一連の「ツール」を与えるのです。AIをミステリーゲームの探偵だと考えてみてください。ゲームが探偵に対して「左へ行く」「右へ行く」「直進する」のいずれかを選ばせるのではなく、探偵が「あの壁の特定のピクセルの深さを確認したい」とか、「自分がこれまでいた場所のマップを見せてほしい」とか、「目に見えるあの椅子に直接歩いていきたい」と言えるようにするのです。

この論文は、これらのスマートなAIの脳のための「ハーネス」やコントロールパネルとして機能する、AgenticNavと呼ばれるシステムを紹介しています。研究者たちは、AIに3つの特定のツールを与えることで、追加のトレーニングなしでも、未知の環境を以前よりもずっと上手くナビゲートできることを見出しました。最初のツールは**アクション・ツール(Action Tool)です。提案された狭い範囲のスポットから選ぶ代わりに、AIはカメラの視野内の任意のピクセルを直接指さして、「そこへ行け」と言うことができます。するとシステムが、そのピクセルを安全な歩行経路へと変換するための計算を行います。第2のツールはデプス・ツール(Depth Tool)です。時には、AIが対象物からどれくらい離れているかを正確に知る必要がある場合があります。AIに巨大で混乱を招くような3Dの深度マップを見せる代わりに、このツールは、AIが「この特定の地点の壁まであとどれくらいか?」と尋れ、正確な数値を得られるようにします。第種3のツールはメモリー・ツール(Memory Tool)**です。ロボットが歩行するにつれて、コンパクトな地図を構築していきます。もしロボットが混乱したり、以前見た標識を思い出す必要があったりする場合、全フレームの記憶をすべて保持しようとして脳をオーバーフローさせるのではなく、システムに「その特定の瞬間を呼び出す」よう頼むことができます。

著者らは、Habitatシミュレータを用いたR2R-CEというコンピュータ・シミュレーション、および実機のロボットを用いてこのシステムをテストしました。実機での検証には、研究所、オフィス、屋外の庭のシーンにわたる30の特定のエピソードが含まれており、標識の読み取り、長距離ナビゲーション、精密なターゲット到着といったタスクを検証しました。彼らは、強力なAIの脳(GPT-5.5)を使用した場合、新しい手法が目標到達率において**55%の成功率を達成したことを発見しました。これは、わずか44%**しか到達できなかった従来の最高手法(SmartWay)からの大幅な向上です。効率性(成功率と経路の短さをいかにバランスよく両立させたか)については、**35.04%から48.41%**へと改善されました。論文は、ボトルネックは単にAIの脳がいかに賢いかではなく、いかにAIに世界と相互作用するためのツールを与えるかにあると示唆しています。AIに自らターゲットを選ばせ、特定の情報を求めることを許可することで、AIは未訪問の場所であっても、現実世界をナビゲートする能力が格段に高まります。研究者たちはまた、このアプローチが異なる種類のAIの脳ともうまく機能することに注目しており、この「ツール呼び出し(tool-calling)」形式が、複雑な世界を真に理解し、移動できるロボットを実現するための有望な道筋であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →