← 最新の論文
🤖 AI

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

本論文は、OpenPangu-7B基盤モデル上に構築され、視覚と言語のモダリティを整列させ、エキスパートの軌跡に適応させるための2段階の学習戦略を採用することで、Ascend 910Bハードウェア上で混合精度演算とDeepSpeedを活用しながら、ホールドアウトデータに対して62.29%の正規化アクション一致率(Normalized Action Match)を達成したオフライン視覚言語ナビゲーションシステムであるPGNを提示する。

原著者: Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが単に、あらかじめプログラムされた硬直したコマンドのリストに従うのではなく、人間の友人のようにあなたを理解できる世界を想像してみてください。これが「エンボディドAI(身体化されたAI)」の夢です。つまり、機械に体(あるいはカメラと車輪)を与え、部屋を見、あなたの声を聞き、どのように移動すべきかを判断できる脳を与えることです。大きな課題は、ピクセルと色彩による視覚の世界と、文章や指示による言語の世界という、二つの全く異なる言語を接続することです。これは、詩で書かれた地図だけを使って、犬に家の中を歩き回る方法を教えるようなものです。「キッチンの横を通り過ぎて歩いて」という言葉を、一連の物理的な旋回や歩数へと翻訳する方法が必要になります。これが、視覚言語ナビゲーション(VLN)の核心となるパズルです。それは単に物体を認識することではなく、部屋の物語を時間の経過とともに理解し、自分がどこにいたかを記憶し、単純な一文に基づいて次に何をすべきかを決定することなのです。

ここで、中国電子科技大学の研究者たちによって構築された、OpenPangu-7Bという強力な「脳」を用いてこのパズルを解くために設計された新しいシステム、PGNが登場します。OpenPanguは、すでに話し方や書き方を知っている非常にスマートな学習済み言語モデルですが、見る方法や動く方法を知りません。研究者たちの目標は、写真と指示を見せることで、この言語の巨人に仮想の家の中をナビゲートする方法を教えることでした。彼らは単にロボットを深い淵に投げ込んだわけではありません。二段階のトレーニングキャンプを構築しました。まず、ロボットが「見る」方法を教えるために、Q-Formerと呼ばれる翻訳モジュールを使用して、言語の脳を特化したカメラの目(ビジョンエンコーダー)に接続しました。これにより、ロボットは「花瓶の画像は『花瓶』という言葉に関連している」ということを理解できるようになりました。

ロボットが画像と言葉のつながりを理解できるようになると、第二段階である「動き」の学習が始まりました。チームは、システムに「エキスパート」(決して間違いを犯さないコンピュータプログラム)によって行われた完璧なナビゲーション経路の数千もの例を入力しました。ロボットは、最近の5枚の部屋のスナップショットのシーケンスを読み、指示を読み、そして極めて重要なことに、行動する前に「考える」ことを学びました。単に「左に曲がる」と口走るのではなく、モデルは行動を確定させる前に、「よし、左にキッチンが見えるので、左に曲がるべきだ」というような、人間が言うような短い推論テキストを生成するように訓練されました。彼らは、ロボットにこれまでに見た正しい履歴を与え、次の動きを予測させるという500の隠されたテストパスでこのシステムをテストしました。結果は有望でした。最新バージョン(V9)では、ロボットは62.29%の確率でエキスパートの行動と一致し、ほぼ常に空ではない回答(100%)を返しました。しかし、著者たちは、これが「ティーチャー・フォース(教師強制)」テストであることを非常に慎重に注記しています。これは、先生が各ステップで正解の解答集を提示している状態で、生徒が多肢選択式のクイズを受けているようなものです。ロボットが、もし間違いを犯した場合にどのように回復できるのか、あるいは助けなしに現実の乱雑な環境で目標に到達できるのかについては、まだテストされていません。このシステムは、大規模言語モデルがナビゲーション指示を理解し、エキスパートの行動と一致するように適応できることを示していますが、論文は、このロボットが実際に自分自身で家の中をナビゲートできるかどうかを判断するための真のテストは、依然として将来の課題であると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →