ロボットが単に、あらかじめプログラムされた硬直したコマンドのリストに従うのではなく、人間の友人のようにあなたを理解できる世界を想像してみてください。これが「エンボディドAI(身体化されたAI)」の夢です。つまり、機械に体(あるいはカメラと車輪)を与え、部屋を見、あなたの声を聞き、どのように移動すべきかを判断できる脳を与えることです。大きな課題は、ピクセルと色彩による視覚の世界と、文章や指示による言語の世界という、二つの全く異なる言語を接続することです。これは、詩で書かれた地図だけを使って、犬に家の中を歩き回る方法を教えるようなものです。「キッチンの横を通り過ぎて歩いて」という言葉を、一連の物理的な旋回や歩数へと翻訳する方法が必要になります。これが、視覚言語ナビゲーション(VLN)の核心となるパズルです。それは単に物体を認識することではなく、部屋の物語を時間の経過とともに理解し、自分がどこにいたかを記憶し、単純な一文に基づいて次に何をすべきかを決定することなのです。
ここで、中国電子科技大学の研究者たちによって構築された、OpenPangu-7Bという強力な「脳」を用いてこのパズルを解くために設計された新しいシステム、PGNが登場します。OpenPanguは、すでに話し方や書き方を知っている非常にスマートな学習済み言語モデルですが、見る方法や動く方法を知りません。研究者たちの目標は、写真と指示を見せることで、この言語の巨人に仮想の家の中をナビゲートする方法を教えることでした。彼らは単にロボットを深い淵に投げ込んだわけではありません。二段階のトレーニングキャンプを構築しました。まず、ロボットが「見る」方法を教えるために、Q-Formerと呼ばれる翻訳モジュールを使用して、言語の脳を特化したカメラの目(ビジョンエンコーダー)に接続しました。これにより、ロボットは「花瓶の画像は『花瓶』という言葉に関連している」ということを理解できるようになりました。
ロボットが画像と言葉のつながりを理解できるようになると、第二段階である「動き」の学習が始まりました。チームは、システムに「エキスパート」(決して間違いを犯さないコンピュータプログラム)によって行われた完璧なナビゲーション経路の数千もの例を入力しました。ロボットは、最近の5枚の部屋のスナップショットのシーケンスを読み、指示を読み、そして極めて重要なことに、行動する前に「考える」ことを学びました。単に「左に曲がる」と口走るのではなく、モデルは行動を確定させる前に、「よし、左にキッチンが見えるので、左に曲がるべきだ」というような、人間が言うような短い推論テキストを生成するように訓練されました。彼らは、ロボットにこれまでに見た正しい履歴を与え、次の動きを予測させるという500の隠されたテストパスでこのシステムをテストしました。結果は有望でした。最新バージョン(V9)では、ロボットは62.29%の確率でエキスパートの行動と一致し、ほぼ常に空ではない回答(100%)を返しました。しかし、著者たちは、これが「ティーチャー・フォース(教師強制)」テストであることを非常に慎重に注記しています。これは、先生が各ステップで正解の解答集を提示している状態で、生徒が多肢選択式のクイズを受けているようなものです。ロボットが、もし間違いを犯した場合にどのように回復できるのか、あるいは助けなしに現実の乱雑な環境で目標に到達できるのかについては、まだテストされていません。このシステムは、大規模言語モデルがナビゲーション指示を理解し、エキスパートの行動と一致するように適応できることを示していますが、論文は、このロボットが実際に自分自身で家の中をナビゲートできるかどうかを判断するための真のテストは、依然として将来の課題であると結論付けています。
技術サマリー: PGN (Pangu Navigator)
問題提起
視覚言語ナビゲーション(VLN)には、エージェントが自然言語の指示を解釈し、時系列に並んだ視覚的観測に基づいて一連のアクションを予測する能力が求められます。マルチモーダル大規模言語モデル(MLLM)は広範な視覚・言語表現を提供しますが、連続的なナビゲーションへの適応には、以下のような特有の課題が存在します:
- 視覚と言語の整合性(Visual-Language Alignment): 視覚的特徴と、言語モデルの埋め込み空間との間のギャップを埋めること。
- 時間的表現(Temporal Representation): コンテキストウィンドウを圧迫することなく、一連の観測を効率的にエンコードすること。
- アクション空間の接地(Action-Space Grounding): 生成されるテキストを、限定された離散的なアクション空間(前進、左、右、停止)に制約すること。
- ハードウェアの制約: 混合精度演算が不安定になりやすい特定のハードウェア(Ascend NPU)において、安定した学習を維持すること。
既存のベンチマークは離散的なグラフや連続的な環境に依存することが多いですが、OpenPangu-7Bのような7Bスケールの基盤モデルをこれらのタスクに適応させるには、これらの制約を同時に解決する専門的なアーキテクチャとトレーニングパイプラインが必要です。
手法: PGN (Pangu Navigator)
著者らは、OpenPangu-7B上に構築されたオフラインVLNアクション予測システムであるPGNを提案しています。本システムは、2段階のトレーニングパイプラインと、時間的推論およびアクション生成のために設計された特定の入出力構造を採用しています。
1. モデルアーキテクチャ
- 視覚エンコーダ: 凍結された EVA-ViT-G/14 を使用し、224×224 の観測画像からパッチレベルの特徴を抽出します。
- 視覚と言語の整合性 (PGMM): 32個の学習可能なクエリトークンを持つ Q-Former がクロスアテンションを用いて固定サイズの視覚表現を生成します。これに続き、768次元のクエリ表現をOpenPangu-7Bの4096次元の埋め込み空間にマッピングする2層のMLPプロジェクターが配置されます。
- 言語バックボーン: OpenPangu-7B がコア言語モデルとして機能します。
- 適応(Adaptation): タスク固有の学習を全パラメータのファインチューニングなしで実現するため、言語バックボーンに LoRA (Low-Rank Adaptation) アダプターを注入します。
- 構造化トークン: 画像の開始、画像の終了、およびフレームの境界を示す3つの学習済みトークンが、マルチモーダル入力を整理するために使用されます。
2. 入出力の定式化
- 入力: 時刻 t において、モデルはナビゲーション指示 I と、5つの時系列順に並んだ観測窓(Ot={ot−4s,…,ot}、ここで s はサンプリングストライド)を受け取ります。
- 出力形式: モデルは推論テキスト(rt)を生成した後、標準的なアクション(at)を出力します。アクション空間は離散的です:{forward,left,right,stop}。
- 分解式: P(rt,at∣I,Ot)=P(rt∣I,Ot)P(at∣rt,I,Ot)。
3. トレーニングパイプライン
- ステージ1: 視覚と言語の整合性 (PGMM):
- データ: Microsoft COCOおよびVisual Genomeからの画像とキャプションのペア。
- 凍結: 視覚エンコーダ (EVA-ViT-G/14) と言語バックボーン (OpenPangu-7B) は凍結されます。
- 学習: Q-Formerと2層のMLPプロジェクターのみを最適化し、視覚入力を言語モデルに整合させます。
- ステージ2: ナビゲーション適応:
- データ: DAgger互換のパイプライン(β=1 を使用し、実質的にエキスパートのみのデータ収集後の教師あり行動クローニング)を通じて収集されたエキスパートのナビゲーション軌跡。
- 凍結: 整合された視覚経路(EVA、Q-Former、プロジェクター)およびベースとなる言語モデルのパラメータは凍結されます。
- 学習: 更新は、3つの構造化トークンの埋め込みおよびLoRAアダプターに限定されます。
- サンプリング: 5つの観測窓を用い、エポック依存の時間的サンプリング(istart=emods)および、前進、旋回、停止のアクションのバランスをとるためのアクション認識サンプリングを使用します。
4. 実装の詳細
- ハードウェア: 8基のAscend 910B NPUで学習。
- 精度: DeepSpeed ZeRO-2を用いた混合精度計算を利用。FP16のアテンションマスク操作における数値オーバーフローに対処するため、グローバルなFP32学習ではなく、特定の不安定な操作に対して選択的なFP32計算を採用しています。
主な貢献
- 2段階システム: 最初に視覚と言語の表現を整合させ(PGMM)、その後に時間的観測とLoRAを用いて整合されたモデルをエキスパートのナビゲーション軌跡に適応させるパイプライン。
- 構造化されたI/O形式: 5フレームの観測窓、時間的境界トークン、推論テキスト生成、および標準的な4アクション空間を組み合わせた新しい入出力設計。
- Ascend指向の実装: 選択的FP32計算による安定性と、ティーチャーフォースド(教師強制)によるオープンループ評価プロトコルを備えた、堅牢なAscend NPU向けトレーニングスタック。
結果
本システムは、ティーチャーフォースドによるオープンループプロトコル(モデルが新しい観測を生成するために実行することなく、エキスパートの観測履歴に基づいてアクションを予測する手法)を用いて、500個の保持されたエキスパート軌跡で評価されました。
- 指標:
- Normalized Action Match (NAM): テキスト表現を正規化した後、予測されたアクションとエキスパートのアクションの一致度を測定します。
- Non-empty Rate (NER): 空ではないレスポンスを生成した予測の割合。
- Exact-string Match (EM): 厳密な文字列一致(推論テキストが含まれるため、後のバージョンでは0%と記載)。
- パフォーマンス:
- バージョン V9: 62.29%のNAMおよび100.00%のNERを達成。
- バージョン V8: 62.13%のNAMおよび100.00%のNERを達成。
- 傾向: 初期のバージョン(V5, V6)はNAM(25.40%および23.18%)とNER(33.98%および99.17%)が低く、推論テキスト、アイデンティティプロンプティング、および改善されたサンプリングの導入が、V8/V9においてアクションの整合性を大幅に向上させたことを示しています。
意義と限界(著者の主張)
論文では、PGNを、Ascendハードウェア上でOpenPangu-7B基盤モデルをオフラインVLNタスクに適応させるための概念実証として位置付けています。
- 実現可能性: 結果(62.29%のNAM)は、凍結されたバックボーンとLoRA適応を用いたアプローチが、オフラインのエキスパート・アクションへの整合において実現可能であることを支持しています。
- 評価の範囲: 著者らは、これらの指標が閉ループ・ナビゲーションの成功ではなく、オフラインのエキスパート・アクション整合を定量化していることを明示しています。
- この評価は、誤差の蓄積、経路の効率性、目標の達成、または誤ったアクションからの回復能力を測定していません。
- Success Rate、SPL、またはナビゲーション誤差といった指標は報告されていません。
- 今後の課題: 予測されたアクションを実行して(シミュレータ内で)真のナビゲーションの成功を確立するには、閉ループ環境での評価が必要であると著者らは述べています。現在の研究は、最新のクローズドループVLNシステムとの比較ではなく、モデルの整合に関する開発記録としての役割を果たしています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録