想像してみてください。あなたにはロボットの助手がいるとします。これまでは、このロボットを作ることは、2人の別々の専門家を雇うようなものでした。一人は「歩行(ナビゲーション)」のエキスパートですが、手先の使い方は全くダメな人。もう一人は「シェフ(マニピュレーション)」の達人ですが、材料を取りに部屋を横切って歩くことができない人です。もしあなたがロボットに「キッチンへ歩いて行き、カップを電子レンジに入れる」という指示を出したい場合、これら2つの異なる「脳」や、2つの別々のモデルを切り替えなければなりませんでした。
この論文は、OneVLAを紹介しています。これは、歩行と手先の使い方の両方に自然と長けている、いわば「十徳ナイフ」のような従業員を一人雇うようなものです。
その仕組みを簡単に解説します:
1. 「ユニバーサル・リモコン」(統合アクションヘッド)
ほとんどのロボットは、仕事ごとに異なる「リモコン」を持っています。あるリモコンには、前進したり左に曲がったりするためのボタンがあります。別のリモコンには、ロボットのアームを上下させたり、ひねったりするためのスライダーがあります。
OneVLAは、単一のユニバーサル・リモコンを作成しました。
- それは、歩行用のボタンとアーム用のスライダーを、一つの長いコントロール・ストリップ(操作帯)にまとめます。
- ロボットが「ドアへ行け」という指示を受け取ると、ストリップ上の「歩行ボタン」だけを押します。
- ロボットが「カップを手に取れ」という指示を受け取ると、「アームのスライダー」だけを動かします。
- 魔法のポイント: ロボットは脳やリモコンを入れ替える必要はありません。タスクに基づいて、リモコンのどの部分を使うべきかを理解しているだけなのです。
2. 「3段階のトレーニングキャンプ」(マルチステージ戦略)
ロボットをいきなり複雑な世界に放り込んでも、すぐにすべてを理解できるとは限りません。著者らは、生徒が学校を進級していくように、OneVLAを3つの特定のフェーズで訓練しました。
- ステージ1:手使いの学習。 まず、ロボットにロボットアームを使って物を掴み、持ち上げ、置く方法を教えました。また、画像を見てそれを説明する方法も教えました(これにより、世界を理解できるようになります)。
- ステージ2:歩行の学習。 次に、ナビゲーションのデータを追加しました。これで、ロボットは地点Aから地点Bへ移動する方法を学びます。ステージ1ですでに「見る」ことと「考える」ことを学んでいるため、より速く、より賢く歩行を学習できます。
- ステージ3:思考の言語化(Chain-of-Thought)の学習。 最後に、ロボットに自分の思考プロセスを「声に出して」伝える方法を教えました。動く前に、ロボットは自分自身にこう言います。「私は廊下にいます。キッチンに行くために右に曲がる必要があります」。このステップにより、ロボットは「何を見ているか」「何をすべきか」「どう動くべきか」の間の点と点を結びつけることができます。
3. 結果:2つのスキル、1つの脳
この論文は、これら2つのスキルを一緒に訓練することで、実際にお互いを高め合えることを主張しています。
- 例え話: バスケットボールもするサッカー選手を想像してみてください。バスケットボールのドリブルを学ぶこと(マニピュレーション)は、足さばきやバランス感覚を向上させ、それがサッカー場での走行(ナビゲーション)に役立つかもしれません。
- 証明: テストにおいて、この単一のロボット(OneVLA)は、歩行のみに特化したロボットや、手先の使いのみに特化したロボットよりも優れた成績を収めました。また、両方をこなそうとしながらも、依然としてタスクごとに別々の「モード」や設定を必要とする他の「ハイブリッド」ロボットよりも優れていました。
まとめ
OneVLAは、歩いたり、何かを掴んだりする際に、再プログラミングを必要としない新しいタイプのロボットの脳です。言語を理解し、世界を視覚化し、足と手の両方を制御するために、一つの統合されたシステムを使用します。著者らは、これらのスキルを一緒に教えることが、個別に教えるよりもロボットをより賢くすることを示しています。
技術要約: OneVLA – 身体化されたタスクのための統一フレームワーク
問題提起
現在の身体化された知能(Embodied Intelligence)のための視覚・言語・行動(VLA)モデルは、根本的なアーキテクチャ上の制限に直面している。具体的には、単一のタスク領域(ナビゲーションまたはマニピュレーションのいずれか)に制約されているか、あるいは複数のタスクを扱うためにタスク固有のモデルバリアントを必要とする。UniVLAのようなクロスタスクモデルは、異なるロボットの形態間で知識を転移させようと試みてきたが、依然として別々のアクションヘッドや特定のモデル構成に依存している。この断片化は、自然言語をシームレスに解釈し、多様なドメインにおいて周囲の環境と物理的に相互作用できる、真に汎用的なロボットエージェントの開発を妨げている。本論文は、2つの重要な問いを特定している:(1) 統一されたVLAアーキテクチャは、タスク固有のバリアントなしに、ナビゲーションとマニピュレーションの両方を実行できるか? そして (2) これら2つの基本的なタスクは、共同学習によって全体的な性能を向上させるという相互利益を得ることができるか?
手法
著者らは、ナビゲーションとマニピュレーションの両方を単一のフレームワーク内で生成するように設計された、統一VLAアーキテクチャであるOneVLAを提案する。
1. 統一アーキテクチャ
- 統一視覚・言語エンコーダ: モデルは、32層のVision Transformer(マルチビューRGB画像を処理)と、GQAを使用する36層のTransformer言語モデルからなる共有バックボーンを利用する。視覚的特徴は、言語モデルの隠れ次元(dh=2048)に投影され、統一されたマルチモーダル表現が作成される。
- トークンベースのデコーディング: 二重の出力を処理するために、語彙は特殊トークン
<text>...</text> と <action>...</action> で拡張されている。これにより、モデルはタスク理解を説明するテキスト応答と、それに続くアクションシーケンスを、単一のフォワードパス内で自己回帰的に生成することができる。
- 統一アクションヘッド: コアとなる革新は、ナビゲーションとマニピュレーションのアクション次元を11次元の統一空間に結合した単一のアクションヘッドである:
- ナビゲーション (anavi∈R4): コマンド(前進、左旋回、右旋回、停止)に対する離散確率分布。
- マニピュレーション (amani∈R7): 連続的な7自由度(7-DOF)エンドエフェクタ制御(Δx,Δy,Δz,Δroll,Δpitch,Δyaw,g)。
- フローマッチング・メカニズム: アクションヘッドは、将来のアクションシーケンスを予測するためにフローマッチング拡散プロセスを採用している。これは、アクションエンコーダ、クロスアテンションを備えたDiTバックボーン、およびアクションデコーダを使用し、フローマッチング目的関数を最小化することで速度場を予測することを学習する。
- タスク固有の重み付け: 異種混合のアクション空間に対応するため、モデルは学習中にタスク固有の重みマスクを使用する。これらのマスクは、与えられたサンプルに対して関連するアクション次元のみが損失計算に寄与することを保証し、アーキテクチャの切り替えなしに同時学習を可能にする。
2. 多段階プログレッシブ学習戦略
強力なポジティブ転移と相互強化を促進するために、著者らは3段階の学習戦略を採用している:
- ステージ1 (マニピュレーション基盤): マニピュレーションのデータセットと一般的なVQAデータのみで学習を行い、堅牢なマニピュレーションスキルと視覚・言語理解を確立する。
- ステージ2 (クロスタスク転移): ナビゲーションデータを共同学習に導入しつつ、マニピュレーションおよびVQAデータを保持する。このステージでは、統一アクションヘッドを活用して両方のタスクを同時に学習し、ドメイン間の知識転移を可能にする。
- ステージ3 (推論の強化): Chain-of-Thought (CoT) データを取り入れ、両タスクにおけるモデルの推論能力と意思決定の質を洗練させる。
3. 損失関数
モデルは、以下の複合損失関数を用いてエンドツーエンドで学習される:
Ltotal=λvlmLvlm+λtextLtext+λactionLaction
- Lvlm: 一般的な視覚・言語アライメントのための標準的なクロスエントロピー。
- Ltext: 推論テキストフェーズ(境界トークンを含む)の次トークン予測。
- Laction: 異種出力の扱いを制御するためにタスク固有の重みマスクを用いて計算されるフローマッチング損失。
主な貢献
- 統一アーキテクチャ: タスク固有のモデルバリアントや別々のアクションヘッドを必要とせずに、ナビゲーションとマニピュレーションの両方のタスクを実行できる初のVLAフレームワークであるOneVLAの提案。
- 革新的なコンポーネント: フローマッチングを備えた統一アクションヘッドと、異なるタスクドメイン間の効果的な相互強化を促進する多段階プログレッシブ学習戦略の導入。
- 相互利益の経験的証拠: 共同学習が単一タスク学習と比較してナビゲーションとマニピュレーションの両方の性能を大幅に向上させることを示す包括的な実験。
- 新しいパラダイム: 独立したタスクドメイン間のアーキテクチャの障壁を取り払い、汎用的なロボットシステムのための新しいパラダイムを確立。
実験結果
著者らは、シミュレーションおよび実世界のベンチマークにおいてOneVLAを評価し、特化した単一タスクモデルおよび既存のクロスタスクモデルと比較した。
シミュレーション・ベンチマーク:
- ナビゲーション (VLN-CE): OneVLAは、R2Rデータセットで68.6%、RxRデータセットで**58.2%**に達し、最先端(SOTA)の性能を達成した。これは、UniVLA(それぞれ47.1%および26.3%)や、StreamVLNのような特化したナビゲーションモデルを大幅に上回る結果である。
- マニピュレーション (SimplerEnv): OneVLAは平均成功率**64.5%**を達成し、UniVLA-Mani (35.4%) やSOTAのマニピュレーションモデルである π0-Fast (48.3%) を上回った。
- 効率性: 特筆すべき点として、3BパラメータのOneVLAモデルがすべての7Bパラメータのタスク特化型モデルを凌駕しており、統一設計の効率性を証明している。
実世界実験:
- Franka Research 3 ロボットアームとモバイルロボットプラットフォームを使用し、OneVLAはマニピュレーションタスクで78.8%、ナビゲーションタスクで**77.5%**の成功率を達成した。
- これらの結果は、実世界の設定においてUniVLAに対してそれぞれ16.3%および35.0%の改善を示しており、シミュレーションを超えて汎化するモデルの能力を裏付けている。
アブレーション研究:
- 多段階学習: 単一ステージ学習と比較して、3段階戦略はR2Rの性能を12.5%、SimplerEnvの性能を18.3%向上させた。
- 共同学習: 共同学習は、単一タスク学習と比較してR2Rで7.3%、SimplerEnvで5.5%性能を向上させ、共有表現が両ドメインに利益をもたらすという仮説を検証した。
- アクションホライゾン: アクションホライゾンは5タイムステップが、時間的モデリングと予測精度の最適なバランスを提供することが判明した。
重要性と主張
本論文は、ナビゲーションとマニピュレーションという中核的な身体化能力を単一の結束したフレームワークに統合することにより、OneVLAが真に汎用的なロボットシステムへの道を切り開くと主張している。著者らは、このアプローチがアーキテクチャとしてよりエレガントである(タスク固有のバリアントを排除できる)だけでなく、性能においても優れていると断言している。共同学習が相互の性能向上につながることを示すことで、本研究は、統一されたアプローチが身体化された知能を人工汎用知能(AGI)へと進化させるために不可欠であることを示唆している。モデルおよびソースコードは、この方向の研究を支援するために公開されている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録