Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
本論文は、異種混合のマルチエンボディメント・データを利用することで、控えめな計算予算や限られたダウンストリーム・データの下でも、多様なタスクや未知のロボットに対する優れた転移性と性能を達成する、表現中心の継続事前学習アプローチであるVLActを導入する。
原著者: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
テクニカル・サマリー: StarVLA (VLAct)
問題提起
本論文は、ロボティクスにおけるVision-Language-Action (VLA) モデルのスケーリングにおける根本的なボトルネックに対処している。モデルの規模、データ、計算資源のスケーリングは汎用基盤モデルにおいて進歩を牽引してきたが、ロボットの軌跡は、物理世界を疎にしかカバーせず、身体性を伴う収集が必要であるため、ウェブスケールの画像・テキストデータよりもスケーリングが本質的に困難である。その結果、固定されたロボット・データ予算の下では、標準的なVLAの継続事前学習は、転移可能な視覚・行動知識を誘発するのではなく、単に特定の行動ヘッドやエンボディメント(形態)への過学習に陥ることが多い。
著者らは、標準的なVLAの継続事前学習における3つの具体的な失敗モードを特定している:
- 表現のドリフト (Representation Drift): 狭い範囲のロボット軌跡によるエンドツーエンドのフル更新は、ウェブスケールの事前学習から学習された広範で転移可能な視覚・言語特徴を損なわせる。
- ヘッド特化型の過剰な専門化 (Head-Specific Over-Specialization): 単一の行動ヘッド(例:特定の連続回帰またはフロー・マッチング・ヘッド)からの教師あり学習は、バックボーンのフィーチャー幾何学をその特定のデコーダーの要求へと崩壊させ、代替となるダウンストリーム・ヘッドへの転移を制限する。
- エンボディメントの断片化 (Embodiment Fragmentation): 孤立したエンボディメント固有の出力ヘッドを使用すると、異なるロボットの形態間で行動セマンティクス(例:グリッパーの開閉)を共有することができなくなる。
手法: VLAct
著者らは、転移可能なVLAバックボーンを構築するために設計された、表現中心の継続事前学習レシピであるVLActを提案する。このアプローチは、事前学習済みのVision-Language Model (VLM) から開始し、タスク固有のダウンストリーム・ファインチューニングを行う前に、広範で異種混合なマルチエンボディメントのロボット・データを用いて学習を行う。コアとなる構成要素は以下の通りである:
1. VLMのプライア(事前知識)の保持
バックボーンが一般的な視覚・言語能力から逸脱するのを防ぐために:
- 浅層レイヤーの保護 (Shallow-Layer Protection): 継続事前学習中、ビジョンエンコーダーとLLMレイヤーの下半分は凍結される。上層のLLMレイヤーと行動ヘッドのみが更新される。これにより、低レベルの視覚処理と初期の整列(アライメント)を保護しつつ、高層レイヤーが行動条件付きの推論に適応することを可能にする。
- キャプション混合事前学習 (Caption-Mixed Pre-training): ロボットの軌跡は、事前学習中に画像キャプション・データと混合される。著者らは、キャプションが物体、属性、空間関係に対する密な教師信号を提供することで、バックボーンの元の視覚・言語表現を保持するための最も強力なアンカーになることを見出した。
2. 行動表現の整列と多様化
ヘッド特有の表現崩壊を避けるため、VLActはマルチヘッド連続共同教師あり学習 (Multi-Head Continuous Co-Supervision) を採用している:
- 同一のバックボーンを、3つの代表的な連続行動ヘッド(OFT(直接回帰)、PI(フロー・マッチング)、GR00T(デュアルシステム・フロー・マッチング))と並行して学習させる。
- すべてのヘッドは同じ潜在表現を受け取り、同じ正解の行動チャンクを予測する。総損失は、すべてのヘッドからの損失の合計である。
- これにより、バックボーンが行動情報を複数のデコーダー幾何学に対してアクセス可能な形式でエンコードすることを強制し、「デコーダーへのロックイン」を防ぐ。
3. エンボディメントを越えた行動表現の統一
互換性のない運動学を単一の空間に強制することなく、クロスエンボディメントの転移を可能にするために:
- 部分的に統一された行動空間 (Partially Unified Action Space): 単一の共有行動ヘッドを使用するが、行動空間は物理的に比較可能な次元においてのみ統一される。例えば、グリッパーの開閉次元はすべてのエンボディメントで共有されるが、腕の関節次元はエンボディメント固有であり、特定のロボットに対して非アクティブな場合はマスクされる。
- ラップ認識損失 (Wrap-Aware Loss): 絶対関節角に対しては、角度の周期性を扱うためのラップ認識損失(例:179∘ と −179∘ を近いものとして扱う)が適用され、異なる関節パラメータ化にわたって一貫した学習を保証する。
主な貢献
- 表現中心の事前学習: 本論文は、焦点を「大規模な行動適合」から、バックボーン内での「転移可能な視覚・行動知識の蒸留」へとシフトさせている。著者らは、VLMバックボーン自体が、単なる固定されたコンポーネントではなく、VLAの性能における一次の設計変数であることを示している。
- ヘッドに依存しないバックボーン: マルチヘッド共同教師あり学習を用いることで、VLActは未知のダウンストリーム行動ヘッドへ効果的に転移するバックボーンを生み出す(例:OFT/PI/GR00Tで事前学習し、異なるヘッドでファインチューニングする)。
- データ効率の高いエンボディメント転移: この手法は、ベースラインが必要とするよりも大幅に少ないダウンストリームの軌跡を用いて、未知のロボット・エンボディメント(例:Franka/AgileXからの事前学習からGR-1ヒューマノイドへ)への強力な転移を可能にする。
- オープンかつ効率的なスケーリング: 結果は、完全にオープンソースのデータと、控えめな16枚のGPUトレーニングセットアップを使用して達成されており、大規模な独自のデータセットと計算資源のみが競争力のあるVLA性能をもたらすという概念に挑戦している。
実験結果
VLActは、シミュレーション・ベンチマーク、実世界のロボット実験、およびクロスエンボディメント転移タスクにわたって評価された:
- LIBERO-Plus: VLActは**82.6%**の成功率を達成し、強力なインハウス・ベースライン(Qwen3VL-OFT)を7.6%、大規模な産業用システムであるABot-M0を2.1%上回った。
- RoboTwin 2.0: VLActはClean設定で92.5%、Random設定で**90.8%**の成功率に達し、InternVLA-A1、Being-H0.7、LingBot-VLAなどのシステムを凌駕した。
- RoboDojo: VLActは、平均スコア(10.66)で8位、平均成功率(7.60%)で6位を記録した(全35ポリシー中)。特筆すべきは、明示的に指定されたWorld-Action-Model (WAM) のエントリーすべて、およびいくつかの業界開発システムを上回ったことである。
- クロスエンボディメント転移 (RoboCasa-GR1): 事前学習中に未知であったヒューマノイドロボット(GR-1)に対してファインチューニングを行った際、VLActはわずか**20%**のダウンストリーム軌跡(成功率49.5%)で、フルデータを用いたGR00T-N1.6ベースライン(成功率47.6%)を上回った。
- 実世界実験: Franka Research 3アームにおいて、VLActはショートホライズン、ロングホライズン、および両腕協調タスクにおいて、非事前学習のベースラインを一貫して上回り、未知の物体や変形可能な物体に対する優れた汎化性能を示した。
意義と主張
本論文は、表現中心の継続事前学習が、単純なデータのスケーリングを超えた、VLAの進歩における重要な独立した軸であることを主張している。著者らは以下のように述べている:
- VLMバックボックは、一般的な事前学習から継承された固定コンポーネントとして扱うのではなく、物理的タスクに適応させるべき訓練可能な変数として扱うべきである。
- 高性能なVLAモデルは、必ずしも大規模な独自のデータセットや計算資源を必要とするわけではない。オープンなデータと適度なリソースを用いた、適切に設計された事前学習レシピによって、非常に競争力のある性能を実現できる。
- 提案されたレシピは、タスク、環境、およびエンボディメントを横断して汎化する再利用可能なバックボーンの作成を可能にし、タスク固有またはエンボディメント固有の再学習への依存を軽減する。
著者らは、彼らの結果がオープンソースのデータと16枚のGPUセットアップを使用して得られたものであることを明示しており、汎用VLMがいかにして物理的タスクのために最適化され得るかについてのさらなる研究を促進するために、すべてのモデルとトレーニングパイプラインをオープンソース化している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。