rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
rMuscleは、人間の筋肉の記憶にインスパイアされたリアルタイムなVision-Language-Action推論フレームワークであり、類似した反復タスク間で視覚トークンとニューロン活性化を再利用する二段階のキャッシュメカニズムを通じて、元の成功率を維持しながらロボットの応答性を1.29〜1.42倍加速させます。
原著者: Kaijun Zhou, Zhiyang Li, Le Chen, Jinyu Gu
原著者: Kaijun Zhou, Zhiyang Li, Le Chen, Jinyu Gu
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: rMuscle: 高効率なVision-Language-Actionモデル推論のためのロボット・マッスルメモリー
1. 問題提起
Vision-Language-Action (VLA) モデルは、ロボットが反復的な手作業を行う工場などの環境において、エンボディドAI(身体性AI)の支配的なポリシー・パラダイムとして台頭しています。しかし、これらのモデルの推論レイテンシは、ロボットの応答性と動作の滑らかさを直接的に制限します。既存の推論フレームワーク(例:FlashRT, vla.cpp)や加速技術(例:カーネル融合、量子化、フレーム間トークン再利用)は、エンボディド・ワークロードの固有の特性を十分に活用できていません。
著者らは、現在のアプローチにおける2つの主要な限界を特定しています:
- 実行間の類似性の活用不足: 産業用ロボットは、固定されたワークステーションで繰り返されるタスクを実行します。既存の手法は単一フレーム内や単一のデノイジング・フェーズ内の類似性に焦点を当てていますが、同じタスクの繰り返し実行における観測、アクション・トラジェトリ、および内部モデル状態の間の実質的な類似性は無視されています。
- 不均一なボトルネックの無視: VLA推論は、異なるパフォーマンス・ボトルネックを持つ2つの明確なステージで構成されています。π0.5 のようなモデルでは、Vision-Language Model (VLM) のプリフィル・フェーズは計算量限定(compute-bound)(MLP計算が支配的)である一方、アクション・デノイジング・フェーズはメモリ帯域限定(memory-bound)(短シーケンスにおける重みのロードが支配的)です。一方のステージのみを最適化しても、エンドツーエンドのスピードアップは限定的です。
2. 手法: rMuscle
人間の筋肉の記憶(マッスルメモリー)——同様の文脈が関連する過去の経験の想起を誘発するという概念——に触発された rMuscle は、デュアルフェーズ・キャッシュを通じて実行間の類似性を活用するように設計された、リアルタイムVLA推論フレームワークです。
2.1 デュアルフェーズ・キャッシュ設計
本フレームワークは、VLA推論の2つの異なるボトルネックをターゲットとしています:
コンテキスト・キャッシュ (計算量限定の最適化):
- ターゲット: VLMのプリフィル・フェーズを加速します。
- メカニズム: レイテンシに敏感なMLP層における入力の類似性を活用します。類似したビジュアル・トークンを完全に再計算する代わりに、rMuscle はリファレンス実行からキャッシュされたFFN出力を再利用します。
- 選択的再計算: 「入力ドリフト」指標を計算し、大幅に変化したビジュアル・トークンを特定します。変化したトークンのみを再計算し、残りはキャッシュから取得します。指示(Instruction)およびロボットの状態(robot-state)の行は常に再計算されます。
- 結果: モデルの精度を維持しながら計算量を削減します。
アクション・キャッシュ (メモリ帯域限定の最適化):
- ターゲット: アクション・デノイジング・フェーズを加速します。
- メカニズム: 類似したタスクが重複する「重要な」ニューロンのセットを活性化するという観察に基づいています。
- ニューロンのスパース性: すべての重みをロードする代わりに、rMuscle はリファレンス実行の活性化パターンを使用して、どのニューロンが重要かを予測します。選択されたニューロンの重みのみをロードして計算します。
- 近似: 残りのニューロンは、以前の完全に計算された「アンカー」ステップからの出力を使用して近似されます。
- グループ共有マスク: 重みの収集オーバーヘッドを削減するために、連続するデノイジング・ステップをグループ化し、単一の重要ニューロン・マスクを共有します。
2.2 キャッシュ管理
低オーバーヘッドかつ管理可能なメモリ・フットプリントを確保するために、rMuscle は以下の3つの手法を採用しています:
- 非同期オンライン再構成: 拡張されたVLM状態(FFNの入力/出力)は、すべてのリファレンスのために保存するには大きすぎます。rMuscle はコンパクトな入力のみを保存し、物理的なロボットの実行中(アクション実行とオーバーラップさせて)に完全な状態を再構成します。これにより、再構成が推論のクリティカルパスをブロックしないようにします。
- スライディングウィンドウ・プリフェッチ: ロボットのワークフローの持つ時間的局所性を利用して、システムは関連するキャッシュ・エントリのスライディングウィンドウをGPUメモリ内に保持します。ロボットが実行されるにつれて、ウィンドウは動的に更新され、将来の参照として可能性の高いデータをプリフェッチします。
- マスク共有: グループ内の連続するデノイジング・ステップは、単一の重要ニューロン・マスクを共有し、キャッシュのメモリ・フットプリントとアクセス・オーバーヘッドを最小限に抑えます。
3. 主な貢献
- ワークロードの特性評価: 著者らは、繰り返されるタスクの実行が、観測やトラジェトリだけでなく、内部モデルの状態(FFNの入力/出力およびニューロンの活性化パターン)においても高い類似性を示すことを実証しました。
- デュアルフェーズ推論システム: 計算量限定のVLMプリフィル用のコンテキスト・キャッシュと、メモリ帯域限定のデノイジング用のアクション・キャッシュを備えたエンドツーエンドのシステムを設計し、SOTA VLAモデルの特定のボトルネックに対処しました。
- 包括的な評価: 本システムは、RTX 4090 および Jetson Thor 上で、92のエンボディド・タスク(LIBERO, RoboTwin, および物理ロボット)にわたる3つのモデル(π0.5, GR00T N1.6, X-VLA)を用いて評価されています。
4. 結果
- スピードアップ: rMuscle は、最先端の(SOTA)推論エンジンである FlashRT に対して、1.29–1.42倍のエンドツーエンドのスピードアップを達成しました。
- RTX 4090 上では、π0.5 で最大1.29倍、GR00T N1.6 で1.20倍、X-VLA で1.50倍。
- Jetson Thor 上では、π0.5 で最大1.42倍、GR00T N1.6 で1.23倍、X-VLA で1.43倍。
- ポリシーの品質: 本手法は、シミュレーションおよび実世界のタスクにおいて、元の成功率(SR)を維持しています。
- RoboTwin (50タスク) において、rMuscle はバニラの成功率 35.2% と一致しており、DP-Cache (33.9%) や NIRVANA (26.9%) を上回っています。
- 物理タスク(ALOHA 二腕ピック・アンド・プレース、DOBOT/Franka アセンブリライン・パッキング)において、rMuscle はバニラの性能(それぞれ 76% および 84% の SR)と一致しており、アグレッシブなステップ・スキッピングによって精度が低下するベースラインを大幅に上回っています。
- メモリ・オーバーヘッド: フレームワークによるオーバーヘッドは最小限です。RTX 4090 では、GPUメモリ使用量は13%未満増加しました(8.4 GB から約 9.4–11.4 GB へ)。Jetson Thor では、ユニファイドメモリ占有率は最大で 6.0 パーセントポイント増加しました。
5. 重要性と主張
論文は、rMuscle がエンボディド・ワークロード向けに特別に最適化された、最も高速な VLA 推論エンジンであることを主張しています。その重要性は以下の点にあります:
- タスクの反復性の活用: 単一フレームまたは単一ステップの最適化を超え、繰り返される産業タスクに内在する冗長性を活用すること。
- 包括的な最適化: VLA 推論の計算量限定およびメモリ帯域限定のステージの両方に同時に対処すること。
- 実用的な実現可能性: 物理ロボットへの実用展開に必要な成功率を損なうことなく、大幅なレイテンシ削減が可能であることを実証していること。
著者らは、rMuscle がコールあたりのレイテンシを削減することで、ロボットの応答性、動作の滑らかさ、およびタスクのスループットを向上させ、固定ワークステーション型のロボットが既存のハードウェア上でより多くのタスクを時間当たりに完了できるようにすると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。