人間のように見て、理解し、そして器用に関数を動かすことができるロボットは、長らく自動化における聖杯とされてきました。長年、研究者たちはテーブルの上のコップを識別したり、「それを持ち上げて」という言葉の指示に従ったりできるシステムを構築してきました。しかし、その理解を滑らかでリアルタイムな物理的動作へと変えることは、依然として手強いボトルネックのままです。核心的な困難はタイミングにあります。ロボットは、世界を観察し、その画像を処理し、次に何をすべきかを決定し、そして腕を動かすというプロセスを、すべて数分の一秒以内に行わなければなりません。もし思考プロセスに時間がかかりすぎると、ロボットは遅れを取り、古くなった情報に基づいて行動してしまい、目標を見失ってしまいます。この遅延は、Vision-Language-Action(視覚・言語・行動)モデルとして知られる最新世代のロボットの脳において、特に深刻です。これらのシステムは、見る能力と読む能力を、動きを計画する能力と組み合わせているため強力ですが、同時に低速でもあります。これらは多くの場合、一つの動きを小さな塊に分解し、モーターにコマンドを送る前に、一連の反復的で時間のかかる計算を通じて各塊を洗練させることで機能します。その結果、ロボなるロボットは躊躇したり、途切れ途切れになったり、あるいは、人間には不可能なほどラグのある動きを見せたりすることになります。
これを解決するために、カリフォルニア大学サンディエゴ校とMITの研究チームは、これらのロボットの脳が逐次的ではなく同時並行的に考え、動けるように設計された「FlashVLA」と呼ばれる新しいフレームワークを導入しました。工場の組立ラインを想像してみてください。作業員が製品の検査が完全に終わるのを待ってから次の製品に取り掛かる場合、ラインは頻繁に停止します。FlashVLAはこのワークフローを変更し、作業員が常に異なる段階の製品を同時に扱うようにすることで、安定した連続的な流れを確保します。技術的な観点では、研究者たちは、一つの完全な動きを一度にデコードするという古い手法を、「ストリーミング」アプローチに置き換えました。動きの計画が完璧になるのを待ってから行動するのではなく、システムは異なる完了段階にある複数の動きの計画をバッファとして保持します。いくつかの計画はほぼ完了して実行準備ができており、他の計画は始まったばかりで、まだ洗練されている最中です。システムはこれらすべての計画を一度に、単一のステップで更新し、最も完成度の高いものを即座にロボットのモーターに送ります。これにより、コンピュータが次の数ステップを考えている間もロボットは動き続けることができ、思考にかかる時間を事実上隠蔽することができます。
この変更による影響は劇的です。研究者たちのテストでは、このストリーミング手法により、標準的な手法と比較して、単一のアクションを生成するために必要な時間が最大20分の1に短縮されました。単一のグラフィックスカード上で、システムは毎秒少なくとも30回の制御周波数を達成しましたが、これは人間の観察者にとって瞬時に感じられる速度です。より重要なことに、この速度は精度の犠牲の上に成り立つものではありませんでした。システムはこれらの動きの塊をまとめて処理するため、将来のステップは今まさに起ころうとしているステップから自然に学習します。これにより、古い情報に基づいて行動しようとするロボットによく見られる、ぎこちなく断片的な動きを回避した、滑らかで連続的な動きが生まれます。シミュレーション環境および実世界のロボットアームを用いたテストにおいて、この新システムは、より低速な従来のモデルと同等またはそれを上回る成功率を示しながら、大幅に高速で動作しました。
研究者たちはまた、この手法がロボットを驚くほど複雑な長期タスクに適応させることも発見しました。ロボットが完了までに長い時間を要する一連の動作を実行しなければならない場合、この新システムの「先読み」と「直近の過去を記憶する」能力が、軌道を外れない助けとなりました。長期的なタスクを含む一連の実験では、成功率は従来の最良の手法と比較して36パーセントポイント以上上昇しました。これは、システムが現在の行動を将来の計画に結びつける方法が、複雑なシーケンスを迷わずに進むための一種の短期記憶として機能していることを示唆しています。チームは、シングルアームやツーアームのシステムを含む様々なロボット構成でこれらのアイデアをテストし、速度と滑らかさの改善が、異なるハードウェアや異なる種類のタスクにおいても有効であることを確認しました。
この研究が特に重要である理由は、計算の遅さと、ロボットが見ているものと実際の位置との間のミスマッチという、二つの問題を同時に解決している点にあります。遅さを修正しようとするこれまでの試みは、ロボットを古いデータに基づいて行動させてしまうことが多く、一方でデータのミスマッチを修正しようとする試みは、ロボットを再び低速化させる複雑な追加計算を必要としました。FlashVLAは、思考プロセス自体を連続的なものに構造化することで、このトレードオフを取り除きました。研究者たちは、単にロボットが動きの計画を処理する方法を変えること、つまり、様々な準備段階にある計画のローリングバッファを保持することによって、以前は到達不可能であった流動性を達成できることを実証しました。その結果、素早く反応し、滑らかに動き、複雑な操作タスクを信頼性高くこなすことができるロボットを実現し、機敏で現実的な自動化という夢を、一歩現実に近づけました。
技術要約: FlashVLA
問題提起
フロー・マッチング(例:π0.5)に基づく視覚・言語・行動(VLA)モデルは、実世界のロボットへの展開において、極めて深刻なボトルネックに直面している。それは、高い推論レイテンシと不安定な非同期実行である。
- レイテンシ: フロー・マッチング型VLAにおけるアクションのデコーディングには、単一の観測条件のもとで、複数の逐次的なデノイジング・ステップ(例:1チャンクあたり10ステップ)を必要とする。プロファイリングの結果、アクションのデコーディングだけで、ステップあたりの推論時間の約75%を消費しており、制御ループを停滞させていることが判明した。
- 非同期の不一致: レイテンシを隠蔽するために、非同期推論では予測と実行をオーバーラップさせる。しかし、これによりモデルは「古い」観測から予測を行うことを余儀なくされる。ロボットは、モデルが一度も見ていない状態に基づいてアクションを実行するため、ルックアヘッド・ホライゾン(先読み期間)とともに増大する時間的なミスマッチが生じる。
- ジレンマ: 既存のソリューションは、これらの問題を個別に解決している。効率的な推論手法(圧縮やプルーニング)は、ステップあたりのコストを削減するが、チャンク境界での停滞を排除することはできない。非同期手法(将来状態の条件付け)は、ミスマッチを修正しようとするが、補助的な予測器やアーキテクチャの変更を必要とし、ルックアヘッドが長い場合には再びミスマッチを増幅させる可能性がある。
著者らは、共通の根本原因を**「孤立」**であると特定している。現在のフロー・マッチング型VLAは、純粋なノイズから各アクション・チャンクを孤立してデコードしており、現在の観測のみを条件としている。これが、すべてのデノイジング・レイテンシを単一のステップに集中させ、将来のチャンクがこれから合流しようとしている軌道について情報を得られない状態に陥らせている。
手法: FlashVLA
FlashVLAは、アクション・チャンクを孤立させるのではなく、共同でデコードするストリーミング・アクション・デコーディング・フレームワークを導入する。これは、フロー・マッチング型VLAモデルに対するドロップイン形式の修正として設計されており、軽量なアーキテクチャ変更とファインチューニングのパスのみを必要とする。
1. チャンク単位の自己回帰定式化
すべてのデノイジング・パスを単一のチャンクに捧げる代わりに、FlashVLAは、ずらされたノイズレベル(τ1<τ2<⋯<τN)で保持されるN個のアクション・チャンクからなるストリーミング・バッファ(Bt)を維持する。
- ずらされたノイズ: バッファには、ほぼクリーンなチャンク(実行準備完了)から、純粋なノイズのチャンク(将来の実行用)まで、スペクトラムが含まれている。
- 共同進行: 単一のフォワード・パスによって、バッファ内のすべてのチャンクを1つのデノイジング・ステップ分だけ前進させる。ウォームアップ期間の後、システムはステップごとに1つの実行可能なチャンクを出力する。これにより、N個のデノイジング・ステップを時間軸にわたって分散(アモルタイズ)させ、ステップあたりのレイテンシを最大20倍削減する。
- チャンク単位の因果的アテンション: モデルは、後続(よりノイズの多い)チャンクが先行(よりクリーンな)チャンクにアテンションを向けるが、その逆は行わないという因果的マスクを適用する。これにより、将来の状態をデコードするモデルが、バッファ内にある近接実行中の軌道を暗黙的に条件付けることが可能になる。これにより、明示的な将来状態予測器なしに非同期の連続性を回復する。
2. ストリーミング推論アルゴリズム
推論プロセスは2つのフェーズで動作する:
- コールドスタート: バッファは、N−1個のパディング・チャンクと1つのガウス・サンプルで初期化される。システムは、ロボットが安全なデフォルト・アクションを実行している間に、バッファを充填するためにN−1ステップの推論を実行する。このオーバーヘッドはエピソード全体を通じて分散される。
- 定常ストリーミング: バッファはキューとして機能する。各ステップで全チャンクを前進させ、最もクリーンなチャンクを取り出して実行し、残りのチャンクをシフトさせ、新しい純粋なノイズ・チャンクを追加する。
- システム最適化: 完全なレイテンシの恩恵を実現するため、著者らは推論ステージをCUDA Graphsにコンパイルし、カーネル・フュージョンとPyTorchのmax-autotuneを適用して、カーネル起動のシリアル化を排除している。
3. マルチ・バッファ共同ファインチューニング
学習済みのVLAは、チャンクを孤立してデノイズするように訓練されている。これらをストリーミング・パラダイムに適応させるため、著者らはパッキング訓練戦略を提案する:
- 単一の観測に対するすべての可能なバッファ構成(コールドスタートから定常状態まで)を、単一の訓練サンプル内にパッキングする。
- アテンション・マスクがサンプル内の異なるバッファ構成を分離し、観測エンコーディングを共有しながら、モデルが任意の有効なバッファ・プレフィックスを扱えるように学習することを保証する。
- ロスはすべてのバッファ構成にわたって合計され、モデルに、任意のノイズレベルにおいて、任意の有効な履歴を条件としてチャンクをデノイズすることを教え込む。
主な貢献
- 統一されたソリューション: FlashVLAは、チャンク・デコーディングの構造的仮定を「孤立」から「共同デコーディング」へと変更することで、推論レイテンシと非同期の不一致の両方に同時に対処する。
- ストリーミング機構: ずらされたノイズレベルを持つストリーミング・バッファとチャンク単位の因果的アテンションを導入し、1回の推論ステップにつき1つの実行可能なアクションを可能にしつつ、軌道の連続性を暗黙的に維持する。
- 効率性: 本手法は、ステップあたりのアクション・デコーディング・レイテンシ(アモルタイズ後)を20倍削減し、非同期設定において最大2.43倍のエンドツーエンドの高速化を実現する。
- 長期間タスクへの恩恵: ストリーミング・バッファに備わったチャンクレベルのメモリ(将来のチャンクが洗練された過去のチャンクにアテンションを向ける仕組み)により、明示的なメモリ・モジュールなしで、長期間のタスクにおける性能が大幅に向上する。
実験結果
著者らは、LIBERO(シングルアーム)、RoboTwin 2.0(バイマニュアル)、および実世界のFrankaタスクにおいて、π0.5、VLASH、StreamingVLA、およびRealtime-VLAと比較評価を行った。
- 非同期性能: 1ステップの遅延があるLIBEROにおいて、FlashVLAは平均成功率を96.9%から97.8%に向上させると同時に、ステップあたりの時間を53.8 msから22.1 msへと短縮した(2.43倍の高速化)。また、遅延 d=1 から $4$ の範囲で高い成功率(97.5–98.3%)を維持し、ルックアヘッドが増加すると著しく低下するベースラインを上回った。
- レイテンシと反応速度: FlashVLAは、すべての構成において最低の推論レイテンシを達成した(例:3ビューにおいてRTX 5090で20.3 ms)。これにより、∼50 Hzのポリシー更新を継続的に可能にした。FASTERベースラインと比較して、初回アクションまでの時間(TTFA)を1.7倍、反応時間(TTR)を1.6倍短縮した。
- 長期間タスク: RoboTwin 2.0において、FlashVLAは長期間のタスクで劇的な改善を示し、π0.5と比較して成功率を36.6ポイント向上させた(53.0%から89.6%へ)。これは、暗黙的なチャンクレベルのメモリによるものである。
- 汎用性: 本手法は他のアーキテクチャ(SmolVLA, LingBot-VLA)にも効果的に転移し、推論レイテンシを1.95倍から2.81倍削減しながら、タスク品質を維持または向上させた。
意義と主張
本論文は、FlashVLAがフロー・マッチング型VLAの展開における根本的な転換を象徴していると主張している。アクション・チャンクを孤立したバッチとしてではなく、連続的で因果的に接続されたストリームとして扱うことで、低レイテンシ推論と時間的一貫性の間のトレードオフを解消する。
- 実世界での実現可能性: 本システムは、単一のGPU上で ≥30 Hzでのスムーズな非同期実行を可能にする。これは、高容量のフロー・マッチング・モデルにおいては以前は困難であった閾値である。
- 構造的な単純さ: このソリューションは、複雑な補助的予測器や大規模なデータセットによる再学習に依存せず、構造的な変更(共同デコーディング)と標準的なファインチューニング手順に基づいている。
- スケーラビリティ: パフォーマンスの向上はタスクのホライゾンとともにスケールしており、この手法が、時間的一貫性が極めて重要となる複雑で長時間の操作タスクに特に適していることを示唆している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録