← 最新の論文
💻 computer science

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLAは、チャンクごとの因果的アテンションを用いたマルチチャンク・アクションバッファを維持することで、高速かつ非同期的なVLA推論を可能にする統一ストリーミング・アクションデコーディング・フレームワークであり、滑らかで時間的に一貫したロボットの実行を保証しながら、30Hzを超える制御周波数を実現します。

原著者: Zekai Li, Jiaming Tang, Zhijian Liu

公開日 2026-08-28
📖 1 分で読めます☕ さくっと読める

原著者: Zekai Li, Jiaming Tang, Zhijian Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人間のように見て、理解し、そして器用に関数を動かすことができるロボットは、長らく自動化における聖杯とされてきました。長年、研究者たちはテーブルの上のコップを識別したり、「それを持ち上げて」という言葉の指示に従ったりできるシステムを構築してきました。しかし、その理解を滑らかでリアルタイムな物理的動作へと変えることは、依然として手強いボトルネックのままです。核心的な困難はタイミングにあります。ロボットは、世界を観察し、その画像を処理し、次に何をすべきかを決定し、そして腕を動かすというプロセスを、すべて数分の一秒以内に行わなければなりません。もし思考プロセスに時間がかかりすぎると、ロボットは遅れを取り、古くなった情報に基づいて行動してしまい、目標を見失ってしまいます。この遅延は、Vision-Language-Action(視覚・言語・行動)モデルとして知られる最新世代のロボットの脳において、特に深刻です。これらのシステムは、見る能力と読む能力を、動きを計画する能力と組み合わせているため強力ですが、同時に低速でもあります。これらは多くの場合、一つの動きを小さな塊に分解し、モーターにコマンドを送る前に、一連の反復的で時間のかかる計算を通じて各塊を洗練させることで機能します。その結果、ロボなるロボットは躊躇したり、途切れ途切れになったり、あるいは、人間には不可能なほどラグのある動きを見せたりすることになります。

これを解決するために、カリフォルニア大学サンディエゴ校とMITの研究チームは、これらのロボットの脳が逐次的ではなく同時並行的に考え、動けるように設計された「FlashVLA」と呼ばれる新しいフレームワークを導入しました。工場の組立ラインを想像してみてください。作業員が製品の検査が完全に終わるのを待ってから次の製品に取り掛かる場合、ラインは頻繁に停止します。FlashVLAはこのワークフローを変更し、作業員が常に異なる段階の製品を同時に扱うようにすることで、安定した連続的な流れを確保します。技術的な観点では、研究者たちは、一つの完全な動きを一度にデコードするという古い手法を、「ストリーミング」アプローチに置き換えました。動きの計画が完璧になるのを待ってから行動するのではなく、システムは異なる完了段階にある複数の動きの計画をバッファとして保持します。いくつかの計画はほぼ完了して実行準備ができており、他の計画は始まったばかりで、まだ洗練されている最中です。システムはこれらすべての計画を一度に、単一のステップで更新し、最も完成度の高いものを即座にロボットのモーターに送ります。これにより、コンピュータが次の数ステップを考えている間もロボットは動き続けることができ、思考にかかる時間を事実上隠蔽することができます。

この変更による影響は劇的です。研究者たちのテストでは、このストリーミング手法により、標準的な手法と比較して、単一のアクションを生成するために必要な時間が最大20分の1に短縮されました。単一のグラフィックスカード上で、システムは毎秒少なくとも30回の制御周波数を達成しましたが、これは人間の観察者にとって瞬時に感じられる速度です。より重要なことに、この速度は精度の犠牲の上に成り立つものではありませんでした。システムはこれらの動きの塊をまとめて処理するため、将来のステップは今まさに起ころうとしているステップから自然に学習します。これにより、古い情報に基づいて行動しようとするロボットによく見られる、ぎこちなく断片的な動きを回避した、滑らかで連続的な動きが生まれます。シミュレーション環境および実世界のロボットアームを用いたテストにおいて、この新システムは、より低速な従来のモデルと同等またはそれを上回る成功率を示しながら、大幅に高速で動作しました。

研究者たちはまた、この手法がロボットを驚くほど複雑な長期タスクに適応させることも発見しました。ロボットが完了までに長い時間を要する一連の動作を実行しなければならない場合、この新システムの「先読み」と「直近の過去を記憶する」能力が、軌道を外れない助けとなりました。長期的なタスクを含む一連の実験では、成功率は従来の最良の手法と比較して36パーセントポイント以上上昇しました。これは、システムが現在の行動を将来の計画に結びつける方法が、複雑なシーケンスを迷わずに進むための一種の短期記憶として機能していることを示唆しています。チームは、シングルアームやツーアームのシステムを含む様々なロボット構成でこれらのアイデアをテストし、速度と滑らかさの改善が、異なるハードウェアや異なる種類のタスクにおいても有効であることを確認しました。

この研究が特に重要である理由は、計算の遅さと、ロボットが見ているものと実際の位置との間のミスマッチという、二つの問題を同時に解決している点にあります。遅さを修正しようとするこれまでの試みは、ロボットを古いデータに基づいて行動させてしまうことが多く、一方でデータのミスマッチを修正しようとする試みは、ロボットを再び低速化させる複雑な追加計算を必要としました。FlashVLAは、思考プロセス自体を連続的なものに構造化することで、このトレードオフを取り除きました。研究者たちは、単にロボットが動きの計画を処理する方法を変えること、つまり、様々な準備段階にある計画のローリングバッファを保持することによって、以前は到達不可能であった流動性を達成できることを実証しました。その結果、素早く反応し、滑らかに動き、複雑な操作タスクを信頼性高くこなすことができるロボットを実現し、機敏で現実的な自動化という夢を、一歩現実に近づけました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →