← 最新の論文
💻 computer science

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

DriftingVLAは、次元ごとの時間的ドリフト(Per-Dimension Temporal Drifting)を用いた分布ドリフト目的関数を活用することで、単一のフォワードパスで完全なアクションチャンクを生成するネイティブな1ステップ・ビジョン・ランゲージ・アクションモデルであり、従来のマルチステップ型フローベース手法と比較して3.36倍の高速化を実現しながら、ベンチマークタスクにおいて最先端の性能を達成しています。

原著者: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

視覚、言語理解、そして人間のような滑らかな動きを兼ね備えたロボットは、長らく人工知能の夢であり続けてきました。長年、研究者たちは強力な視覚的・言語的理解とロボットアームの制御能力を組み合わせたシステムを構築してきました。「ビジョン・ランゲージ・アクション(視覚・言語・行動)モデル」として知られるこれらのシステムは、ロボットの脳として機能し、カメラが見ているものと人間が話す言葉を取り込み、それをもとにロボットの関節をどのように動かしてタスクを完了させるかを決定します。しかし、ある重大なボトルネックが、これらの機械が真のリアルタイムな応答性を備えることを阻んできました。滑らかな一連の動きを生成するために、これらのモデルは伝統的に、複雑で多段階のプロセスに依存しています。線に沿って一点ごとに小さな、ためらいがちな修正を加えながら完璧な円を描こうとしている場面を想像してみてください。ロボットは経路を計算し、一歩進み、自分の作業を確認し、そしてまた次の一歩を踏み出すというサイクルを、一つの動きに対して何度も繰り返さなければなりません。この手法は高品質な結果を生み出しますが、動作が遅いため、ダイナミックな世界においてロボットを鈍重で反応の遅いものにしてしまいます。

研究チームは現在、ロボットの動きの計画方法を根本的に変え、一瞬のうちに一連の行動全体を生成することを可能にする新しいアプローチを導入しました。彼らの研究の中心である「DriftingVLA」と呼ばれるシステムは、この遅い反復的な修正プロセスを、将来の動き全体を一度に予測することを学習する手法へと置き換えます。実際のタスク中にステップ・バイ・ステップで経路を計算する代わりに、このシステムは、訓練フェーズにおいて、ランダムな開始点から最終的な目的の動きへの直接的なつながりを学習します。この転換により、ロボットは展開時に反復的な計算を完全にスキップし、正しいアクションへと直ちにジャンプすることができます。複雑な操作タスクを含むテストにおいて、この新手法は従来の遅いシステムの精度に匹ullary(匹敵)するだけでなく、ロボットを3倍以上高速化させ、動きの決定にかかる時間を200ミリ秒以上から70ミリ秒未満へと短縮しました。

この画期的な成果の核心は、研究者がロボットに異なる動的部分間の関係をどのように理解させたかにあります。ロボットアームは単一の直線で動くのではなく、前進、回転、グリッパーの開閉など、協調して機能しなければならない複数の関節と自由度を持っています。これらのシステムを高速化しようとするこれまでの試みは、動き全体を一つの大きなブロックとして扱ったり、あるいは時間を極めて小さな断片に分解したりすることがよくありました。しかし、新しいアプローチは、各特定の動きの方向(例えば、グリッパーの垂直方向の持ち上げや手首の回転など)には、それぞれ独自の律動と統計的パターンがあることを認識しました。研究者たちは、「次元別時間的ドリフト(Per-Dimension Temporal Drifting)」と呼ばれる技術を開発し、個々の動きの方向の全履歴を学習すべき独立したユニットとして扱いました。これにより、システムは、異なる動きを単一の硬直した数学的ルールに従わせることなく、グリッパーがどのように開くべきか、あるいは手首がどのように回転すべきかといった具体的なニュアンスを理解することができるのです。

極めて重要な点として、この手法はロボットの肢体の協調能力を犠牲にしません。システムは各動きの方向のパターンを個別に学習しますが、それでもなお、アクションプラン全体を一貫した全体として生成します。言語と視覚を理解するロボットの脳は損なわれることなく、動きを生み出すアクション・エキスパートを導き続けます。多くの「もしも(what-if)」のシナリオに対して同時に予測を洗練させるようシステムを訓練することで、研究者たちは、単一ステップの決定が、遅い多段階計算の結果と同じくらい正確であることを保証しました。これは、液体を容器から別の容器へ注いだり、二つの腕を同期させてブロックを積み上げたりといった繊細なタスクを、以前のモデルを悩ませていた躊躇なしに実行できることを意味します。

研究者たちは、この新しいシステムをシミュレーション環境と実世界の双方でテストし、速度が信頼性を損なわないかを確認しました。物体を拾い上げて配置換えをするような困難なタスクを含む一連のシミュレーションにおいて、新システムは、既存の最高峰の多段階モデルをわずかに上回る、約98.3パーセントの成功率を達成しました。物理的なロボットアームを用いた実世界の環境に移しても、システムはその優位性を維持し、単腕および両腕の協調課題を含む6つのタスクにおいて、77.67パーセントの試行成功率を記録しました。このパフォーマンスは、計算プロセスを単に短縮することで古いシステムを高速化しようとした他のワンステップ手法よりも顕著に高く、それらの手法では精度が大幅に低下してしまうことがよくありました。この新手法は、システムの計算方法ではなく、学習方法を変更することで、速度と精度の両立が可能であることを証明しました。

生の数値を超えて、この研究は反復的な計算ループを取り除くことによる効率性の向上を強調しています。現実の世界では、コンマ数秒の差が重要となるため、新システムは動きのチャンクを生成するために必要な時間を227.61ミリ秒から67.67ミリ秒へと短縮しました。これは3倍以上の高速化を意味し、ロボットを環境から切り離されたように感じさせるラグを事実上排除しました。訓練プロセスでは、複数の「もしも」のシナリオを扱うために多少多くのコンピュータ・パワーを必要としますが、このコストは一度限りの投資です。一度訓練されれば、ロボットは追加のリソースを要求することなく、引き締まったシングルステップの効率性で動作します。この研究は、レスポンシブなロボティクスの未来が、より遅いアルゴリズムを実行するために高速なコンピュータを構築することにあるのではなく、アルゴリズム自体を本質的に直接的かつ即時的なものへと再設計することにあることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →