✨ 要約🔬 技術概要
ロボットは、長らく生物のような流動的な動きを行うことに苦戦してきました。工場内であれば、あらかじめプログラムされた厳格な一連の指示に従わせることはできますが、現実の世界は混沌としており、予測不能で、動きが速いものです。これに対処するため、研究者たちは「ビジョン・ランゲージ・アクション・モデル(視覚・言語・行動モデル)」として知られる一種の人工知能に注目してきました。これらは膨大な量のデータで学習された巨大なコンピュータプログラムであり、カメラを通じて目にするものを理解し、テキストによる指示を読み取り、ロボットアームをどのように動かすかを決定することを可能にします。これらが強力なのは、世界の仕組みに関する非常に多くの例を見てきた、広大な知識のライブラリのように機能するからです。しかし、重大な落とし穴があります。これらのモデルは非常に巨大で複雑であるため、思考するのに目に見えるほどの時間を要してしまうのです。コンピュータが画像を処理して動きを決定するまでのわずかな瞬間の間に、物理的な世界はすでに変化してしまっています。もしロボットがボールをキャッチしようとしたり、物体をバランスよく保持しようとしたりしている場合、決定を下すために使用した情報は、実際に動き出す頃にはすでに古くなっており、しばしば動作の失敗を招きます。
スタンフォード大学の研究チームは、これらの大規模なモデルがいかに思考が遅い場合でも、リアルタイムで動作するように教える新しい方法を開発しました。「Real-Time EXPO-FT」と呼ばれる彼らのアプローチは、ロボットの意思決定を2つの明確な部分に分割することで、遅延の問題を解決します。巨大で遅いモデルにすべての瞬間的な調整を行わせるのではなく、そのモデルには一般的な経路を計画するという「重労働」を行わせ、より小さく高速なコンピュータプログラムに即座の修正を行わせるのです。オーケストラを率いる指揮者を想像してみてください。指揮者は全体のテンポとメロディを設定しますが、個々の演奏家は同期を保つために即座に演奏を調整しなければなりません。このシステムでは、大規模なモデルが指揮者の役割を果たし、少し前の状況に基づいて一連の動きを提案します。次に、軽量なアシスタントが現在の世界の状況を見守り、提案された動きに対して、ロボットが動くべきまさにその瞬間に適した形となるよう、微細かつ迅速な編集を加えます。これにより、ロボットは大規模モデルの深い知識を利用しながらも、その思考速度の遅さに足を引っ張られることなく動作できるのです。
研究者たちは、この手法を物理法則が存在するシミュレーション環境と、実際の物理的な環境という2つの全く異なる環境でテストしました。シミュレーションでは、皿の上でボールのバランスを取る、ディフェンダーを避けながらサッカーボールを蹴る、動いている物体をキャッチするといった10種類の動的なタスクにロボットを挑戦させました。彼らは、遅延に対処しようとする既存のいくつかの手法と比較を行いました。結果は明白でした。新しいアプローチは、ほぼすべての試行において成功を収め、遅延を考慮しない手法を含む他のすべての手法を上回りました。これは、システムに対して自らの「遅さ」をあらかじめ考慮するように明示的に教えることで、理論上はより高速であっても適応力の低いシステムよりも、ロボットをより信頼性の高いものにできることを示した重要な発見でした。
この手法が実世界でも機能することを証明するために、チームはロボットを実験室へと移し、絶え間ない迅速な反応を必要とする4つの困難なタスクを与えました。これらには、回転するプレートの上でピンポン玉のバランスを保つこと、回転する表面からブロックを拾い上げること、別のロボットアームから渡された物体を受け取ること、そしてディフェンダーが周囲を動く中でボールをゴールへ蹴り込むことが含まれます。研究者たちは、システムがエンドレスな練習を必要とせずに素早く学習できるように、ロボットが環境と相互作用するトレーニング時間をわずか10分間に制限しました。この手法を適用する前、これらのタスクにおけるロボットの成功率はかなり低く、平均して約42パーセントでした。しかし、この新しいリアルタイム・トレーニング・フレームワークを使用した後は、成功率が97パーセントへと跳ね上がりました。ロボットは、トレーニングプロセス中に人間の介入を受けることなく、物体の混沌とした動きやタスクのタイミングの制約に適応することを学んだのです。
この研究では、システムが異なる条件下でどの程度耐性を持つかについても調査されました。研究者がロボットの思考プロセスにおける遅延を人工的に増大させた際、他の手法は失敗しましたが、新しい手法は高いパフォーマンスを維持しました。同様に、動く物体の速度が上がった場合でも、この新しいフレームワークを使用するロボットは成功し続け、他のアプローチは追いつけずに苦戦しました。これは、このシステムが特定の速度や遅延に特化したものではなく、動的な環境の予測不可能な性質に対処できるほど堅牢であることを示しています。研究者たちは、彼らのシステムが非常に効果的である一方で、タスク終了後にロボットをリセットするために依然として人間を必要とし、また各タスクに対して成功の定義を特定する必要があると指摘しています。しかし、核心的な成果は、大規模で強力なAIモデルをリアルタイムで機能させることが可能であり、人工知能の「遅くて思慮深い計画」と、物理世界の「速くて反応的な要求」との間の溝を埋めたという点にあります。
技術要約: Real-Time EXPO-FT
問題提起 大規模な学習済み視覚言語行動(VLA)モデルの強化学習(RL)によるファインチューニングは、信頼性の高いロボット展開への期待を集めている。しかし、これらのモデルの規模の大きさは、重大な推論レイテンシ(遅延)をもたらす。動的な実世界環境において、アクションを生成するために使用される観測情報は、実行が行われる頃には既に古くなっていることが多い。これにより、ポリシーが古い状態情報に基づいて行動するという分布シフトが発生し、信頼性と性能を大幅に低下させる。先行研究では、このレイテンシを軽減するために非同期実行(例:Real-Time Chunking)を探索してきたが、これらの手法は主に模倣学習に基づいており、学習分布を超えていくためのメカニズムを欠いている。さらに、標準的なRLを遅延のあるポリシーに直接適用すると、アクションが過去の観測から予測されるため、標準的なクレジット割り当てに必要なマルコフ性を破壊してしまい、RLによる完全な信頼性向上を得ることができない。
手法: Real-Time EXPO-FT 本論文は、リアルタイムの制約下でのRLファインチューニングを可能にするために、低速で表現力豊かなアクション生成と、高速で反応的なアクション編集を分離するフレームワークであるReal-Time EXPO-FT を提案する。このアプローチは、VLAファインチューニングのためのサンプル効率の高いRLシステムであるEXPO-FT に基づき、Training-Time Real-Time Chunking (RTC) の概念を統合したものである。
コアアーキテクチャは、異なるタイムスケールで動作する3つのコンポーネントで構成される:
非同期VLAアクション生成(低速): 大規模な学習済みVLAベースポリシー(π V L A \pi_{VLA} π V L A )がバックグラウンドで非同期に動作する。これは、推論遅延 d d d を考慮するために、観測 s t s_t s t と前回のチャンクからの「コミット済み」アクション接頭辞(a t : t + d p r e v a^{prev}_{t:t+d} a t : t + d p r e v )に基づき、複数の候補アクションチャンクを生成する。このステップでは、多様な候補をサンプリングするためにフローマッチングを利用する。
高速・同期型エディット(高速): ロボットが実行時刻 t + d t+d t + d に到達し、最新の観測 s t + d s_{t+d} s t + d を取得すると、軽量なエディット・ポリシー(π e d i t \pi_{edit} π e d i t )が反応的な意思決定を行う。これは、VLAによって生成された候補チャンクを受け取り、現在の状態に基づいてそれらを編集することで、推論遅延中に発生した状態の変化を補正する。
Q関数による選択: 学習されたQ関数(Q ϕ Q_\phi Q ϕ )が、現在の状態 s t + d s_{t+d} s t + d のもとで、元のVLA候補と編集された候補の両方を評価する。システムは、実行のために最も高いQ値を持つアクションチャンクを選択する。
学習手順
VLAファインチューニング: ベースとなるVLAは、推論遅延を訓練中にシミュレートする修正されたフローマッチング目的関数を用いてファインチューニングされる。損失は最初の d d d アクション(遅延ウィンドウ)を除外するようにマスクされており、モデルに、コミットされた接頭辞に条件付けられた残りのアクションを予測することを強制する。
エディット・ポリシーの学習: エディット・ポリシーは、編集されたアクションのQ値を最大化するように学習され、ベース・ポリシーの出力をアクション空間内のより高い価値を持つ領域へと効果的にシフトさせることを学習する。
クリティック(Critic)の学習: クリティックは、フルアクションチャンクに対して時間差学習(TD学習)を用いて訓練される。計算コストを削減するため、この手法は(FASTERに着想を得た)ノイズ空間フィルタリングメカニズムを採用している。軽量なクリティック(Q ψ d n Q^{dn}_\psi Q ψ d n )が、フルデコードの前に候補ノイズベクトルをスコアリングし、システムがノイズ空間内で候補をフィルタリングし、エディットを適用する前に最適な候補に対して一度だけVLAデコードを実行できるようにする。
主な貢献
リアルタイムRLのためのフレームワーク: 本論文は、リアルタイムの制御頻度を維持しながら、推論レイテンシを明示的に考慮した大規模VLAモデルのRLファインチューニングを可能にする初のフレームワークを導入する。
分離された制御アーキテクチャ: 低速で高容量な行動生成(VLA)と、高速で反応的な状態補正(エディット・ポリシー)の新しい分離を提案し、システムがVLAの事前知識を活用しつつ、反応性を維持することを可能にする。
サンプル効率の高い適応: EXPO-FTのサンプル効率とリアルタイム実行戦略を組み合わせることで、最小限のオンラインデータで動的な環境への迅速な適応を実現する。
実験結果 著者らは、Kinetixベンチマーク (10のシミュレーションタスク)および4つの動的な実世界タスク (ロボットによる物体受け渡し、ボールバランシング、卓球キック、動的物体ピッキング)においてReal-Time EXPO-FTを評価した。
シミュレーション: Kinetixベンチマークにおいて、Real-Time EXPO-FTは、遅延ありおよび遅延なしの両方の手法の中で、10個の環境すべてにおいて 最高の性能を達成した。4ステップの推論遅延を伴うにもかかわらず、遅延のあるベースライン(DSRL、RTCあり/なしのEXPO-FT)を大幅に上回り、非遅延のRLPDベースライン(平均成功率81.4% vs 96.2%)さえも凌駕した。
実世界: 10分間のオンラインロボットデータ に制限された実世界実験において、Real-Time EXPO-FTは平均ポリシー成功率を42% (12.5/30) から 97% (29/30) に向上させた。Dynamic PickingとObject Passingではほぼ完璧な性能(30/30)を達成し、Ball BalancingとSoccer Kickingでは28/30を記録し、すべてのベースラインを大幅に上回った。
堅牢性: 本手法は、変化する推論遅ディや環境速度に対しても安定した性能を示したが、RTCのようなベースラインは、遅延が増加するにつれて著しく性能が低下した。
意義と主張 本論文は、Real-Time EXPO-FTが、RLファインチューニングの高い信頼性と、動的な実世界操作に必要な反応性の間のギャップを正常に埋めることを主張している。推論レイテンシを明示的にモデル化し、アクション生成と実行を分離することで、本手法は大規模なVLAモデルを、性能を犠牲にすることなく高頻度の制御ループにデプロイすることを可能にする。結果は、モデルのレイテンシによって引き起こされる分布シフトを克服し、訓練中の人間による介入なしに、困難な実世界のダイナミクスへ迅速かつサンプル効率よく適応できることを示している。
限界 著者らは、現在の実装が環境のリセットに人間のオペレーターに依存しており、それが運用上の負担を生んでいることを認めている。さらに、報酬信号はタスク固有の成功分類器(ルールベースまたは学習されたもの)に依存しており、新しいタスクごとに手動設計が必要となる。論文では、リセットの自動化や代替的な報酬定式化の探索が、今後の課題として残されていると述べている。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×