← 最新の論文
🤖 machine learning

Reinforcement Learning for Real-Time Vision-Language-Action Policies

本論文は、推論レイテンシにもかかわらず、大規模なVision-Language-Actionモデルを実世界のダイナミクスへサンプル効率的かつ高性能に適応させるために、低速で表現力豊かな行動生成と高速で反応的な行動編集を分離する強化学習フレームワークであるReal-Time EXPO-FTを導入するものである。

原著者: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

公開日 2026-09-17
📖 1 分で読めます☕ さくっと読める

原著者: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは、長らく生物のような流動的な動きを行うことに苦戦してきました。工場内であれば、あらかじめプログラムされた厳格な一連の指示に従わせることはできますが、現実の世界は混沌としており、予測不能で、動きが速いものです。これに対処するため、研究者たちは「ビジョン・ランゲージ・アクション・モデル(視覚・言語・行動モデル)」として知られる一種の人工知能に注目してきました。これらは膨大な量のデータで学習された巨大なコンピュータプログラムであり、カメラを通じて目にするものを理解し、テキストによる指示を読み取り、ロボットアームをどのように動かすかを決定することを可能にします。これらが強力なのは、世界の仕組みに関する非常に多くの例を見てきた、広大な知識のライブラリのように機能するからです。しかし、重大な落とし穴があります。これらのモデルは非常に巨大で複雑であるため、思考するのに目に見えるほどの時間を要してしまうのです。コンピュータが画像を処理して動きを決定するまでのわずかな瞬間の間に、物理的な世界はすでに変化してしまっています。もしロボットがボールをキャッチしようとしたり、物体をバランスよく保持しようとしたりしている場合、決定を下すために使用した情報は、実際に動き出す頃にはすでに古くなっており、しばしば動作の失敗を招きます。

スタンフォード大学の研究チームは、これらの大規模なモデルがいかに思考が遅い場合でも、リアルタイムで動作するように教える新しい方法を開発しました。「Real-Time EXPO-FT」と呼ばれる彼らのアプローチは、ロボットの意思決定を2つの明確な部分に分割することで、遅延の問題を解決します。巨大で遅いモデルにすべての瞬間的な調整を行わせるのではなく、そのモデルには一般的な経路を計画するという「重労働」を行わせ、より小さく高速なコンピュータプログラムに即座の修正を行わせるのです。オーケストラを率いる指揮者を想像してみてください。指揮者は全体のテンポとメロディを設定しますが、個々の演奏家は同期を保つために即座に演奏を調整しなければなりません。このシステムでは、大規模なモデルが指揮者の役割を果たし、少し前の状況に基づいて一連の動きを提案します。次に、軽量なアシスタントが現在の世界の状況を見守り、提案された動きに対して、ロボットが動くべきまさにその瞬間に適した形となるよう、微細かつ迅速な編集を加えます。これにより、ロボットは大規模モデルの深い知識を利用しながらも、その思考速度の遅さに足を引っ張られることなく動作できるのです。

研究者たちは、この手法を物理法則が存在するシミュレーション環境と、実際の物理的な環境という2つの全く異なる環境でテストしました。シミュレーションでは、皿の上でボールのバランスを取る、ディフェンダーを避けながらサッカーボールを蹴る、動いている物体をキャッチするといった10種類の動的なタスクにロボットを挑戦させました。彼らは、遅延に対処しようとする既存のいくつかの手法と比較を行いました。結果は明白でした。新しいアプローチは、ほぼすべての試行において成功を収め、遅延を考慮しない手法を含む他のすべての手法を上回りました。これは、システムに対して自らの「遅さ」をあらかじめ考慮するように明示的に教えることで、理論上はより高速であっても適応力の低いシステムよりも、ロボットをより信頼性の高いものにできることを示した重要な発見でした。

この手法が実世界でも機能することを証明するために、チームはロボットを実験室へと移し、絶え間ない迅速な反応を必要とする4つの困難なタスクを与えました。これらには、回転するプレートの上でピンポン玉のバランスを保つこと、回転する表面からブロックを拾い上げること、別のロボットアームから渡された物体を受け取ること、そしてディフェンダーが周囲を動く中でボールをゴールへ蹴り込むことが含まれます。研究者たちは、システムがエンドレスな練習を必要とせずに素早く学習できるように、ロボットが環境と相互作用するトレーニング時間をわずか10分間に制限しました。この手法を適用する前、これらのタスクにおけるロボットの成功率はかなり低く、平均して約42パーセントでした。しかし、この新しいリアルタイム・トレーニング・フレームワークを使用した後は、成功率が97パーセントへと跳ね上がりました。ロボットは、トレーニングプロセス中に人間の介入を受けることなく、物体の混沌とした動きやタスクのタイミングの制約に適応することを学んだのです。

この研究では、システムが異なる条件下でどの程度耐性を持つかについても調査されました。研究者がロボットの思考プロセスにおける遅延を人工的に増大させた際、他の手法は失敗しましたが、新しい手法は高いパフォーマンスを維持しました。同様に、動く物体の速度が上がった場合でも、この新しいフレームワークを使用するロボットは成功し続け、他のアプローチは追いつけずに苦戦しました。これは、このシステムが特定の速度や遅延に特化したものではなく、動的な環境の予測不可能な性質に対処できるほど堅牢であることを示しています。研究者たちは、彼らのシステムが非常に効果的である一方で、タスク終了後にロボットをリセットするために依然として人間を必要とし、また各タスクに対して成功の定義を特定する必要があると指摘しています。しかし、核心的な成果は、大規模で強力なAIモデルをリアルタイムで機能させることが可能であり、人工知能の「遅くて思慮深い計画」と、物理世界の「速くて反応的な要求」との間の溝を埋めたという点にあります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →