GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
GE-Act 2.0は、制御指向のオートエンコーダ、単一ステップの視覚プランナー、および知識整合的な選択的最適化を備えた逆動力学モデルを統合し、操作データからゼロから学習された新しい世界行動モデルであり、大規模なスケーリングとクロスエンボディメント転移を通じて、多様なタスクやエンボディメントにわたる顕著なゼロショット成功を達成している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットは長らく工場の現場の達人であり、同じ正確な動作をエラーなく数千回と繰り返してきました。しかし、彼らをキッチンやリビングルーム、あるいは散らかった作業場に立たせると、しばしば動きが止まってしまいます。課題は単に手を動かすことではなく、その手が何かに触れたときに世界がどのように変化するかを理解することなのです。この課題を乗り越えるため、新しい世代の人工知能は、未来を想像することを学んでいます。今見えているものに単に反応するのではなく、これらのシステムは、特定の行動をとった場合に次に何が起こるかを予測しようとします。「ワールド・アクション・モデル(世界・行動モデル)」として知られるこのアプローチにより、ロボットは筋肉を一つも動かす前に、頭の中で一連の出来事をシミュレーションし、その結果が目標と一致するかどうかを確認することができます。長年、研究者たちは既存のビデオ生成器(偽の映画を作成するように訓練されたプログラム)を利用し、そこにロボットの動きを理解させることで、こうしたシステムを構築しようとしてきました。しかし、この手法では、ビデオ生成器は本来物理的な体を制御するために設計されたものではないため、ロボットは物理法則に対して曖昧な理解しか持てないことがよくありました。
AgiBotのチームは現在、異なるアプローチを導入しています。それは、ロボットと人間が物体を操作する実世界のインタラクション・データのみを使用して、ロボットの想像力をゼロから構築するというものです。彼らはGE-Act 2.0と呼ばれるシステムを作り上げました。これは未来を予測し、行動を決定することを同時に学習しますが、決定的な違いがあります。それは、システムのすべての部分が、ロボットと人間による物体の操作から収集されたデータに基づいてゼロから訓練されているという点です。研究者たちは既製のビデオモデルには頼りませんでした。代わりに、彼らはシステムに「動きの圧縮された言語」、つまり制御のために重要な要素に焦点を当て、不要な詳細を削ぎ落とした世界の見方を教え込みました。これにより、ロボットは、成功したデモンストレーション、失敗した試行、さらには指示の記録がない状態での人間の作業ビデオを含む、膨大で多様なライブラリから学習することができました。これらの異なる種類の学習を組み合わせることで、システムは汎用性を学習しました。つまり、学習したことを、一度も見たことがない全く新しい状況に適用できるようになったのです。
この成果の核心は、研究者が物理世界の混沌とした現実をどのように扱ったかにあります。ロボットが学習しようとする際、しばしば混乱を招く問題に直面します。それは、同じ指示であっても、完了させる方法が数多く存在することです。ロボットに「赤いカップを手に取れ」と命じられた場合、左側から近づくことも、右側から近づくことも、あるいはハンドルや縁を掴むこともできます。もし訓練データがたった一つの方法しか示していないのに、ロボットの想像力が別の方法を予測した場合、システムの二つの部分が同期しなくなってしまいます。研究者たちは、この不一致を「妥当性のギャップ(validity gap)」、つまりロボットの未来の予測が、取るべき行動と一致しない状態であると特定しました。これを修正するために、彼らはフィルターとして機能する選択プロセスを開発しました。ロボットが予測された未来から学習する前に、その未来が実行すべき行動と互換性があるかどうかをチェックします。システムはいくつかの可能な未来を生成し、それらを要求される行動と照らし合わせ、共に意味を成すものだけから学習します。これにより、異なる行動がどのように異なる結果をもたらすかという理解が、混同されることを防いでいます。
この訓練の結果は驚く true に、特にロボットが練習していないタスクにおいて顕著です。研究者たちは、ブロックの積み重ねから液体の注ぎ込み、タオルの折り畳み、プラグの挿入に至るまで、100種類の異なる操作タスクを用いてシステムを評価しました。これらのテストは、訓練時に使用されたものとは異なる照明、背景、物体の配置を持つ環境において、実機のロボットを用いて実施されました。システムを300時間の小規模なデータセットで訓練した場合、あるロボットモデルにおけるタスクの成功率はわずか17.1%でした。しかし、研究者が訓練データを30,000時間にスケールアップすると、成功率は着実に44.1%へと上昇しました。この向上は、個々のタスクに対する特定の微調整なしに実現されました。ロボットは、学習した一般的なスキルを新しい課題に単に適用したのです。さらに驚くべきことに、システムは訓練データの2%未満しか占めていない別の異なるロボットモデルに対しても強い能力を示しました。これは、大規模なデータセットから学んだスキルが、新しい物理的形態へと効果的に転移したことを示唆しています。
指示に従う能力についても、困難な条件下でテストが行われました。多くの試行において、ロボットは、シーンや以前の習慣に基づいた予想に反する行動を求められました。例えば、ロボットが動作の途中にあったとしても、停止して新しい明示的なコマンドに従い、経路を変更することができました。90%以上の試行において、ロボットは、たとえそれらの詳細が微細であったり文脈が混乱していたりしても、指示の中で言及された特定の物体、色、形、または位置を正しく識別できました。研究者たちは、ロボットが学習したスキルの多様性と、新しいタスクを遂行できる能力との間に強い相関関係があることを見出しました。訓練データの多様性が高ければ高いほど、ロボットは未知の状況に対処できる可能性が高まります。これは、より有能なロボットへの道が、単に優れたアルゴリズムにあるのではなく、それらが消費するデータの量と多様性にあることを示唆しています。
この研究は、人間が世界を理解するために用いる豊かで構造化されていないデータから、ロボットが学習できるようにするための重要な一歩となります。未来を予測し、行動を計画することを統一的な方法で行い、多くの可能性の中から正しい予測を選択するように教えることで、研究者たちは堅牢で適応性の高いモデルを作り上げました。これらの知見は、十分な多様性を持った経験があれば、ロボットは物体がどのように振る舞い、それらとどのように相互作用すべきかについて、深く直感的な理解を発達させられることを示しています。このアプローチが、新しい仕事ごとに再学習を必要とすることなく実機ハードウェア上で成功したことは、ロボットが動的で予測不可能な環境に配備され、そこで成長していける未来を示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。