GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
本論文は、斬新な3システム・アーキテクチャを活用し、37,000時間を超えるヘテロジニアスなデータで学習された、優れたゼロショット汎化性能、指示遂行能力、および多様なロボット形態におけるタスク成功率を従来の最先端モデルと比較して達成した、エンボディド・ファンデーションモデルであるGigaBrain-0.7を紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットが散らかったキッチンのテーブルを見つめ、「赤いリンゴをボウルに入れて」という音声の指示を理解し、周囲のものを倒すことなく、そのために腕をどのように動かすべきかを正確に判断できる世界を想像してみてください。これが、身体化された人工知能(エンボディドAI)が約束するものです。つまり、単に情報を処理するだけでなく、物理的な世界と相互作用する機械のことです。長年、研究者たちは、ロボットに人間の手が物体を動かしている何千ものビデオを見せることで、機械が物理学の法則や因果関係を学習することを期待して、ロボットを教えようとしてきました。しかし、大きな障害が残っていました。ロボットはそれぞれ作りが異なります。あるものは2本の腕を持ち、別のものはシングルグリッパーを持ち、また別のものは車輪で移動するかもしれません。あるタイプのロボットから収集されたデータは、他のタイプのロボットを混乱させてしまうことがよくあります。さらに、単にビデオを見るだけでは、もしミスをした場合に次に何が起こるかを予測する方法や、タスクがうまくいかなくなった時にどのように回復するかを、機械に教えることはできません。課題は、言語を理解し、世界を見、あらゆる種類のロボットの体を制御できる、単一のスマートな「脳」を、多様な経験の膨大な混合物から学習させながら構築できるかどうかでした。
研究チームは現在、「GigaBrain-0.7」と呼ばれるシステムによって、大きな前進を提示しています。これは単なる一つのプログラムではなく、現実世界の相互作用の複雑さを扱うために設計された、調整されたシステムです。研究者たちは、学習プロセスを一度に混沌とした爆発的なものとして強制するのではなく、連携して機能する3つの明確かつ接続された部分に整理しました。第一の部分は「手と反射」として機能し、ロボットのモーターを即座に制御して動作を実行します。第二の部分は「プランナー兼観測者」として機能し、シーンを観察し、言語による指示を理解し、「テーブルを片付ける」といった大きな目標を、「カップを持ち上げる」「シンクへ運ぶ」といった管理可能な小さなステップへと分解します。第三の部分は、最も斬新な追加要素であり、「予測者兼判定者」として機能します。これは、ロボットが現在の経路を続けた場合に、数秒後のシーンがどのようになるかを想像し、その未来に対してスコアを割り当てることで、ロボットが進歩しているのか、それとも失敗に向かっているのかを判断します。
このシステムを訓練するために、研究者たちは単一のデータソースには頼りませんでした。彼らは3万7,000時間を超える経験の膨大なライブラリを収集しました。このコレクションには、工場や家庭で働く実在のロボットのビデオ、一人称視点での人間の手が物体を操作している記録、そしてコンピュータシミュレーションから生成されたデータが含まれていました。彼らはまた、人工知能を使用して新しい訓練シナリオを作成し、ロボットが学習できる状況の多様性を効果的に拡張しました。この多様なデータの混合物をシステムに投入することで、研究者たちは、特定のロボットのための特定のテクニックを暗記するのではなく、動きと相互作用の一般的な原則をモデルに学習させたのです。システムは、2本の腕を持つ機械からヒューマノイドまで、16種類の異なるロボットの体に扱えるように訓練され、「左」と「右」、あるいは「掴む」と「放す」という理解を、制御している特定の体に基いて適応させることを学びました。
このアプローチの結果は、産業および家庭の両方の環境における実在のロボットでテストされました。見たことがないタスクを実行するよう求められた際、システムは驚異的な汎化能力を示しました。あるテストでは、ロボットは乱雑に積み上げられた服の山から衣類を畳むよう指示されました。これは、布地が形を変えたり動いたりするにつれて、グリップを常に調整する必要があるタスクです。その特定のシャツのために再学習させることなく、システムは変形する物体をうまく操作できました。別のシナナリオでは、ロボットは混ざった調理器具の中から特定の色のスプーンを拾い上げるよう指示され、微妙な言語指示を理解し、新しい物体に適用できることを実証しました。システムはまた、「机を整理する」や「米を掃く」といった、ロボットが多くの小さな動きを実行しながらも全体の目標に対する感覚を維持しなければならないような、長い一連の動作を処理できることも証明しました。
重要な発見は、システムの「未来を予測し、自身の進捗を評価する能力」が、成功率に具体的な差をもたらしたことでした。研究者がシステムの予測部分を取り除くと、ロボットは複雑なタスクに苦戦し、反復的な動作のループに陥ったり、軽微なエラーから回復できなくなったりすることがよくありました。予測コンポーネントが有効な状態では、ロボットは特定の動きが衝突や落下につながることを予見し、ミスが起こる前に進路を調整することができました。この能力により、ロボットはギフトをラッピングしたり立方体を仕分けたりといった困難なタスクを、以前のモデルよりもはるかに高い信頼性で完了することができました。研究者たちは、訓練データの量を増やすにつれてロボットのパフォーマンスが一貫して向上したことを発見し、システムがまさに経験の量と多様性から真に学習していることを示唆しました。
この研究はまた、異なる種類のデータをどのように組み合わせるかの重要性を強調しました。システムは、実在のロボットの試行、人間のデモンストレーション、およびシミュレーション環境の混合物から学習したときに最も優れた性能を発揮しました。各ソースは異なる種類のレッスンを提供しました。実在のロボットは、特定の機械の物理的な制約についてシステムに教え、人間のビデオは、人間が自然に物体とどのように相互作用するかを教え、シミュレーションは、稀な、あるいは危険なシナリオを安全に練習することを可能にしました。これらのソースを融合させることで、システムは、異なるロボットの体に対しても適用可能な、世界の仕組みに関する強固な理解を構築しました。研究者たちは、システムは完璧ではなく、最も複雑な物理的相互作用には依然として苦戦する場合があるものの、これは単一のタスクに特化したロボットを作ることから、新しい課題に適応できる汎用的なインテリジェンスを作るという転換を表していると指摘しました。
結局のところ、GigaBrain-0.7は、訓練データの量と多様性を拡大することと、計画、実行、予測を分離した構造化されたアーキテクチャを組み合わせることが、より有能で適応力のあるロボットにつながることを示しています。このシステムは単にスクリプトに従うのではありません。タスクの文脈を理解し、行動の結果を予見し、時間をかけて自身の経験から学習して改善していくのです。家庭や工場におけるあらゆる状況を扱うにはまだ課題が残っていますが、この研究は明確な道筋を示しています。それは、ロボットの未来が、より優れたハードウェアを構築することだけにあるのではなく、物理的な世界の広大で多様な経験から学習できる、よりスマートで柔軟なソフトウェアを作ることにあるということを示唆しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。