✨ 要約🔬 技術概要
ロボットが単に、あらかじめ書かれた硬直したスクリプトに従うのではなく、パズルを管理可能な小さな断片に分解して、それを解く方法を実際に「考える」ことができる世界を想像してみてください。これは現代のロボティクスの夢であり、科学者が機械に世界の捉え方、人間の言語の理解、そして物事を成し遂げるための腕の動かし方を教える分野です。長い間、最も賢いロボットは、輝かしいが単一的で巨大な天才のような存在でした。彼らは一つの巨大で壊せない脳として訓練されます。新しい技を学ばせたい場合、多くの場合、その全体を再学習させる必要があり、彼らが「どのように」それを行っているのかを判断するのは困難です。彼らはただ、それを行うのです。しかし、もし一つの巨大な脳の代わりに、ロボットにその頭の中に専門家のチームを持つことを教えられるとしたらどうでしょうか?もし、ロボットが「よし、このカップを掴んで、次にそれを動かして、それから手を離す必要がある」と言い、それぞれのステップを、その特定の仕事を正確にこなす異なる「エキスパート」に割り当てることができるとしたらどうでしょうか?これは研究者たちが投げかけている大きな問いです。すべての動きに対してマニュアルを書き込むことなく、人間がタスクを行う様子を観察するだけで、ロボットが自律的に自分のスキルを整理することを学べるのでしょうか?
この論文は、「Mixture-of-Experts(混合エキスパート)」と呼ばれる巧妙なトリックを用いて、まさにそのアイデアを探求しています。ロボットの脳を、忙しい厨房だと考えてみてください。伝統的なセットアップでは、一人の巨大なシェフが、刻む、焼く、盛り付ける、掃除するといったすべてを一度に行おうとします。それは機能しますが、乱雑で理解しにくいものです。著者たちは異なる方法を試みました。彼らはロボットに「ヘッドシェフ」(ルーターと呼ばれます)と、専門化された「スーシェフ(副料理長)」のチームを与えました。ヘッドシェフは、状況(ロボットが見ているもの、人間が言っていること、そしてロボットの腕の位置)を見極め、次の動きのためにどのスーシェフが主導権を握るべきかを決定します。面白い点は、ロボットはこれらのスーシェフが誰であるか、あるいはどのような仕事をするべきかを教えられていなかったことです。科学者たちは、ただロボットがゼロから学習するようにさせたのです。
結果は、ロボットが自律的に驚くべきことを成し遂げたことを示唆しています。ロボットは単に人間を模倣しただけではありませんでした。タスクを再利用可能な明確なスキルへと分解することを学んだのです。例えば、ある「エキスパート」は「グラスパー(掴む者)」となり、マグカップやモカポットのような細いハンドルを掴むことに習熟しました。別のエキスパートは「プレーサー(置く者)」となり、物体を優しく置くという最終的な動きだけに集中しました。第三のエキスパートは「リトラクター(退避させる者)」となり、手を離した後に腕を持ち上げることを学びました。これらはランダムなものではなく、マグカップを電子レンジに入れたり、鍋をコンロの上に置いたりといった異なるタスクを通じて、繰り返し使用される一貫した再利用可能な行動でした。「ヘッドシェフ」は、複雑で長期的な目標を解決するために、これらのエキスパートの間をシームレスに切り替えることを学びました。
さらに魅力的なのは、ロボットに既製のスキルリストが必要ではなかったことです。ロボットは階層構造を自ら理解しました。ロボットがタスクに失敗したとき、ただ円を描いて回り続けるのではなく、既知のスキルのシーケンス(例えば、掴む、動かす、離すという動作)を何度も何度も繰り返しました。これにより、その間違いを理解することが容易になりました。研究者たちは、ロボットが複雑なシステムを使用しているにもかかわらず、標準的な巨大な脳を持つロボットと同等の性能を発揮しながら、モジュール性と解釈可能性という利点も備えていることを見出しました。これは、スマートなロボットを得るために、複雑なプランナーを構築したり、スキルのライブラリを手動でコーディングしたりする必要はないかもしれないことを示唆しています。代わりに、適切な構造を与え、データから自らスキルを構成することを学ばせればよいのかもしれません。一部のスキルは依然として特定のタスクに特化していましたが、この研究は、「エキスパートのチーム」というアプローチが、適応し、自らの行動を説明し、より自然に新しいことを学ぶロボットへの有望な一歩であることを強く示唆しています。
技術要約:Mixture-of-Experts VLAにおける創発的な構成スキル
問題提起
視覚・言語・行動(VLA)モデルは、多様なロボット操作タスクへの汎化において大きな有望性を示している。しかし、これらは通常、モノリシック(単一的)な方策として訓練・展開される。このアーキテクチャには限界がある。すなわち、再利用可能なスキルを特定したり、行動を階層的に構成したり、あるいはモデル全体を再学習させることなく方策の特定部分を適応させたりすることが困難である。対照的に、多くのロボットタスクは、自然に再利用可能な行動モード(例:リーチング、把持、配置)へと分解される。本研究の核心的な問いは、事前に指定されたタスク分解、階層、あるいは手動で定義されたスキルライブラリを用いずに、データから直接、モジュール化された方策構造(そのようなスキルを明示的に学習するもの)を導出できるか、という点にある。
手法
著者らは、既存の学習済みVLAバックボーンであるπ 0 \pi_0 π 0 およびSmolVLAの上に、Mixture-of-Experts (MoE) アクション方策を訓練することを提案している。両バックボーンは、アクション生成にフローマッチングを利用している。このアプローチは、主に2つの設計上の選択肢によって定義される:
LoRA Mixture-of-Experts: このMoEアーキテクチャは、各アクション層のFeed-Forward Network (FFN) サブレイヤーのみを置き換えるものであり、セルフアテンションはすべてのエキスパート間で共有される。各エキスパートは、ベースとなるFFNに適用される低ランク(LoRA)デルタ(r = 16 r=16 r = 16 )として実現される。方策は以下のように定式化される:FFN ℓ ( x ) = FFN ℓ base ( x ) + ∑ e ∈ R w e ( FFN ℓ ( e ) ( x ) − FFN ℓ base ( x ) ) \text{FFN}_\ell(x) = \text{FFN}^{\text{base}}_\ell(x) + \sum_{e \in R} w_e \left( \text{FFN}^{(e)}_\ell(x) - \text{FFN}^{\text{base}}_\ell(x) \right) FFN ℓ ( x ) = FFN ℓ base ( x ) + e ∈ R ∑ w e ( FFN ℓ ( e ) ( x ) − FFN ℓ base ( x ) ) ここで、R R R は正規化された重みw e w_e w e を持つルーティングされたエキスパートの集合である。LoRA行列B B B はゼロ初期化されており、これにより、ステップゼロにおいて方策が事前学習済みのバックボーンを正確に再現することを保証する。これにより、強力な事前知識からゼロからではなく、その周囲に特化(specialization)が創発することが可能となる。
全フォワードパス・ルーティング: 標準的なMoEトランスフォーマーがトークンごと、レイヤーごとにルーティングを行うのに対し、本手法では方策のフォワードパスごとに一度だけルーティングを行う。小さなMLPルーターg ϕ g_\phi g ϕ が、視覚、言語、および固有受容状態をエンコードしたコンテキストベクトルを受け取り、エキスパートE E E に対するロジットを出力する。単一の選択(top-k k k )が、すべての行動エキスパート層に対して一様に適用される。これにより、各エキスパートが、独立したレイヤーごとの決定の集合としてではなく、一貫したエンドツーエンドの行動または「スキル」として機能することを保証する。
訓練目的関数: モデルは、バックボーンのフローマッチング行動模倣損失と、単一のエキスパートへのルーティング崩壊を防ぐための補助的なロードバランシング項(λ L B = 0.01 \lambda_{LB} = 0.01 λ L B = 0.01 )を用いて訓練される。
主な結果と分析
著者らはLIBERO-10ベンチマークを用いて、学習されたスキルの性質に関する4つの核心的な問いについて評価を行っている:
質的に異なるスキルの創発: ルーターは、明確に異なる低レベルの行動に対応するエキスパートを自律的に選択することを学習した。定性的分析により、操作の特定のフェーズ(例:「把持した物体を運ぶ」、「放して退避させる」、「細いハンドルに接近して把持する」など)に特化したエキスパートが存在することが明らかになった。これらのスキルは、構造的に異なるタスク(例:マグカップを置く vs モカポットを置く)の間で再利用されており、エキスパートがタスク固有の方策ではなく、フェーズレベルのスキルをエンコードしていることを示唆している。
再利用可能なエキスパート vs タスク固有のエキスパート: 選択頻度の分析により、エキスパートの二重の役割が明らかになった。一部のエキスパート(例:エキスパートAおよびB)は、複数のタスクにわたって頻繁に再利用され(選択率35–45%)、汎用的なプリミティブとして機能する。一方で、他のエキスパートは高度に特化しており、特定のタスク(例:タスクT5におけるエキスパートC)に対してほぼ排他的に活性化し、効果的に特異なエッジケースを処理することで、再利用可能なエキスパートを「鮮明(crisp)」に保っている。
プリミティブの構成: ルーターは暗黙的な高レベルシーケンサーとして機能し、これらのプリミティブをより長いホライゾンの軌道へと繋ぎ合わせる。例えば、あるタスクはエキスパートC(把持)に続いてエキスパートA(配置)を行うといったプロセスを含む。注目すべきは、失敗事例においても、方策は任意のノイズへと退化するのではなく、既知のプリミティブを繰り返し呼び出す(例:把持と解放を何度も試みる)といった解釈可能な挙動を示す点である。
手動ルーティングによる検証: スキルがエキスパートに内在しているのか、それともルーターのアーティファクトなのかを検証するため、著者らは手動ルーティング実験を行った。ルーターの選択を特定のエキスパート(例:本来選択されていない文脈で「把持」エキスパートを強制する)で置き換えたところ、期待通りの定性的挙動が得られた。これにより、エキスパートがルーターのデフォルトの選択とは独立して、再利用可能で汎用的な能力を備えていることが確認された。
パフォーマンス: MoE方策は、同じチェックポイントからファインチューニングされた高密度(dense)なモノリシック・ベースラインと同等のタスクパフォーマンスを達成した。これは、タスクの能力を損なうことなく、スキルの特化が可能であることを示している。
意義と主張
本論文は、ロボットのための階層的なスキルベースの学習には、高レベルプランナー、オプションフレームワーク、あるいは学習済みスキルライブラリのような追加の機構を必ずしも必要としないことを主張している。代わりに、標準的な模倣学習に単純なMoEアーキテクチャを適用するだけで、以下のことが得られる:
創発的な構成可能性: モデルは、タスクを少数のモジュール化された再利用可能なプリミティブへと分解することを学習する。
解釈可能性: 成功も失敗も、既知のプリミティブのシーケンスとして理解できるため、方策の透明性が高まる。
データ駆動型のモジュール性: 構成的な構造は、ルーターと特化したエキスパート間の相互作用によって、デモンストレーションデータのみから創発する。
著者らは限界についても認めており、学習されたスキルの中には依然としてタスク固有であったり、解釈が困難であったりするものがあること、また、エキスパートとプリミティブの対応が常に完全に正確であるわけではないことを指摘している。しかし、本研究は、データのみから創発する、よりモジュール化され解釈可能なロボット方策への一歩を示すものである。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×