← 最新の論文
🤖 machine learning

A Compositional Paradigm for Foundation Models: Towards Smarter Robotic Agents

本論文は、動的な実世界のシナリオへの適応における限界を克服するために、継続学習と構成性の原理を基盤モデルに統合することを提案し、それによって、より柔軟で効率的かつスマートなロボットエージェントの開発を可能にするものである。

原著者: Luigi Quarantiello, Elia Piccoli, Jack Bell, Malio Li, Giacomo Carfì, Eric Nuertey Coleman, Gerlando Gramaglia, Lanpei Li, Mauro Madeddu, Irene Testa, Vincenzo Lomonaco

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Luigi Quarantiello, Elia Piccoli, Jack Bell, Malio Li, Giacomo Carfì, Eric Nuertey Coleman, Gerlando Gramaglia, Lanpei Li, Mauro Madeddu, Irene Testa, Vincenzo Lomonaco

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットにトーストを作ることから蛇口の修理まで、あらゆることを教えようとしていると想像してみてください。長い間、これを行うための最善の方法は、ロボットのために「スーパーブレイン(超脳)」を構築することでした。それは、テラバイト級のデータで学習された、巨大で全知全能なモデルです。これは、図書館にあるすべての本を読み、インターネット上のあらゆる動画を見た天才を雇うようなものです。これらの「基盤モデル(Foundation Models)」は驚くほど賢く、人間のようにチャットができ、画像を認識し、さらにはロボットアームを制御することさえできます。しかし、落とし穴があります。それらは巨大で重いバックパックのようなものです。一度背負ってしまうと、変更するのが困難になります。もしロボットが、特定の種類の瓶を開けるといった新しいスキルを学ぶ必要がある場合、多くの場合、バックパック全体を一度脱ぎ、天才をゼロから再学習させ、再び背負わせ直さなければなりません。これには膨大な時間がかかり、大量の電力を消費します。また、瓶について学んでいる間にロボットがトーストの作り方を忘れてしまうことがあり、これは「破滅的忘却(catastrophic forgetting)」と呼ばれる問題です。

この問題を解決するために、科学者たちは「継続学習(Continual Learning)」と「構成性(Compositionality)」という2つの異なるアイデアに着目しています。継続学習は、決して勉強をやめない学生のようなものです。彼らは古い知識を忘れることなく、新しい知識を脳に付け加え続けていきます。構成性は、レゴブロックで組み立てるようなものです。一つの巨大で単一的なプラスチックの塊ではなく、多くの小さく専門化されたブロックがあります。それらをさまざまな方法で組み合わせれば、城や車、宇宙船を作ることができます。もし宇宙船を潜水艦に変える必要があれば、全体を溶かし直す代わりに、いくつかのブロックを入れ替えるだけで済みます。大きな疑問は、これらのレゴのような組み立てブロックを使うことで、今日の巨大なバックパックよりも賢く、速く、更新しやすいロボットを作れるのか、という点です。

「基盤モデルのための構成的パラダイム:よりスマートなロボットエージェントに向けて」と題されたこの論文は、その答えは「イエス」であると示唆しています。著者らは、AIモデルをただ大きくし続けることは限界に達していると主張しています。彼らは、一つの巨大で硬直したモデルを訓練するのではなく、小さく専門化されたパーツを組み合わせるシステムを構築することを提案しています。彼らはこのアイデアを、画像の認識とロボットアームの制御という、2つの全く異なる世界でテストしました。

まず、画像分類について検討しました。コンピュータに、鳥、車、花といった異なる種類の写真を次々と見せる場面を想像してください。新しい種類の写真が現れるたびにコンピュータのビジョンシステム全体を再学習させる代わりに、著者らは「レゴ」のアプローチを用いました。彼らは、新しいタスクごとに小さな、独立したモジュール(LoRAアダプターと呼ばれます)を訓練しました。そして、これらのモジュールをカチッと組み合わせるためのスマートなマージ(統合)プロセスを使用しました。その結果、この手法は精度においてより高く、かつ学習速度も非常に速いことがわかりました。50種類のタスクを含むデータセットを用いたテストでは、彼らの「レゴ」方式は55.17%の精度に達し、他の手法が47.56%や36.02%にとどまった手法を上回りました。さらに優れたことに、競合する手法が300秒以上かかったのに対し、彼らの手法はわずか170.61秒で学習を終えました。

次に、彼らはこのアイデアを現実世界のロボティクスへと持ち込みました。彼らは、ロボットがスーパーコンピュータを必要とせずに物体を操作できるかどうかを確認したいと考えました。彼らは、既存のロボットの脳を微調整するための、小型の学習済み「アダプター」を使用するシステムを構築し、状況に応じて即座に適応できるようにしました。その結果は驚くべきものでした。ロボットの操作タスクにおいて、彼らの軽量な手法は0.91の成功率(つまり91%の確率で成功したこと)を達成し、ステップあたり0.60の報酬を獲得しました。対照的に、OpenVLAやInstructRLのような非常に複雑で有名なモデルは、成功率0.0を記録し、完全に失敗しました。重量級のモデルが学習に40時間から92時間を要したのに対し、著者らの手法はわずか14時間でその役割を果たしました。

論文は、ロボットが真にスマートなエージェントとして、変化の激しい現実世界を扱えるようになるためには、静止した巨大な存在であることをやめ、柔軟なスキルの集合体になる必要があると結論付けています。これらの小さく効率的なパーツを組み合わせることで、古いことを忘れることなく新しいことを学び、かつエネルギーや時間をはるかに節約できるエージェントを生み出すことができます。これは、単一で変更不可能な「スーパーブレイン」を構築することから、互いに協力し、即座に適応し、従来のやり方では到底及ばなかったレベルの柔軟性を持って問題を解決できる、専門家チームを組み立てる方向への転換なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →