← 最新の論文
🤖 AI

RoboSSM: Scalable In-context Imitation Learning via State-Space Models

本論文は、LIBEROベンチマークにおける長期間のタスクや未学習のタスクに対して、線形時間の推論と優れた汎化性能を実現するために、TransformerをLonghorn状態空間モデルに置き換えた、スケーラブルなインコンテキスト模倣学習フレームワークであるRoboSSMを提案する。

原著者: Youngju Yoo, Jiaheng Hu, Yifeng Zhu, Bo Liu, Qiang Liu, Roberto Martín-Martín, Peter Stone

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Youngju Yoo, Jiaheng Hu, Yifeng Zhu, Bo Liu, Qiang Liu, Roberto Martín-Martín, Peter Stone

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに「オレンジジュースを手に取って、バスケットに入れる」といった新しい家事のやり方を教えていると想像してください。

旧来の方法(「Transformer」ロボット):
以前は、ロボットは「Transformer」と呼ばれるシステムを使って学習していました。これは、新しい質問を受けるたびに教科書全体を読み直さなければならない学生のようなものです。短い動画でタスクを見せればうまく機能します。しかし、もし長い動画(多くの例示を含む「ロングプロンプト」)を見せようとすると、その学生は圧倒されてしまいます。動画の最後まで到達する頃には、最初の方の内容を忘れてしまい、パフォーマンスが崩壊してしまうのです。また、毎回ゼロからすべてを読み直さなければならないため、非常に動作が遅くなります。

新しい方法(RoboSSM):
この論文では、State-Space Model (SSM) という異なる脳のアーキテクチャを用いた、ロボットへの新しい教え方である RoboSSM を紹介しています。

RoboSSMの仕組みを、簡単な比喩を使って説明します:

1. 「無限スクロール」 vs 「図書室」

  • Transformer(図書室): 本棚にあるすべての本との関連性を見つけるために、司書がすべての本まで歩いていかなければならない状況を想像してください。もし本(デモンストレーション)が増えると、司書が答えを見つけるのに時間がかかるようになります。棚が長すぎると、彼らは迷子になってしまいます。
  • RoboSSM(無限スクロール): RoboSSMは、読み進めるにつれて自動的に更新されるスマートなスクロールのようなものです。毎回履歴全体を読み直す必要はありません。自身の「メモリ」の中に、即座に更新される進行中の要約を保持しています。これにより、学習時よりも16倍長いビデオを扱っても、動作が遅くなったり混乱したりすることなく処理できます。

2. 「ベータ」調整(ボリュームノブ)

論文では、β\beta-scaling と呼ばれる特別なテクニックについて触れています。

  • 合唱団の歌を聴いているところを想像してください。時には合唱全体を均等に聴きたいこともあれば、時にはソロ歌手(今見せられた新しいデモンストレーション)に集中して聴きたいこともあるでしょう。
  • RoboSSMには、「ボリュームノブ」(β\beta パラメータ)があり、それを上げたり下げたりすることができます。新しいタスクを見たとき、ロボットはこのノブを上げて新しい例への注目度を高め、古いルールを忘れることなく、より速く学習できるようにします。

3. 結果:彼らは何を発見したのか?

研究者たちは、ボウルを持ち上げたり、引き出しを開けたり、物を積み重ねたりするタスクを含む、LIBERO という有名なロボットテストを用いて検証を行いました。

  • 「長い動画」テスト: 短い動画(2つの例)でロボットを訓練し、その後、非常に長い動画(32つの例)でテストを行いました。
    • 旧型のロボット (ICRT): 見事に失敗しました。余分な長さに対処できませんでした。
    • RoboSSM: 例を見るほど性能が向上しました。長い例のリストを見るだけで、見たことがない物体をうまく持ち上げることができました。
  • 「スローモーション」テスト: デモンストレーション動画の速度を落とし(タイム・ディレーション)、ロボットがゆっくり動いたり、ためらったりすることをシミュレートしました。
    • 旧型のロボット: 混乱して失敗しました。
    • RoboSSM: 冷静かつ成功し続け、現実世界のタイミングの変化にも対応できることを証明しました。
  • 「スピード」テスト:
    • 旧型のロボット: ビデオが長くなるにつれて、どんどん動作が遅くなりました。
    • RoboSSM: ビデオがどれほど長くても、常に高速かつ効率的なままでした。

総括

この論文は、RoboSSM が、ロボットの脳を再学習させることなく、単に長い例のリストを見せるだけで、新しいタスクを即座に教えることができることを証明した最初のシステムであると主張しています。これは、従来の「Transformer」方式よりも高速で、より長い指示のリストを扱いやすく、速度やタイミングの変化に対してもより堅牢です。

端的に言えば、もし旧型のロボットが「5ページ読んだだけで疲れてしまう学生」だとしたら、RoboSSMは「80ページを読み、最初の1ページ目も完璧に覚えており、なおかつ素早く質問に答えることができる学生」なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →