← 最新の論文
💻 computer science

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

本論文は、多段階の融合と経験再生を用いることで、学習済みの視覚のみのロボットポリシーを新たな力-トルク・モダリティへと効果的に適応させ、元の能力を忘却することなく接触が豊富なタスクにおける性能を向上させるマルチセンサリ・コンティニュアルラーニング・フレームワークであるMuSeを提案する。

原著者: Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、あるロボットにマスターシェフになるよう訓練したと想像してください。ただし、その教え方は「目」を使ったものだけです。ロボットは、何千もの動画を見て、刻んだり、混ぜたり、盛り付けたりすることを学びました。視覚的な動作については非常に優れていますが、どれくらいの強さで押すべきか、あるいは何かが滑り落ちているときにどうすべきかまでは知りません。

次に、このロボットに新しいスキルである「感覚(触覚)」を教えたいと考えているとします。あなたは、力センサー(繊細なタッチのようなもの)を使って、花瓶を割らずに拭いたり、電球を割らずにねじ込んだりといった、デリケートな作業をこなせるようにしたいのです。

ここで問題が発生します。あなたは、ロボットの「目」と、この新しい「触覚」センサーの両方のデータが含まれた膨大なライブラリを持っていません。持っているのは、これら新しいセンサーを用いた、ごくわずかな新しいデータセットだけです。もし、この小さな新しいデータだけでロボットを教えようとすると、ロボットは混乱し、これまで学んだ「視覚」のすべてを忘れてしまうかもしれません。これは「破滅的忘却(catastrophic forgetting)」と呼ばれる現象です。

この論文は、MuSe(Multisensory Continual Learning:マルチセンサ継続学習)と呼ばれる解決策を紹介しています。MuSeを、ロボットが古い感覚を忘れることなく、新しい感覚を学ぶのを助ける賢い「学習ガイド」だと考えてください。

MuSeの仕組みを、簡単な比喩を用いて説明します。

1. 「双方向の道」のつながり(マルチステージ・フュージョン)

通常、ロボットに新しい感覚を追加する場合、料理にサイドディッシュを添えるように、最後に単に付け加えるだけです。しかし、MuSeは異なります。これは、ロボットの「目」と新しい「触覚」センサーの間に双方向の道を作ります。

  • 早期融合(Early Fusion): ケーキを焼く前に小麦粉と卵を混ぜ合わせるように、「触覚」のデータを「視覚」のデータと最初から混ぜ合わせます。これにより、ロボットは視覚と触覚が互いにどのように関連しているかを即座に理解できるようになります。
  • 後期融合(Late Fusion): 調理の途中で味見をして味を調整するように、プロセスの後半でもチェックを行います。
  • 結果: ロボットは単に「見る」あるいは「感じる」のではなく、視覚と触覚が互いに助け合う、統合された理解を学習します。

2. 「未来の水晶玉」(マルチセンサリ・フューチャー・プレディクション)

ロボットが本当に新しい感覚を理解しているかを確認するために、MuSeは単に「タスクを実行せよ」と命じるのではありません。ロボットに未来を予測することを求めるのです。

  • ロボットは次のように推測するように訓練されます。「次の1秒間に、自分は何を見るだろうか? 何を感じるだろうか? そして、どのようなアクションを取るべきだろうか?」
  • 比喩: 雨の中での運転を学ぶドライバーを想像してください。ただ運転するだけでなく、「今ハンドルを切ったら、車はスリップするか?」「ワイパーは水を拭き取ってくれるか?」といった予測を求められている状態です。
  • 視覚的なシーンと力(フォース)の信号の両方を予測させることで、ロボットは物理的な世界の仕組みに関する深い内部マップを構築します。これにより、学習していないタスクに対しても、習得した「触覚」のスキルを応用できる「汎用性」が生まれます。

3. 「フラッシュカードの復習」(エクスペリエンス・リプレイ)

これは、忘却を防ぐための最も重要な部分です。ロボットが新しい「触覚」のスキルを学んでいる間、MuSeはロボットに同時に古い「視覚」のスキルも練習し続けることを強制します。

  • 比比喩: スペイン語を維持しようとしながら、新しい言語(フランス語)を学んでいる学生を想像してください。もしフランス語だけを1ヶ月間勉強したら、スペイン語を忘れてしまうかもしれません。MuSeは、「1時間フランス語を勉強するごとに、30分間はスペイン語の復習をしなさい」と言う教師のようなものです。
  • ロボットの場合、この「わずかな新しい触覚データ」と「膨大な古い視覚データ」を混ぜ合わせます。ロボットが、触覚データが存在しないタスク(古いデータには触覚がなかったため)に直面したとき、MuSeは単に「触覚」の部分を隠し、視覚のみに基づいて回答できるようにします。これにより、古いスキルが生き続け、失われることがありません。

研究の結果

研究者たちは、これを実物のロボットアームでテストしました。

  • 前方転移(Forward Transfer:新しいことの学習): ロボットは、新しい触覚センサーを使用して、接触を伴うタスク(花瓶を拭く、ペグを挿入するなど)において、格段に優れた能力を発揮しました。単にタスクを学んだだけでなく、「どのように感じながら進むべきか」を学んだのです。
  • 後方転移(Backward Transfer:忘れないこと): 驚くべきことに、触覚センサーの使い方を学んだ後、ロボットは元の「視覚のみ」のタスクにおいても性能が向上しました。これは、「感じる」ことを学ぶことが物理的な世界の理解を深め、結果として「見る」スキルをも鋭くしたことを示唆しています。
  • クロスモーダル汎化(Cross-Modal Generalization): 学習中に触覚データを見せていないタスクに対しても、ロボットはそこでの力がどうなるかを予測することができました。ロボットは、どこにでも適用できる「力(フォース)」という一般的な概念を学習したのです。

結論

MuSeは、ロボットを訓練するために、あらゆるセンサーの完璧で膨大なデータセットを用意する必要はないということを示しています。すでに視覚のエキスパートであるロボットに対し、少量の新しい「触覚」データを与え、この特別な訓練方法を用いることで、アップグレードが可能になります。ロボットは新しい感覚を学び、古いスキルを維持し、全体としてさらに賢くなるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →