← 最新の論文
💻 computer science

MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks

本論文は、強化学習と模倣学習の専門家を動作のばらつきに基づいて動的に切り替える「MoRI」を提案し、複雑な実世界操作タスクにおいて高い成功率を達成しつつ、人間の介入を大幅に削減して収束を加速させることを示しています。

原著者: Yaohang Xu, Lianjie Ma, Gewei Zuo, Wentao Zhang, Han Ding, Lijun Zhu

公開日 2026-04-15
📖 1 分で読めます☕ さくっと読める

原著者: Yaohang Xu, Lianjie Ma, Gewei Zuo, Wentao Zhang, Han Ding, Lijun Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが「職人」と「探検家」の力を合わせて、難しい作業をマスターする話

〜「MoRI」という新しいロボット学習システムの紹介〜

こんにちは!今日は、ロボットが人間のように器用に物を扱えるようになるための、とても面白い新しい研究についてお話しします。

この研究の名前は**「MoRI(モーリ)」です。名前の由来は「Mixture of RL and IL Experts(強化学習と模倣学習の専門家たちの混合)」から来ていますが、イメージとしては「ロボットが、熟練した職人と、好奇心旺盛な探検家の二人組を同時に雇って、最高のチームワークで作業をこなす」**ようなものです。

1. なぜ新しいシステムが必要だったの?

ロボットに難しい作業(例えば、タオルを折ったり、箱に物を詰めたり)を教えるとき、これまで主に 2 つの方法が使われてきました。

  • 方法 A:模倣学習(IL)=「真似上手な見習い職人」
    • 得意なこと: 人間がやったことをそのまま真似するので、すぐに基本動作を覚えます。
    • 苦手なこと: 人間がやったことと少し違う状況になると、パニックになります。「失敗を繰り返して自分で考える」ことが苦手で、一度失敗すると、その失敗が積み重なって全く動けなくなることがあります。
  • 方法 B:強化学習(RL)=「試行錯誤の探検家」
    • 得意なこと: 失敗を恐れず、自分で色んなことを試して「正解」を見つけます。人間がやっていないような新しい動きも発見できます。
    • 苦手なこと: 失敗から学ぶのに時間がかかりすぎます。現実のロボットで「失敗=壊れる」リスクがあるため、無闇に試すのは危険で、人間が何度も手助けしてあげないと進みません。

これまでの研究では、この 2 つを単純に混ぜるだけだと、どちらの弱点も消えずに「難しい作業」には対応できませんでした。

2. MoRI のすごいところ:「状況に合わせて切り替えるスイッチ」

MoRI は、この 2 つの「職人(IL)」と「探検家(RL)」を、**「状況に合わせて使い分ける」**という天才的な仕組みを持っています。

  • 安定した動き(粗い動作): ドアを開ける、引き出しを閉めるなど、動きが決まっているときは**「職人(IL)」**に任せます。
  • 細かい調整(精密な動作): 物を掴んで微妙な位置に置く、穴に差し込むなど、少しのズレで失敗するときは**「探検家(RL)」**に任せます。

どんな基準で切り替えるの?
システムは、二人の「動きのブレ(ばらつき)」を見て判断します。

  • 「職人」の動きが安定している(ブレが少ない)→ 職人に任せる
  • 「職人」の動きが不安定で、迷っている(ブレが大きい)→ 「探検家」に任せて、新しい解決策を探させる

まるで、料理人が包丁の扱い(安定した動き)は得意ですが、火加減の微妙な調整(不安定な状況)は、経験豊富なシェフ(探検家)に相談するイメージです。

3. 学習のプロセス:「予習」と「実践」の 2 段階

MoRI は、以下の 2 つのステップでロボットを鍛え上げます。

  1. 予習(オフライン学習):
    まず、人間がやった動画データ(20 回分程度)を見て、「職人」も「探検家」も基本的な動きを頭に入れておきます。ここで「職人」は完璧な動きを真似し、「探検家」は「こうすれば成功するかも」という仮説を立てておきます。
  2. 実践(オンライン学習):
    実際のロボットで作業を始めます。ここで重要なのが**「安全網」**です。
    「探検家」が新しい動きを試すとき、いきなり暴走してロボットを壊さないよう、「職人」の動きを基準にして「これくらいなら安全だよ」と教えてあげます(これを正則化と呼びます)。これにより、人間が手出しする必要が激減します。

4. 結果:驚異的なパフォーマンス

このシステムを、以下の 4 つの難しいタスクでテストしました。

  • 引き出しにブロックを入れる
  • 蓋付きの箱にタオルを入れる
  • 2 つのソケットにプラグを挿す
  • タオルを二重に折りたたむ

その結果:

  • 成功率: 97.5%(ほぼ完璧!)
  • 学習時間: 2 時間〜5 時間だけで完成(従来の方法より 21% 速い)
  • 人間の手助け: 必要な回数が85.8% 減(ほぼロボットが一人でやれるようになった)

従来の方法だと、人間が何度も「待て、そこじゃない!」と手助けしていましたが、MoRI は「職人」と「探検家」がうまく連携して、ほとんど一人で問題を解決しています。

まとめ

MoRI は、「安定した真似」と「大胆な探検」を、その場の状況に合わせて賢く使い分けることで、ロボットが複雑な作業を短期間で、安全に、そして人間の手を借りずにマスターできることを証明しました。

これは、ロボットが工場のラインだけでなく、私たちの家庭や病院など、予測不能な環境でも活躍するための大きな一歩と言えるでしょう。まるで、熟練の職人と天才的な探検家がタッグを組んで、どんな難問も解決してしまうようなイメージです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →