← 最新の論文
🤖 AI

Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation

Instant-Foldは、勾配更新や追加の微調整を必要とせず、単一の人間によるデモンストレーションから多様な実行モードを推論することにより、ゼロショットでの現実世界における変形可能な物体の操作を可能にする、シミュレーション訓練済みかつインコンテキストの模倣学習フレームワークである。

原著者: Yilong Wang, Cheng Qian, Edward Johns

公開日 2026-06-04
📖 1 分で読めます☕ さくっと読める

原著者: Yilong Wang, Cheng Qian, Edward Johns

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題:ロボットにとって「畳む」ことは難しい

ロボットにシャツの畳み方を教える場面を想像してみてください。硬い箱やコップとは違い、シャツはぐにゃぐにゃとしていて、伸び縮みし、常に形を変えてしまいます。「シャツを畳んで」と指示しても、ロボットはどうすればいいのか分かりません。袖を先に畳むべきでしょうか?それとも本体を先に畳むべきでしょうか?あるいは、両方を同時に行うべきでしょうか?

現実の世界では、人間はただ「畳んで」と言うだけではありません。私たちは誰かにやり方を見せます。「見ててね」と言って、特定の畳み方を実演するのです。この論文は、まさにこれを行うロボットシステム「Instant-Fold」を紹介しています。これは、人間のシャツの畳み方のビデオをたった一つ見るだけで、数学的な再プログラミングや学習を必要とせず、その特定のスタイルを即座にコピーして模倣することができます。

解決策:「Instant-Fold」

著者らは、まるで「観察力の鋭い弟子」のように振る舞うシステムを作り上げました。その仕組みを、3つのシンプルなステップに分けて説明します。

1. 布地を「見る」ことを学ぶ(目)

ロボットが布を畳む学習をする前に、布が動いているときにどのように見えるかを理解する必要があります。

  • 例え: 濡れたタオルを絞っているときに、特定の場所を追跡しようとしている場面を想像してください。布は伸びたり、ねじれたり、一部が隠れたりします。普通のカメラだと、混乱して「タオルが別の物体に変わってしまった」と判断してしまうかもしれません。
  • 解決策: 研究者たちは、ロボットに布を見るための特別な方法を教えました。彼らは**時間的対照学習事前学習(Temporal Contrastive Pretraining)**という手法を用いました。これは、ビデオの最初にある青い布の特定のパッチが、たとえ引き伸ばされたり、クシャクシャになったり、手で覆われたりしても、ビデオの最後でも「同じ」青い布のパッチであることを認識させるように教えることです。これにより、ロボットは「ノイズ」(シワや照明の変化など)を無視し、布の形状の「本質」に集中できるようになります。

2. 「見て真似る」メカニズム(脳)

ロボットが布を明確に視認できるようになったら、次は操作の「順序」を学ぶ必要があります。

  • 例例: あなたがダンスを習っている場面を想像してください。ステップを数字のリストとして暗記する必要はありません。代わりに、ダンサーのビデオを見て、「なるほど、左足を上げて、次に回転して、それからジャンプするんだな」と瞬時に理解します。そして、すぐにその通りのダンスができるようになります。
  • 解決策: これは**インコンテキスト模倣学習(In-Context Imitation Learning)**と呼ばれます。ロボットは、人間がシャツを畳んでいるビデオ(デモンストレーション)を一つ取り込みます。ロボットは脳を再学習させたり、複雑な数学的更新を行ったりする必要はありません。単にビデオを見て、パターン(例:「まず袖を畳み、次に裾を折り上げる」)を理解し、即座にそれを実行します。ビデオに示された特定の順序に従って、「左の袖を右の袖より先に畳む」といった異なるバリエーションにも対応できます。

3. 動きの「流れ」(手)

最後に、ロボットは実際に畳むために2本の腕を動かさなければなりません。

  • 例え: ロボットの腕が、川を下る水の流れのようなものだと想像してください。川の水は、目的地である海(完成した畳まれた状態)に到達するために、正確に進むべき道を知っています。ロボットは次にどこへ動くべきかを推測するのではなく、乱れたシャツの状態から整った山へと至る、滑らかな経路全体を予測します。
  • 解決策: 彼らは**フロー・マッチング・トランスフォーマー(Flow-Matching Transformer)**を使用しています。これは、ロボットが腕の滑らかで連続的な経路を予測し、進みながら自らを修正することで、途中で止まったりシャツを落としたりしないようにする、高度な手法です。

なぜこれが画期的なのか

ほとんどのロボット学習手法は、数千時間のデータや、あらゆる種類のシャツに対する個別の指示を必要とします。

  • ゼロショット転移(Zero-Shot Transfer): この論文の最も驚くべき点は、ロボットをコンピュータ内のシミュレーション(ビデオゲームの世界)で完全に訓練したことです。その後、その同じロボットを現実世界の、本物の服がある場所に持っていきました。すると、新しいデータや微調整を一切必要とせず、即座に動作しました(これがゼロショットです)。
  • ビデオ一本で十分: 1,000本のビデオのライブラリは必要ありません。たった一つの人間のデモンストレーションがあれば、ロボットは残りのすべてを理解します。

結果

チームはこのシステムを、実物のデュアルアーム・ロボットでテストしました。

  • 人間がシャツを畳むビデオを与えました。
  • するとロボットは、一度も見せたことがない8種類の異なる実物の衣類(シャツ、ショートパンツ、ジャケット)を、見事に畳むことに成功しました。
  • 既存の他の手法は、多くの場合失敗するか、新しいアイテムごとに特定のプログラミングを必要としましたが、この手法はそれらを上回る成果を出しました。

まとめ

Instant-Foldは、ロボットに布を理解するための「魔法の目」と、たった一つのビデオから人間の畳み方を即座にコピーする「魔法の脳」を与えるようなものです。これは、コンピュータ・シミュレーションと、複雑で変化しやすい現実世界の間の溝を埋め、ロボットが私たちを見ているだけで、複雑で形が定まらないタスクを学習できるようにします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →