← 最新の論文
💻 computer science

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

本論文は、学習時に手首カメラの視点からエンドエフェクタをマスキングすることで、単一のロボットで学習したモデルが新しいデータを収集することなく未知のハードウェアへと汎化することを可能にし、Vision-Language-Actionモデルがゼロショットでのクロスエンボディメント操作を実現できるようにする学習手法であるCloakを導入する。

原著者: Michael Piseno, Guy Tevet, C. Karen Liu

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Michael Piseno, Guy Tevet, C. Karen Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにコップを掴む方法を教えていると想像してください。あなたは、ロボット自身の「目」(手首についているカメラ)からのビデオを見せています。しかし問題は、そのビデオの中で、ロボット自身の「手」(グリッパー)が画面の大部分を占領してしまっていることです。

もし、あなたが特定のタイプの手(例えば、シンプルな2本指のピンセット型)を使ってロボットを訓練した場合、ロボットはその特定の形を認識することを学習します。そして、もしそのロボットの手を、全く異なるもの(例えば、5本の指を持つ人間のような手)に入れ替えたら、ロボットは混乱してしまいます。それは、フォードのステアリングホイールだけを見せて運転を教わった人に、突然テスラの異なるステアリングホイールを渡すようなものです。視覚的な「マップ」が目の前のものと一致しないため、その人はパニックに陥るでしょう。

問題:「手」による注意の逸れ
ロボット工学の世界では、データの収集には多大なコストと時間がかかります。2本指のグリッパーを持つロボットが行うタスクのデータライブラリは膨大に存在します。しかし、ロボット工学の未来は、複雑な多指ハンドへと向かっています。私たちは、古いデータを使ってこれらの新しい手を教えたいと考えていますが、古いロボットの手は新しいものとは似ても似つきません。ロボットの脳は、自分の指の特定の形状に集中しすぎてしまい、周囲の状況を理解できなくなってしまうのです。

解決策:「Cloak(クローク)」
この論文では、「Cloak」と呼ばれる巧妙なトリックを紹介しています。これは、ロボットの視覚に対するデジタルな「目隠し」や「口輪」のようなものです。

  1. 手を隠す: ロボットがカメラ映像の中で自分の手を見ることがないように、Cloakは手の上にマスクを描いてデジタル的に塗りつぶします。これは、カメラのレンズの、手が映っている部分にテープを貼るようなものです。
  2. シーンを学習し、手ではないものを学ぶ: 手を隠すことで、ロボットは強制的に「世界の残り(テーブル、コップ、障害物など)」を見るようになります。これにより、ロボットは特定の指の形に惑わされることなく、タスクの「論理」(例:「コップに当たるまで前進する」)を学習します。
  3. 「カメレオン」トレーニング: ロボットが単に「特定の形のテープ」を無視するように学習してしまうのを防ぐため、研究者たちはトレーニング中に「目隠し」の形状をランダムに変更しています。時にはマスクが大きく、時には小さく、時には奇妙な形になります。これにより、ロボットに「明日、私の手は違う形になっているかもしれないので、自分の手を見ることに頼ってはいけない」ということを教え込みます。

実生活での仕組み
実際にロボットが作業を行うとき:

  • 目: カメラ映像にはまだ手が映っていますが、ソフトウェアはロボットの脳がそれを見る前に、瞬時に手でデジタルマスクをかけます。
  • 脳: ロボットの脳(Vision-Language-Actionモデル)は、マスクされた画像と「コップを掴め」というテキストコマンドを受け取ります。そして、環境に基づいて動きを判断します。
  • 体: 脳が「指先をこの位置に移動せよ」と決定すると、翻訳機(tip-pose retargetingと呼ばれます)が、その指示を新しい手に必要な具体的な筋肉の動きへと変換します。もし新しい手が5本の指を持っていれば、システムはその5本の指をどのように動かせば、2本指の計画に一致するかを計算します。

結果
研究者たちは、単純な2本指のグリッパーを用いて既存のデータでロボットを訓練し、その後、その学習済み脳を、一度も見せたことのない全く異なる3つのロボットでテストしました。

  1. 異なる色と形状を持つ、別の2本指グリッパー。
  2. 全く別のロボットアーム。
  3. 複雑な、人間のような5本の指を持つ手。

結果:

  • Cloakなしの場合: ロボットは新しい手に対して無残に失敗しました。視覚的な「マップ」が一致しなかったため、混乱したのです。
  • Cloakありの場合: ロボットは、元のロボットで行ったのとほぼ同等のパフォーマンスを新しい手でも発揮しました。ゼロショット(つまり、新しい手のための新しい学習データを必要とせずに)でスキルを転移させることに成功したのです。

重要な教訓
Cloakは、ロボットの「脳」(タスクを実行するスキル)と「体」(特定のハードウェア)を切り離すことができることを証明しました。学習中に脳から体を隠すことで、あるロボットで収集されたデータを、将来の全く異なるロボットに再利用できるのです。それは、水のリズムを学ぶために目隠しをして泳ぐ練習をさせるようなものです。水の動きに集中してリズムを学べば、一度そのリズムを覚えれば、どんな種類のフィンや足ひれを使ってでも泳げるようになるのです。

限界
この論文では、この手法は「2つの点(例えば2本の指先)を物体に配置する」といったタスクに最も効果的であると述べています。手の内部で複雑な操作を行う(例えば、手の中でボールをジャグリングするような)高度なタスクについては、指の感覚や形状に強く依存するため、まだ解決できていません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →