棚にある特定の玩具を取ろうとしている場面を想像してみてください。しかし、大きな箱が視界を遮っています。ただ立ち止まって棚をじっと見つめているだけでは、その玩具を見つけることはできないかもしれません。箱の周りを歩き回り、箱越しに覗き込み、手を伸ばすためのより良い角度を見つけなければなりません。
この論文は、まさにそのようなことを学習するロボットの脳、See2Actを紹介しています。これは、手(アーム)の動かし方を学ぶと同時に、目(カメラ)の動かし方も学ぶものです。
仕組みをシンプルな概念に分解して説明します:
問題点:「盲目の」ロボット
ほとんどのロボット学習手法は、テーブルのほんの一角しか見えない目隠しをした状態でパズルを解こうとしているようなものです。彼らは、必要なものはすべて目の前にあると想定しています。しかし、現実世界では物体が互いに隠し合っています(オクルージョン)。もしロボットが対象物を見ることができなければ、それを掴むこともできません。
解決策:「デノイジング(ノイズ除去)」のダンス
著者らは、**拡散モデル(Diffusion Model)**と呼ばれる種類のAIを使用しています。これは、ノイズを含んだぼやけた粘土の塊から始まり、ノイズを少しずつ削ぎ落として完璧な彫像を浮かび上がらせる彫刻家のようなものだと考えてください。
- 従来の方法: ロボットは、固定されたぼやけた画像を見つめながら、ノスの除去(ノイズを削ぎ落とすこと)を通じて「動作」(手をどこに動かすか)を見つけ出そうとします。
- See2Act の方法: ロボットは、動作を導き出すのと同時に、頭(カメラ)を動かしてノイズを削ぎ落とします。
ロボットが「何をすべきか」を理解に近づくにつれて、同時に「どこを見るべきか」も理解していきます。
- 開始: ロボットはテーブル全体の、広くぼやけた視界を見ます。対象物が隠れているため、正確にどこにあるのかは分かりません。
- ダンス: AIが手の動きについての推測を「クリーンアップ」していくにつれて、ロボットは同時にカメラを近づけ、障害物の周りを覗き込むように角度を変えていきます。
- 結果: 手の動きに関する明確なプランが出来上がる頃には、カメラは完璧な近接ビューへと移動しており、隠れていた対象物を明らかにしています。
学習:「デジタルツイン」からの学習
ロボットは、現実世界での試行錯誤(それは時間がかかり、危険でもあります)によって学習したのではありません。代わりに、研究者たちはデジタルツイン、つまりロボットと部屋の完璧なビデオゲーム版を構築しました。
彼らは、誰かが物体を拾い上げるデモンストレーションを50回分、ロボットに見せました。極めて重要なのは、単に「手をどう動かすか」を教えただけでなく、「各ステップでカメラをどこに置くべきか」も教えたことです。ロボットは、隠れた物体を掴むためには、まずそれを視界に入れるためにカメラを動かさなければならないことを学習しました。
結果:「見ることは信じること」
彼らはこのロボットを2つの方法でテストしました:
ビデオゲーム内(シミュレーション):
- 物体が箱の後ろに隠されていたり、ビンの中に隠されていたりする場合、他のロボットは完全に失敗しました(成功率0%)。
- See2Act は約**96%**の確率で成功しました。それは箱の周りを回り込み、ビンの中を覗き込んでターゲットを見つけ出す方法を編み出しました。
- また、標準的なタスクにおいて、障害物がない状況でも他の高度なロボットを上回りました。これは、カメラを動かすことが精度向上に役立つことを証明しています。
現実世界:
- 彼らはビデオゲームで学習したロボットを、実際のラボにある実物の金属製アームに載せました。彼らは現実世界に合わせて再学習させたり、微調整したりはしていません(これは「ゼロショット転移」と呼ばれます)。
- ロボットは、隠れた物体を拾い上げ、高い精度で配置するタスクを**95%**の確率で成功させました。
- ロボットは、ベースを狭い棚のスロットに差し込むような、ミリ単位の誤差が問題となるタスクも、物体を挿入する前にカメラを近づけて近くで確認することで、見事にこなしました。
まとめ
See2Actは、人間が行う非常に高度なスキルを学習したロボットです。すなわち、**「もし見えないなら、見えるようになるまで頭を動かせ」**ということです。「見る」ことと「動く」ことを一つの連続したプロセスとして組み合わせることで、固定された一点を見つめ続けるだけの他のロボットには対処できない問題を、このロボットは解決できるのです。
技術要約:See2Act – ロボット模倣学習における能動的知覚のための拡散モデル
問題提起
現在の視覚運動制御(visuomotor control)における模倣学習(IL)手法は、通常、完全な観測可能性と固定された視点を前提としており、「見る」能力と「動く」能力を混同している。現実的な環境では、物体が頻繁に遮蔽されるため、ロボットは操作を行う前に、タスクに関連する情報を能動的に探索する必要がある。既存のアプローチには根本的な限界がある。すなわち、デモンストレーションにおいて視点の選択と操作が絡み合っているにもかかわらず、標準的なILはこれらを別々に扱ったり、必要な視覚情報がすでに可視状態にあると仮定したりしている。
- 固定視点ポリシーは、タスクに関連する領域が遮蔽されている場合に機能しない。
- マルチビューまたは受動的視点選択手法(例:あらかじめ設定されたセットから最適なビューを選択する手法)は、特定の遮蔽を解消するためにカメラをどのように動かすべきかという方法をポリシーに教えることはできない。
- データの非効率性: デモンストレーションに多数の視点を単に追加するだけでは、どのビューが特定の動作に有用であるかをポリシーに教えることなく、データ要求量のみが組合せ爆発的に増加してしまう。
核心となる課題は、限られたデモンストレーションから、特に深刻な遮蔽条件下において、「どこを見るか」と「どのように動くか」を共同で決定するポリシーを学習することである。
手法:See2Act
著者らは、拡散によるアクションのデノイジング(ノイズ除去)と視点の洗練を単一の生成ループ内で結合させた、拡散ベースの模倣学習フレームワークであるSee2Actを提案する。中心となる洞察は、拡散の軌跡がアクションと視点の両方に関する軌跡として機能するという点にある。
1. 学習戦略
ポリシーは、デジタルツインを用いたシミュレーション内で、オフラインの操作データセットを活用して完全に学習される。
- キーフレーム・アクション: デモンストレーションは、ピック&プレース操作におけるエンドエフェクタのポーズを表すターゲット・キーフレーム・アクション(a0)へと分解される。
- 視点のアンカリング: 固定された世界座標系ではなく、アクションはカメラ座標系で表現される。各拡散タイムステップ t において、カメラポーズ Ct が生成される。
- アンカー: 軌跡は、広範なグローバルビュー(CT)と、キーフレーム・アクション a0 から直接導出されるターゲット中心のビュー(C0)の間でアンカーされる。
- 補間: 中間ポーズ Ct は、位置については線形補間を用いて、姿勢については CT と C0 の間の球面線形補間(SLERP)を用いて生成される。
- ノイズ付加プロセス: ターゲット・アクション a0 は、カメラフレーム Ct に変換され、視点依存のターゲット a^0 が作成される。その後、ガウスノイズが加えられ、ノイズを含んだアクション a^t が生成される。
- 目的関数: 観測 Ot(Ct からレンダリングされたもの)とノイズを含んだアクション a^t が与えられたときに、ノイズ ϵ を予測するように、視覚エンコーダとノイズ予測ネットワークが訓練される。これにより、モデルはアクションをデノイズすると同時に、対応する情報量の多い視点を暗黙的に学習する。
2. 推論:能動的視点推論
テスト時、ポリシーは結合された逆拡散プロセスを実行する:
- 初期化: グローバルビュー(CT)とノイズを含んだアクション推定値から開始する。
- 反復的な洗練: 各デノイジング・ステップ t において:
- 現在の観測 Ot を取得する。
- ノイズを予測し、カメラフレーム内でのアクション推定値を更新する。
- 洗練されたアクション推定値を世界座標系に変換する。
- カメラの再配置: 更新されたアクション推定値に基づいて、よりターゲット中心となる新しいカメラポーズ Ct−1 を計算する(学習時と同じ補間ロジックを使用)。
- 新しい観測 Ot−1 を取得する。
- 実行: このループは t=0 まで継続され、最終的なアクションと、遮蔽を能動的に解消するためのカメラポーズのシーケンスが得られる。ポリシーは、安定性を確保するために、カメラポーズの変化の分散が最小となるロールアウトを選択する。
主な貢献
- See2Act フレームワーク: デジタルツインを活用し、カメラの軌跡がアクションラベルによって完全に監督されるという斬新な学習戦略を用いることで、視点とアクションの結合を学習する、視点に依存しないポリシー。
- 能動的視点推論: テスト時に、ロボットのカメラポーズと予測されるアクションを同時に反復的に洗練させるメカニメントにより、個別のプランニング段階や報酬なしに、ロボットが自律的に遮蔽を解消することを可能にする。
- ベンチマーク性能:
- Ravens: 4つの新しい遮蔽の多いタスクにおいて平均成功率91%を達成し、固定視点、マルチビュー、およびズームのみのベースラインを大幅に上回った。
- RL1Bench: 9つのタスクにおいて平均成功率81.1%を達成し、1ステップにつき1つの能動的に再配置された2Dビューのみを使用しているにもかかわらず、最先端の3Dおよびマルチビューポリシー(RVT-2、PerActなど)を凌駕した。
- ゼロショットSim-to-Real転移: 手首に取り付けられた深度カメラを備えた物理的なUR10ロボットで実証。デジタルツインで収集されたわずか50回のデモンストレーションのみを使用し、大幅な遮蔽がある実世界のピック&プレース・タスクにおいて、実世界での微調整なしに95%の成功率を達成した。
実験結果
- 遮蔽の解消: Ravensのタスク(例:bin-picking, put-within-shelf)において、固定視点のベースライン(Conv-MLP, Diff-MV)は失敗(成功率0%)した。受動的視点選択(Diff-MV-Entropy)は最大64%に達したが、複雑な遮蔽には苦戦した。See2Actは最大100%の成功率を達成し、反復的な能動的洗練が隠れた領域を明らかにするために必要であることを示した。
- 探索行動: bin-search タスクにおいて、See2Actは創発的な探索行動を示し、現在のビューが空である場合にカメラの向きを変えて代替のビンを検査し、ベースラインが0%であったのに対し100%の成功率を達成した。
- 精密操作: 1〜2mmの公差を必要とする実世界のshelf-kittingにおいて、See2Actは95%の成功率を達成した(固定視点手法は25%)。デノイジング中にカメラをターゲットに近づける能力が、高精度な挿入に必要な幾何学的詳細を提供した。
- 堅牢性: ポリシーは、学習分布外の初期カメラポーズに対しても堅牢性を示し、学習分布外の視点から開始した場合でも、性能の低下はわずか(8〜10%)であった。
意義と主張
本論文は、See2Actが、操作をアクションの洗練と視覚的証拠の獲得という結合されたプロセスとして扱うことで、模倣学習における重要なギャップを埋めるものであると主張している。
- 統一された学習: 「どこを見るか」と「どのように動くか」が、明示的な視点アノテーションや知覚のための強化学習報酬なしに、オフラインデータから共同で学習可能であることを示している。
- 効率性: このアプローチは、限られたデータ(50デモ)で堅牢な性能を達成し、深度観測と能動的な視点洗練を用いることで、Sim-to-Realのギャップを克服し、ゼロショットでの実世界転移を実現している。
- 限界: 著者らは、各デノイジングステップで新しい観測を必要とすることがレイテンシ(遅延)を導入し、固定視点の手法よりも実行速度が遅くなることを認めている。今後の課題として、より器用でダイナミックな操作のための、高密度な軌跡予測へのフレームワークの拡張が示唆されている。
本研究は、能動的知覚を拡散デノイジングループに直接組み込むことで、固定視点、マルチビュー、および受動的選択手法では不可能な方法で、部分観測性を解消できることを確立した。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録