← 最新の論文
💻 computer science

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAMは、実環境からシミュレーションへの再構成、LLMによるタスクプランニング、および軌跡レンダリングを通じてファインチューニング用データを自動生成することにより、コストのかかる人間によるテレオペレーションのデモンストレーションを不要にし、新たなワークスペースへのビジョン・ランゲージ・アクションモデルのスケーラブルな適応を可能にするフレームワークである。

原著者: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長らく反復の達人であり、工場で同じ精密な動作を何千回も繰り返すことができますが、新しい部屋や、わずかに異なる物体の配置に適応することを求められると苦戦します。ロボットに新しいタスクを教える際、エンジニアは伝統的にテレオペレーションと呼ばれる手法に頼ってきました。これは、人間が機械を物理的に誘導してステップを進め、すべての動きを記録してトレーニングデータセットを作成するというものです。このプロセスは効果的ではありますが、時間がかかり、コストが高く、新しい環境ごとに人が立ち会う必要があります。ロボット工学の分野は現在、言語と視覚を同時に理解できる人工知能モデルを使用するという、異なるアプローチへと向かっています。膨大なデータで学習したこれらのモデルは、「青いブロックをボウルに入れて」といった単純な一文に基づいて、ロボットアームの動きを推測することができます。しかし、これらの高度なシステムであっても、見たことがない現実世界の環境に置かれると失敗することがよくあります。なぜなら、部屋の具体的なレイアウト、照明、そして物体の正確な位置が、汎用的な学習では解決できない独自の課題を生み出すからです。

東京大学の研究者たちは、人間にロボットを誘導させることなくこの問題を解決する「DREAM」と呼ばれるシステムを開発しました。人間がタスクの実演を求める代わりに、このシステムは空のワークスペースの短い動画と単純なテキスト指示を受け取ります。そして、ロボットが視覚として使用する正確なカメラアングルを含めた、その部屋の精密なデジタルコピーを構築します。洗練されたプランニングエンジンを使用することで、コンピュータは、物体を拾い上げてどこかに置くといった、目標を達成するための論理的な一連の動きを計算します。次に、この仮想世界の中で、物体の異なる開始位置をシミュレートしながら、このタスクの何千ものバリエーションを生成し、ロボットの成功した動きを記録します。これらのシミュレーションされた動きは、現実的な画像とアクションデータへと変換され、ロボットが実世界に触れる前に、その「脳」を微調整するために使用されます。

この手法の核心は、物理的な空間の「デジタルツイン」を作成することにあります。研究者たちは、標準的な手持ちカメラを使用して、テーブルやワークスペースの短い動画を記録することから始めます。システムはこの映像を分析してシーンを三次元的に再構成し、あらゆる表面や物体の質感と位置を捉えます。極めて重要なのは、このデジタル再構成をロボット自身の座標系に合わせることです。これにより、仮想カメラが現実のロボットのカメラと全く同じように世界を見ることができるようになります。これによって、システムは現実の環境に似た感覚と見た目を持つトレーニングデータを生成でき、コンピュータのシミュレーションと物理的な世界の間の溝を埋めることができます。環境が構築されると、システムは大規模言語モデルを使用して、人間の指示を論理的な目標のセットへと翻訳します。例えば、「果物を詰める」という指示があれば、システムはまずバナナに手を伸ばし、次に桃に触れ、最後にそれらを皿に置かなければならないことを理解します。

目標が定義されると、システムはタスク・アンド・モーション・プランナーを用いて、成功するために必要な物理的なステップを算出します。このプランナーは、非常に論理的なエンジニアのように振る舞い、タスクを一連のアクションに分解し、衝突を回避してターゲットに到達するためにロボットが必要とする正確な関節の動きを計算します。これは「ソース・デモンストレーション」と呼ばれる、初期の成功した経路の小さなセットを生成します。堅牢なロボットを訓練するのに十分なデータを作成するために、システムはこれらのわずかな例を、物体が異なる場所に配置された何百もの新しいランダム化されたシナリオへと拡張します。システムは、それぞれの新しい試みが物理的に可能で安全であることを確認し、失敗したものは破棄します。最終的に、これらの成功した試みをフォトリアリスティックなビデオフレームへとレンダリングし、ロボットが学習できる画像とアクションのペアの完全なデータセットを作成します。

研究者たちは、このアプローチを、青いブロックを赤いボウルに入れる作業と、バナナと桃を特定の順序で皿に詰める作業という、2つの異なるタスクを実行する実機のロボットアームを用いてテストしました。彼らは、DREAMによって生成されたデータで訓練されたロボットと、人間が機械を誘導して収集したデータで訓練されたロボットを比較しました。その結果、デジタルツインは現実世界でのパフォーマンスの信頼できる予測因子であることが示されました。つまり、シミュレーション内で優れたパフォーマンスを発揮したロボットは、現実世界でも優れたパフォーマンスを発揮したのです。さらに重要なことに、このシステムは高いスケーラビリティを証明しました。人間のオペレーターが合理的な時間内に約100回のデモンストレーションを行えるのに対し、DREAMシステムは1,000個の高品質なトレーニング例を生成しました。このより大量に自動生成されたデータで訓練されたとき、ロボットは、より少ない人間によるデモンストレーションのセットで訓練されたものよりも高い成功率を達成しました。

この研究は、ロボットがどのように学ぶかにおける大きな転換を浮き彫りにしています。人間のテレオペレーションは依然としてデータを収集するための有効な手段ですが、オペレーターの時間と注意に制限されています。対照的に、DREAMシステムは、わずか1回のビデオキャプチャとテキスト指示だけで、膨大なトレーニング例のライブラリを生成できます。初期設定には数分かかりますが、一度システムが稼働すれば、人間がわずかな記録を行う間に、システムは数千のトレーニングシナリオを生成できます。研究者たちは、単純なタスクにおいては、自動生成されたデータによって、ロボットが人間が収集したデータよりも高い頻度で成功できることを発見しました。これは単に、練習の量が圧倒的に多かったためです。より複雑な多段階のタスクにおいても、システムは依然として人間によるデータ収集を上回りましたが、タスクの複雑さが増すと、初期の動きを計画するために、より多くの計算時間を必要としました。

この研究は、最小限の人間の介入でロボットを新しい環境に配備できる未来を示唆しています。特定のキッチンや作業場をナビゲートする方法を教えるために、専門家が何時間も待つ代わりに、ユーザーは単にロボットに部屋を見せ、何をすべきか伝えるだけで済みます。するとシステムが、トレーニングデータの作成という重労働を担い、ロボットがその空間特有の課題に対処できるよう準備を整えます。研究者たちは、現在のシステムは硬い物体が静止したテーブルの上にある場合に最も効果的であり、将来的には、柔らかい物体や動く物体を含むより複雑なシナリオに対処する必要があると認めています。しかし、単純なビデオと一文を、完全に訓練されたロボットのポリシーへと変える能力は、ロボットアシスタントを真に順応可能でアクセシブルなものにするための大きな一歩を表しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →