← 最新の論文
💻 computer science

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAMは、インコンテキストの人間による動画をタスク仕様として活用し、74.2K組の人間とロボットのペアからなる合成データセットと、視覚的なプロンプトへの依存を強制するための将来のチャンク予測目的関数によって支えられた、ロボット操作におけるゼロショットのタスク横断的汎化を実現する因果的ビデオアクションモデルである。

原著者: Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長年、根本的な限界に直面してきました。それは、教えられたことを正確に繰り返すことは得意であるものの、練習したことのない新しい状況に直面すると立ち往生してしまうという点です。もしロボットが赤いブロックを積み上げることを学習したとしても、青いブロックをどう積み上げるか、あるいは電子レンジをどう開けるかといったことを、人間のプログラマーがその特定のタスクのためにコードを書き換えない限り、自力で判断することはしばしばできません。このような汎用性の欠如は、家庭や職場で役立つ機械を構築する上での大きな障壁となっています。長年、研究者たちは言語を通じてロボットに教えることでこの問題を解決しようと試みてきました。「カップを持ち上げて」といった言葉による指示を与える方法です。しかし、言葉は、物体をどの程度の強さで握るべきか、あるいは結び目を解くために必要な正確な一連の動きといった、複雑で物理的な詳細を捉えるには、あまりにも曖昧すぎることがあります。人間がロボットにやり方を教えるより自然な方法は、単に実演を見せることですが、人間の動画を見てロボットに直接学習させることは困難であることが証明されてきました。なぜなら、人間とロボットでは動きが異なり、世界の見え方も角度も異なるからです。

ある研究チームは、特定のタスクに関する事前のトレーニングや、ロボットの内部ソフトウェアの変更を必要とせず、人間が行っている短い動画を見るだけで、全く新しいタスクを学習できる新しいアプローチを開発しました。彼らはこのシステムを「Zero-WAM」と呼んでいます。核心となるアイデアは、人間の動画を単なる参照資料としてではなく、直接的な指示として扱うことです。ロボットが新しい仕事を行う際、ロボットは人間が似たような仕事をしている動画を見て、その視覚的なガイドを利用して自分自身の次の動きを決定します。これを実現するために、研究者たちは膨大なデータ問題を解決しなければなりませんでした。彼らは、人間がタスクを行っている動画と、その同じタスクに対するロボット自身の動きが完璧に一致している例を数多く必要としました。このようなペアを手作業で収集するのは時間がかかりコストも高いため、彼らは既存のロボットの作業記録を取り込み、人工知能を使用してそれに対応する人間の動画を生成する自動化システムを構築しました。このプロセスにより、単純なピック・アンド・プレース(持ち上げて置く)動作から複雑で多段階の操作に至るまで、約9,000種類の異なるタスクをカバーする74,200組のペアを含む膨大なライブラリが作成されました。

研究者たちは、この多様なライブラリを用いてモデルを訓練し、自身の動きの履歴と見ている人間の動画に基づいて、次にロボットが何をすべきかを予測するように学習させました。彼らの手法の重要な要素は、モデルが以前に見たものに基づいて推測するのではなく、実際に人間の動画に注意を向けるようにすることでした。彼らは、モデルが単に次の瞬間を予測するだけでなく、数ステップ先まで予測しなければならないという特別な訓練ステップを追加しました。これにより、システムは単に直前の過去に反応するのではなく、人間の動画に示されている長期的な目標を理解することを強制されました。シミュレーション環境において、訓練中に一度も見せたことのない7つの全く新しいタスクでこのシステムをテストしたところ、試みのほぼ半分で成功しました。これは、成功率が5回に1回未満であった従来のメソッドと比較して、劇的な改善です。このシステムは、電子レンジを開ける、ブロックを積み上げる、ステープラーを動かすといった困難な課題を、単に人間のデモンストレーション動画を見るだけで処理することができました。

成功はシミュレーションに留まりませんでした。チームは訓練されたモデルを実世界の物理的なロボットアームへと持ち込み、物体を容器に入れる、複数のアイテムを特定の順序で動かす、テーブルの脚を穴に精密に挿入するといったタスクでテストを行いました。これらの実世界でのテストにおいても、ロボットは再び人間の動画による指示を用いて、訓練中に見ていない異なる色の物体や異なるテーブルのセットアップといった未知の構成を乗り越えていきました。実世界の物理的な困難さゆえに成功率はシミュレーションよりも低くなりましたが、ロボットは標準的な言語ベースのシステムでは全く解決できなかったタスクを完遂することができました。例えば、ビデオガイドに基づいてテーブルの脚を特定の穴に挿入するように求められた際、ロボットはかなりの割合の試行で成功しましたが、言語のみのシステムは完全に失敗しました。

これらの知見は、ロボットの適応性を妨げているボトルネックは、必ずしもロボットの動きの能力ではなく、指示の与え方にあることを示唆しています。テキストベースのコマンドから動画ベースのデモンストレーションへと移行し、膨大な自動生成データセットを用いて、人間の行動をロボット自身の動きへと翻訳する方法を用いることで、研究者たちはより柔軟な機械への実行可能な道筋を示しました。このシステムは、新しい仕事ごとに新しいスキルを学習する必要はありません。代わりに、視覚的なデモンストレーションを解釈するという一般的な能力を学習します。これは将来、ロボットに蛇口の修理や棚の整理をしている動画を見せれば、ロボットが自身の身体と目の前にある特定の物体に合わせて物理的な動きを適応させ、自力で同じタスクを実行できる可能性があることを意味しています。この研究は、適切なデータと訓練方法があれば、ロボットが人間の直感と機械の実行の間の溝を埋め始め、真の汎用アシスタントという目標に近づけることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →