← 最新の論文
💻 computer science

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

本論文は、時間ワープされた成功デモンストレーションから密な相対的進捗信号を生成する完全自己教師あり報酬モデルであるWARP-RMを導入し、混合品質のデータからアクションチャンクをフィルタリングおよび再重み付けすることで、長期的なタスクにおけるロボットの性能を大幅に向上させる行動クローニング手法であるWARP-BCを可能にする。

原著者: Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

公開日 2026-09-09
📖 1 分で読めます☕ さくっと読める

原著者: Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長い間、人間を見ながら学習することに苦戦してきました。人間はタスクを一目見るだけで動きの流れを理解できますが、ビデオデータで訓練されたロボットは、成功とともに失敗までも学習してしまうことがよくあります。もし人間の操作者が考え込むために一時停止したり、物体に手こずったり、あるいは成功する前にぎこちない握り方を試したりした場合、ロボットはこれらの躊躇を正しい経路の一部として捉えてしまいます。これは、洗濯物を畳んだり物体を組み立てたりといった、長く複雑なタスクにおいて特に問題となります。一つの混乱の瞬間が、シーケンス全体を台無しにしてしまうことがあるからです。長年、研究者たちはロボットにこれらの「悪い瞬間」を無視するように教えようとしてきましたが、ほとんどの手法は、どこで間違いが起きたかを正確にマークするために高価な人間のラベル付けを必要としたり、エラーが含まれるビデオクリップ全体を破棄してしまったりしており、不完全なデモンストレーションの中に隠された貴重なリカバリー動作まで捨て去っていました。

カリフォルニア大学バークレー校とスタンフォード大学の研究チームは、人間のラベルを必要とせずに、生産的な動きと無駄な時間を区別してロボットに教える新しい方法を開発しました。彼らは「WARP(Warp-Augmented Relative Progress:ワープ拡張相対進捗)」と呼ばれるシステムを考案しました。人間が何時間ものビデオを視聴し、良質な瞬間と悪質な瞬間にボックスを描くよう求める代わりに、研究者たちは、ビデオを異なる速度で再生したり、さらには逆再生したりすることで、コンピュータに速度と進行の方向を理解させるようにしました。このシステムは、ビデオを「順方向」に進めるのと比較して、「逆方向」や停滞した動きがどのようなものかを認識させることで、ビデオのあらゆるフレームに対してスコアを割り当てることができるようになりました。このスコアは、タスクがどれほど速く前進しているか、停滞しているか、あるいは実際に後退しているかをロボットに伝えます。

研究者たちはこのアイデアを、二本の腕を持つ物理的なロボットを用いてテストしました。具体的には、ビンの中に入ったしわくちゃのTシャツを畳むタスクです。彼らは、品質の異なるトレーニングデータセットを作成しました。最も優れたデータセットでは、人間のデモンストレーションは速く効率的でした。最も劣悪なデータセットでは、人間のデモンストレーションは一時停止ややり直し、そして長い間の手こずりで満たされていました。これらの乱れた低品質のビデオを用いて標準的なロボット学習システムを訓練すると、ロボットはほぼ完全に失敗しました。ロボットは、タスクを完了できず、無意味で小さな調整のループに陥って動けなくなってしまうのです。しかし、新しいWARPシステムを使用してデータをフィルタリングすると、結果は劇的に変化しました。システムはビデオ内の遅くて躊躇のある部分を自動的に特定してその重要性を下げ、一方で速くて決定的な瞬間を維持しました。標準的なロボットが20回中20回失敗したような乱れたデータセットにおいて、WARPで訓練されたロボットは20回中19回成功しました。また、同じ質の低いデータを与えられた場合、WARPは標準的なロボットよりもTシャツを畳む速度が約18倍速くなりました。

チームはTシャツだけに留まりませんでした。彼らは、プラスチック製のボトルをビンに入れるタスクでもこの手法をテストしました。現実の世界では、新しいシステムは80個中74個のボトルを配置できたのに対し、標準的なシステムは5第個しか配置できませんでした。新しいロボットは、より速く、より一貫性を持ってボトルを配置しました。これらの結果が特定のロボットハードウェアによる偶然の産物ではないことを確認するため、研究者たちは512種類の異なるシナリオを用いた大規模なシミュレーションを実行しました。この仮想テストにおいて、新しいシステムは1時間あたり290個のボトルを配置し、標準的なシステムが管理した237個を大幅に上回りました。他の高度なデータクリーニング手法と比較しても、この新しいアプローチは一貫して最も速く、最も信頼性の高い結果を生み出しました。

この仕組みが機能する鍵となるのは、システムがどのように「進捗」を認識するかという点です。研究者たちはコンピュータに「畳まれたシャツ」がどのような見た目であるかを教えたわけではありません。代わりに、シャツを畳む人間の成功したビデオを取り出し、それらをランダムな速度で再生しました。時には極端に遅く再生し、時には高速で再生しました。また、いくつかのビデオを逆再生もしました。その後、コンピュータは、クリップの開始時点から現在の時点までにどれだけの時間が経過したかを推測するよう求められました。これらのワープさせられ、かき混ぜられたバージョンのビデオを通じて経過時間を予測することを学ぶことで、コンピュータはタスクの自然なリズムを理解したのです。コンピュータは、速くてスムーズな動きは通常タスクが前進していることを意味し、遅くてぎこちない動きや逆方向の動きは、タスクが停滞しているか失敗していることを意味すると学びました。これにより、システムはビデオの全フレームに対して連続的なスコアを生成し、ロボットに対してどのデモンストレーションに注意を払い、どの部分を無視すべきかを正確に伝えることが可能になりました。

研究者たちは、単に悪いビデオを捨て去るだけでは不十分であることを発見しました。最も効果的な戦略は、乱れたビデオは保持しつつ、ロボットがそれらから学ぶ方法を変えることでした。システムはビデオから一連のアクションの塊(チャンク)を取り出し、そのチャンクの最後における進捗スコアを確認します。もしスコアが高ければ(つまり、タスクが速く前進していれば)、ロボットはそのチャンクから全力で学習します。もしスコアが低かったりマイナスであったりする場合(つまり、ロボットが躊躇していたり後退していたりする場合)、システムはそのチャンクを完全に無視するか、あるいは非常に軽く学習を行います。このアプローチにより、ロボットはシャツを落として拾い上げる際の人間のリカバリー動作からは学ぶことができますが、その落下を引き起こしたパニックや躊躇については学習しないようにすることができました。

この研究は、ロボットが複雑なスキルを習得するために完璧な人間のデモンストレーションを必要としないことを示唆しています。タスクが進む時間の流れと、その中の進捗を理解する方法さえあれば、ロボットは乱れた現実世界のデータから学ぶことができるのです。研究者たちは、彼らの手法が、ビデオを逆再生するという、実際のロボットには物理的に不可能なタイプのデータ拡張に依存していることを指摘しています。しかし、システムはこれら人工的なトレーニングから有用なパターンを依然として学習しました。この手法は、あらゆる可能なタスクに機能する魔法のような解決策ではありませんが、人間のエラーという「ノイズ」を無視し、成功したアクションという「信号」に集中させるための強力な新しいツールを提供します。チームは、他の研究者が自身のロボットやタスクでこれらのアイデアをテストできるよう、コードとデータを公開しており、これは不完全で日常的な世界から迅速に学習できる次世代のロボットへとつながる可能性があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →