← 最新の論文
💻 computer science

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

本論文は、反復的な精緻化を学習プロセスに内包させることで、ロボット制御のためのネイティブな1ステップ生成方策を可能にし、既存のマルチステップ拡散モデルやシングルステップのベースラインを凌駕する高周波・低遅延の性能を実現する、2段階のフレームワークであるDrift-Based Policy Optimization (DBPO) を提案する。

原著者: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットアームは、電子部品の組み立てや物体の仕分けといった繊細な作業を担うものとして、工場や研究所でますます一般的になっています。これらの機械がうまく機能するためには、カメラが見ているものに基づいて、関節をどのように動かすかを正確に決定できる「脳」が必要です。この意思決定プロセスは、変化し続ける世界に反応しながら、一瞬のうちに、何度も繰り返し行われます。課題は、現実の世界が乱雑で予測不可能であることです。テーブルの上のブロックを一度見ただけでは、ロボットの以前の動きや照明のわずかな変化に応じて、いくつかの異なる有効な掴み方が考えられます。この不確実性を扱うために、研究者たちは単一の答えを選ぶのではなく、一連の可能性のある優れたアクションを学習するシステムを開発してきました。これまで最も成功してきたシステムは、「ゆっくりと丁寧な彫刻家」のように機能する手法を用いています。それは、ランダムな推測から始まり、動きが完璧に見えるまで、ステップごとに段階的に洗練させていくというものです。このアプローチは高品質な動きを生み出しますが、速度が遅いという欠点があります。ロボットは一つの動きをするたびにコンピュータの脳を何度も走らせる必要があり、それが遅延を生み、高速なリアルタイムのタスクや、試行錯誤を通じた新しいスキルの習得には不向きなものにしています。

現在、ある研究チームが、これほどスマートなロボットの脳を、同等の能力を保ちながら劇的に高速化する方法を見つけました。彼らは、数十ステップを経て洗練させるのではなく、一瞬で同じ高品質で多角的なアクションプランを生み出す新しいシステムを開発しました。彼らの研究では、ロボットの学習方法を変更することで、この遅い洗練プロセスを完全にスキップするように教え込むことができることを示しました。間違いを犯した後に修正する方法を学ぶのではなく、最初から正解を出す方法を学ぶのです。

この画期的な成果の核心は、ロボットがどのように例から学ぶかにあります。高品質なアクションを生み出す従来の手法は、「反復的なデノイジング(除去)」と呼ばれるプロセスに依存することがよくあります。ロボットがカップを拾う最善の方法を見つけようとしている場面を想像してみてください。古いシステムでは、完全にランダムな手の位置から始まり、カップに近づけるように少しずつ手繰り寄せ、その結果を確認し、再び少し動かし、完璧な位置に来るまでこのサイクルを何度も繰り返します。これによりロボットは良い解決策を見つけることができますが、時間がかかります。新しいアプローチである「ドリフトベース・ポリシー」は、この論理を逆転させます。実行時のアクション中に答えを洗練させるのではなく、トレーニング中に洗練プロセス全体を内部化するように学習します。トレーニング中、システムは成功した動きの例を多く提示され、ランダムな推測がどのように正しい方向へと「ドリフト(漂流)」していくのかを予測するように教え込まれます。ロボットはこれらの修正を自身の内部設定へと吸収することを学び、最終的に展開されるときには、それらの遅い増分ステップを踏む必要がなくなります。単に、最終的な修正済みの動作を即座に出力するのです。

このアイデアが機能することを証明するために、研究者たちは幅広い課題を用いてシステムをテストしました。まず、ブロックを押す、物体を持ち上げる、道具を操作するといった12種類の標準的なシミュレーションタスクを用いました。古い多ステップのシステムでは、一つの動きを決めるためにコンピュータがネットワークを100回実行する必要がありました。新しいシステムは、同じ仕事をわずか1回の実行で行いました。その結果、このシステムは100倍速いだけでなく、全体的な成功率もわずかに高く、遅い手法の79パーセントに対して83パーセントの平均成功率を達成しました。これは、速度が品質を犠牲にしないことを示しており、ロボットは同様に優れた成果を出しつつ、はるかに効率的であったのです。

研究者たちはさらに、ロボットが平坦な画像ではなく「点の雲(ポイントクラウド)」として世界を見る、より複雑な3次元環境を扱えるかどうかを確認するために、システムをさらに発展させました。彼らは、単純な物体の操作から、ハンマーを使ったりドアノブを回したりといった困難な器用さを要するタスクまで、37種類の異なるタスクでテストを行いました。これらのテストにおいて、新しいシステムは、単一ステップの速度を目的とした既存の主要な手法を再び上回りました。88.4パーセントの平均成功率を達成し、次に優れたワンステップ・システムを大幅に引き離しました。これは、この手法が、これまでこのような困難な作業には遅い多ステップの洗練が必要だと考えられていたにもかかわらず、現実世界の3Dビジョンの複雑さを扱うのに十分な堅牢性を持っていることを示しました。

しかし、人間のデモンストレーションを模倣するのが得意なロボットが、必ずしも新しい問題を解決したり、ミスから回復したりするのが得意であるとは限りません。これに対処するため、研究者たちはフレームワークに第2段階を追加し、オンライン強化学習を通じてロボットが学習できるようにしました。これは、単に古いビデオをコピーするのではなく、環境と相互作用し、成功に対するフィードバックを受け取ることで、パフォーマンスを向上させるプロセスです。ここでの課題は、標準的な学習アルゴリズムは通常、あらゆる可能なアクションの確率を計算する必要があるため、これらのような高速なシングルステップ生成器にとっては困難であることでした。チームは、ロボットが高速なシングルステップの性質を維持したまま、経験から学習できる特別なインターフェースを作成することで、この問題を解決しました。彼らは、このアプローチによって、人間によるデモンストレーションのみで訓練されたタスクにおいても、ロボットが効果的にスキルを微調整できることを見出しました。

最終テストとして、システムをコンピュータ・シミュレーションから現実の研究所の物理的なロボットへと移行させました。彼らは、人間と同様に2本の腕を持つデュアルアーム・ロボットにシステムを搭載し、ブロックを持ち上げる、缶を運ぶ、物体を両腕の間で移動させるといったタスクを実行させました。ロボットは、人間の介入なしに、カメラからの視覚情報にリアルタイムで反応しなければなりません。システムは、世界を見てから腕を動かすまでの平均遅延わずか9.5ミリ秒で作動し、高周波制御が可能な速度を実現しました。一連の試行において、ロボットは150回の試行のうち123回を成功させ、成功率は82パーセントでした。比較として、従来の最良のワンステップ・システムは、150回のうち89回、つまり59パーセントしか成功しませんでした。発生した失敗は、主に物体が滑った、あるいは両腕が衝突したといった物理的な問題によるものであり、意思決定システム自体の失敗ではありませんでした。

この研究は、ロボット制御におけるスピードと知能のトレードオフが、かつて考えられていたほど固定的なものではないことを示唆しています。洗練の負担を、アクションの瞬間から学習の時点へと移すことで、高度な能力と驚異的な速度を兼ね備えたロボットコントローラーを作ることが可能です。研究者たちは、ロボットが良い決定を下すために、ステップバイステップで選択肢を考えて時間をかける必要はないこと、即座に正しい決定を下すことを学べることを示しました。これは、ロボットが人間の反射神経の速さで動作し、私たちの世界の複雑で予測不可能な環境に対して、リアルタイムで学習し適応していく扉を開くものです。この新しいシステムのコードは他の研究者にも公開されており、コミュニティがこの高速な生成的制御の基盤の上にさらなる発展を築けるようになっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →