← 最新の論文
💻 computer science

Continual Domain Randomization

本論文は、シミュレーションパラメータのサブセットに対して強化学習の方策を順次学習させるためにドメインランダム化と継続学習を組み合わせる新たな手法である継続的ドメインランダム化(CDR)を提案し、これにより同時ランダム化の非最適性を克服し、ロボティクスタスクにおける堅牢なシミュレーションから実世界への転移を実現する。

原著者: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにコップを掴ませることを想像してみてください。これを実現する最も賢明な方法は、通常、まずコンピュータシミュレーション内でロボットに数百万回練習させることです。そうすれば、実機のロボットを壊したり、誰かを傷つけたりするのを防げるからです。しかし、ここに問題があります。コンピュータシミュレーションは、決して現実世界と「完全に」同じにはなり得ないのです。実際のロボットはわずかに重かったり、モーターが少し遅かったり、センサーが少し「ノイズ」を含んでいたりするかもしれません。この違いは「リアリティギャップ」と呼ばれます。完璧なシミュレーション内でロボットを訓練すると、そのシミュレーションの完璧さに依存して学習してしまうため、実際に現実世界に置くと惨めに失敗することがよくあります。

これを解決するために、科学者たちは「ドメインランダム化」というトリックを使います。シミュレーションを完璧にしようとする代わりに、あえてそれを乱します。ある実行ではロボットを重くし、次の実行では軽くし、偽のセンサーノイズを加えたり、制御を遅延させたりします。アイデアは、ロボットがこれらすべての「乱れた」バージョンに対処することを学べば、単に「乱れた」バージョンの一種に過ぎない現実世界に対処するのに十分な頑健性を持つようになる、というものです。

従来の方法の問題点
従来の方法は、まるで初めての日、強い流れ、大きな波、冷たい水がすべて同時にある嵐のような海に飛び込んで泳ぐことを学ぼうとするようなものです。難しすぎます!ロボットは圧倒され、混乱し、課題が難しすぎるために悪い戦略を学んでしまいます(あるいは全く何も学べません)。

新しい解決策:継続的ドメインランダム化(CDR)
この論文の著者たちは、継続的ドメインランダム化(CDR) と呼ばれる、より賢い学習方法を提案しています。車を運転することを学ぶことに例えてみましょう。

  1. 簡単から始める: まず、風も他の車もなく、タイヤも完璧な、空で完璧な駐車場での運転を学びます。基本を身につけます。
  2. 一度に一つの課題を追加する: それができるようになったら、突然ハリケーンの中に投げ込まれるわけではありません。代わりに、一つだけ 新しい課題を追加します。例えば、雨の中を運転します。雨をマスターしたら、風を追加します。風をマスターしたら、渋滞を追加します。
  3. すべてを記憶する: 難しい点は、雨の中での運転を学んでも、乾燥した舗装路での運転の仕方を忘れてはいけないということです。ここで「継続的学習」の部分が役立ちます。ロボットは、弾性重み統合(Elastic Weight Consolidation) という特別な記憶技術を使用します。これは「安全網」のように機能し、ロボットが新しいスキル(雨への対処など)を学ぶ際に、古いスキル(乾燥した舗装路での運転など)を「忘れる」ことを防ぎます。

どのようにテストしたか
研究者たちは、このアイデアを以下の 2 つのタスクでテストしました。

  • 到達: ロボットアームが特定の場所に触れようとするタスク。
  • 把持: ロボットアームが箱を見つけ、グリッパーを完璧に揃え、それを掴むという、より複雑なタスク。

彼らは、この「段階的」な方法(CDR)を、以下の 2 つのアプローチと比較しました。

  • 「完璧な」シミュレーター: 清潔で完璧な世界でのみ訓練する方法(現実では失敗する)。
  • 「混沌」シミュレーター: 雨、風、渋滞といったすべての問題を同時にロボットに投げつける方法。
  • 「忘却」方法: 問題を一つずつ追加するが、記憶の安全網を使用しない方法(そのためロボットは以前のステップを忘れる)。

結果
結果は印象的でした。

  • CDR で訓練されたロボットは、シミュレーション内で効果的に学習しました。
  • ロボットを現実世界に移したとき、そのパフォーマンスは「混沌」モードで訓練されたロボットと同等か、それ以上でした。
  • 決定的な点は、CDR がより安定していたことです。課題を追加する順序(まず雨か、まず風か)が変わっても、ロボットはよく学びました。一方、「忘却」方法は、課題の順序が変わると苦労しました。

要約すると
この論文は、ロボットを一度に無数のランダム変数の海に溺れさせるのではなく、一つずつ難易度を追加しながら、かつ以前の課題への対処法を忘れないように保証しつつ、段階的に教える方がよいことを示しています。これにより、訓練中に現実世界でテストする必要なく、乱雑で予測不可能な現実世界に備えたロボットが生まれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →