Reinforcement Learning on Cost-Constrained Quadrupedal Hardware
本論文は、平均的な遅延のフォワードモデルと、堅牢で生物学的な着想を得た中枢パターン生成器を自律的に学習する時間認識型ニューラルネットワークを組み合わせることで、平均的な遅延のフォワードモデルを用いることにより、アクチュエータの遅延に起因する重大なシム・トゥ・リアル・ギャップを克服し、低コストの四足歩行ハードウェア上で強化学習を実装できることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
遠く離れた部屋から、非常に長く、もつれた電話線でつながれた状態で、叫び声で子犬に歩き方を教えようとしている場面を想像してみてください。あなたの声が子犬の耳に届く頃には、子犬はすでに自分の足に躓いています。そして、新しい叫び声に基づいて足運びを修正しようとする頃には、すでに再び転んでしまっています。これは「Sim-to-Real(シミュレーションから現実へ)」ロボティクスの日常的な苦闘であり、科学者たちが完璧で即時的なビデオゲームの世界でロボットに動きを教え、その後、乱雑で、遅く、ノイズの多い現実世界へと送り出す分野における問題です。
核心となる問題は、「レイテンシ(遅延)」、つまりコマンドと動作の間のタイムラグです。高価でハイテクなロボットでは、この遅延は極めて小さく、ほとんど目に見えないほどです。しかし、安価で手頃な価格のロボットでは、遅延は非常に大きくなることがあり、それはまるで動画の読み込みを待つ遅いインターネット接続のようです。この遅延が大きくなりすぎると、ロボットは「今」見えているものに対して反応するだけでなく、「次に何が起こるか」を予測しなければならなくなります。これにより、ロボットの脳はパズルへと変わります。つまり、足が「今」どこにあるのかを正確に知ることなく、単に「少し前」にどこにあったかだけを知りながら、どうやって歩くべきかを考え出さなければならないのです。大きな疑問は、この問題を解決するために高価で超高速なロボットを作る必要があるのか、それとも、安価なロボットにラグに対処できるほど賢くなるよう教えることができるのか、という点です。
この論文は、後者の選択肢を試みることに決めたチームの物語を伝えています。彼らは、モーターに76ミリ秒という膨大な遅延を抱えている、300ドルの非常に安価な4足歩行ロボット「Mini Pupper 2」を使用しました。ハードウェアを修理したり、ロボットの位置を予測するための複雑な数学的架け橋を構築したりする代わりに、彼らは自然にインスピレーションを求めました。彼らはこう問いかけました。「神経が遅いとき、動物はどうやって歩くのか?」と。その答えは脊髄の中にあります。脊髄は、脳の反応が遅れても脚を動かし続けるための、特別なリズム生成器を使用しているのです。
研究者たちは、この安価なロボットを制御するために、異なる種類の「脳」ネットワーク(ニューラルネットワーク)を訓練しました。彼らは、単純で標準的な「脳」(MLPと呼ばれます)では、複雑なルールを用いた何時間もの手動チューニングを行わない限り、無残に失敗することを発見しました。しかし、より高度な「時間認識型」の脳(LSTMと呼ばれます)は、自律的に魔法のような動きを見せました。それは、ロボットのセンサーからのノイズが多く遅延した信号を無視することを学習し、代わりに、脊椎動物の脊髄に見られる中枢パターン生成器(CPG)と全く同じように、独自の内部リズムを生み出したのです。
結果は驚くべきものでした。この自習されたリズムは非常に強力で、研究者が既存のラグに加えてさらに320ミリ秒の遅延を人工的に追加しても、ロボットは歩き続けることができました。単純なロボットの脳は崩壊して歩行が止まってしまった一方で、時間認識型の脳は安定した速歩を維持しました。この論文は、これが単なる幸運な偶然ではなく、一般的な戦略であることを示唆しています。ロボットに遅くてノイズの多いハードウェアに対処することを強いると、最も賢明な解決策は、現在に反応しようとするのをやめ、自ら未来を生み出し始めることなのです。
チームはまた、ロボットの実際のノイズの多いセンサーデータ(速度や負荷など)を使おうとすると、事態を悪化させることも発見しました。安価なセンサーは非常に信頼性が低いため、ロボットはそれらのセンサーが存在しないふりをして、内部のリズムに完全に依存したほうがうまく歩けるのです。彼らは二層構造のシステムを構築しました。長期的なタイミングを扱う「リズム保持者」(LSTM)と、壊れた現実世界のセンサーに代わって、脚がどこにあるべきかを推測する単純な「予測器」(小さなニューラルネットワーク)です。
結局のところ、この論文は、うまく歩くために1万ドルのロボットは必要ないということを証明しています。必要なのは、待ち方を知っている脳を持った、安価なロボットなのです。内部リズムを生み出すという生物学的なトリックを模倣することで、研究者たちはシミュレーションと現実世界の間の溝を埋め、時には、遅くてノイズの多い世界に対処する最善の方法は、それに耳を傾けるのをやめ、自分自身のビートに合わせて踊り始めることであるということを示しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。