CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving
CLEARは、異種混合のシミュレーションパイプラインを用いて、学習済みVision-Language-Actionモデルの上に残差ウェイポイント方策を学習させることで、従来の模倣学習における分布シフトの限界を克服し、困難なベンチマークにおいて最先端の性能を達成する、エンドツーエンドの自律走行のためのスケーラブルなクローズドループ強化学習フレームワークを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
自動運転車を教える場面を想像してみてください。長い間、その最善の方法は**模倣学習(Imitation Learning)**でした。これは、完璧なエキスパートが運転する車の後部座席に、生徒のドライバーが座っているようなものです。生徒はエキスパートの動きをただコピーします。エキスパートが左に曲がれば、生徒も左に曲がります。
問題は何でしょうか?これは「クローズド・ブック(教科書通り)」のテストでしか通用しません。もし生徒がエキスパートが見せてくれなかった状況に遭遇したり、あるいは生徒自身が小さなミスをしたりすると、混乱してしまいます。現実世界(あるいは複雑なシミュレーション)では、一つの小さなミスが衝突につながることがあります。生徒は単に「コピーすること」を教えられただけで、「考える」ことや「適応する」ことを教わっていないため、どのようにリカバリーすべきかを知らないのです。
近年、研究者たちはVLA(Vision-Language-Action:視覚・言語・行動)モデルを使用し始めました。これらは、道路を「見て」、交通標識を「読み」、運転コマンドを「話す」ことができる、非常にスマートな運転インストラクターのようなものです。しかし、これらの賢いインストラクターでさえ、主に「エキスパートをコピーする」方法で訓練されていたため、事態が悪化した際に脆弱であるという課題が残っていました。
そこで、CLEARが登場しました。
大きなアイデア: 「残差(Residual)」コーチ
著者らは、この問題を解決するためにCLEARと呼ばれるシステムを構築しました。単にコピーするのではなく、AIに「訓練生」を修正する**「コーチ」**になってもらうよう教えたのです。
- 事前学習済みの「訓練生」: まず、非常にスマートなVLAモデル(訓練生)を取り上げ、膨大なエキスパートの運転データを用いて基礎を教えます。この訓練生は、「500フィート先で左折です」と告げるGPSのように、一般的な経路を予測することには長けています。
- 「コーチ」(強化学習/RL): 次に、**強化学習(RL)**を導入します。訓練生の隣にコーチが立っているところを想像してください。訓練生が予測(「ベースとなる経路」)を出したとき、コーチは「いや、あの水たまりを避けるために、もう少しだけ左に曲がって」と指示を出します。
- AIはゼロから運転を学び直すわけではありません(それには膨大な計算資源が必要だからです)。
- 代わりに、AIは**残差ポリシー(residual policy)**を学習します。これは、優れた計画と完璧な計画の「差」を学ぶようなものです。AIは、訓練生のミスを修正するために必要な、わずかな「修正」だけを学習します。
「ヘテロジニアス・パイプライン」: 交通渋滞を解決する
これらのAIコーチを訓練するには、膨大なデータが必要です。AIに教え込むために、何百万回もの運転シミュレーションを実行する必要があります。
ここでボトルネックが発生します:
- シミュレーター(道路): 現実的な運転シミュレーター(CARLAなど)を実行するには、高度なコンピュータグラフィックスの負荷がかかります。それは、ハイエンドのビデオゲームを動かしているようなものです。
- 学習者(脳): AIモデル自体も巨大であり、思考するために強力なグラフィックスカード(GPU)を必要とします。
もし、同じコンピュータ上でシミュレーターと「脳」の両方を動かそうとすると、それらはグラフィックスカードを奪い合います。それは、狭いジムの中で、マラソンと重量挙げの大会を同時に開催しようとするようなもので、すべてが遅延するか、クラッシュしてしまいます。
CLEARの解決策: 彼らは**ヘテロジニアス・パイプライン(異種混合パイプライン)**を構築しました。
- **シミュレーター(道路)**を、一連の古くて安価なコンピュータ上に配置しました。
- **AIの脳(学習者)**を、別の超強力なコンピュータ・クラスター上に配置しました。
- そして、それらをデジタルなトンネル(SSH)で接続しました。
これは、リモートにあるレース場(シミュレーター)の群れが、中央の本部(脳)にデータを送っているような状態です。レース場側は豪華である必要はなく、ただ動作していればよいのです。脳は、グラフィックスの描画によって速度を落とされることなく、必要なすべてのデータを受け取ることができます。これにより、64個のシミュレーションを同時に実行し、1億個のサンプルで学習することが可能になりました。
結果: 「失敗」から「勝利」へ
このシステムは、いくつかの非常に困難な運転チャレンジ(「longest6」や「Bench2Drive」などのベンチマーク)でテストされました。
- CLEAR以前: 従来のメソッドは、たとえスマートなものであっても、これらの難しいルートではほぼ100%失敗していました。小さなミスから回復できず、衝突したり立ち往生したりしてしまうからです。
- CLEAR導入後: システムは自らのミスを修正することを学びました。単に台本に従うのではなく、障害物を回避し、複雑な交通状況を処理することを学んだのです。
- あるベンチマークでは、成功率が0%(完全な失敗)から**25%**へと跳ね上がりました。
ের - 別のベンチマークでは、運転の効率性と安全性において歴代最高スコアを記録し、これまでのあらゆる手法を打ち破りました。
- あるベンチマークでは、成功率が0%(完全な失敗)から**25%**へと跳ね上がりました。
まとめ
CLEARを、スマートだが融通の利かないドライバーに、少しでもコースを外れそうになったら正しい方向へ押し戻すための超スマートなコーチを与え、さらにコンピュータがクラッシュすることなく何百万マイルもの練習ができるよう、大規模で分散型のトレーニング施設を構築したものだと考えてください。その結果、現実世界の混沌とした予測不可能な道路状況をより巧みに扱うことができる、大幅に優れた自動運転システムが実現したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。