End2Race: An End-to-End Learning Framework for Multi-Vehicle Autonomous Racing
本論文は、サブミリ秒の推論レイテンシを実現し、直接対決の競技において堅牢な汎化性能、高速走行、および適応的な追い越しを実証することで、既存のルールベースの手法や単一車両学習手法を凌駕する、複数車両による自律走行レースのためのエンドツーエンド学習フレームワークであるEnd2Raceを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
自動運転車の世界は、しばしば、車両が単に停止標識や歩行者を認識すればよいだけの、直線道路を静かに進む旅として想像されがちである。しかし、自律型システムの知性の真の試練は、レーストラックの混沌の中にこそある。ここでは、車両が高速で移動し、一瞬の遅れがクリーンな追い越しと衝突の差を生むような、動的な環境の中で絶えず互いに反応し合っている。高価な実車の車両を破壊するリスクを負わずに、このハイステークスな環境を研究するために、研究者たちは「F1Tenth」として知られるスケールダウンされたプラットフォームを使用している。これらは実車の10分の1のサイズであり、レーダーのように周囲をスキャンするセンサーを備え、秒速18メートルに迫る速度でトラックを走行することができる。課題は、ただ速く走ることではなく、いつ加速し、いつ減速し、どのようにして相手車両に触れることなくその脇をすり抜けるかという複雑な決定を下しながら、速く走ることである。
長年、これらのレース競技における最も成功した戦略は、硬直した、あらかじめプログラムされたルールに依存してきた。エンジニアはレースが始まる前にトラックのデジタルマップを作成し、車が辿るべき完璧なラインを計算する。これは既知のトラックではうまく機能するが、車が新しいレイアウトや、予想された経路に従わないライバルに遭遇した瞬間に失敗する。他の手法は、車が今見ているものに対して即座に反応しようとするが、スムーズな操縦を行うための先見性に欠けることが多く、挙動がぎこちなく不安定な走行につながる。第三のアプローチは、コンピュータがエキスパートを観察したり、試行錯誤を通じて学習したりする機械学習を用いるものである。しかし、これらの学習システムの大半は、単独走行する一台の車両に対してのみテストされているか、あるいはリアルタイムでの反応が遅すぎて、競争力のある速度で走行することができなかった。そこには空白が存在していた。すなわち、高速で走行しながら、別の車と対面でレースを行う方法を、コンピュータに教え込むことに成功した者は誰もいなかったのである。
この空白を埋めるために、研究チームは「End2Race」と呼ばれる新しいシステムを導入した。このフレームワークは、人間がどのように学ぶか(まずエキスパートを観察し、次に自律的に練習する)というプロセスを模倣した学習プロセスを用いて、自律走行車に他車両をリアルタイムで追い越す方法を教えるように設計されている。研究者たちは、エゴ・ビークル(自車)と呼ばれる車が対戦相手とペアになる仮想トレーニング場を構築した。彼らは、対戦相手が異なる経路や異なる速度で走行する720の明確なシナリオを作成し、学習する車がどのように隙を見つけ、そこに入り込み、安全にパスするかを判断できるようにした。このシステムは、あらかじめ描かれたトラックのマップには依存せず、代わりにセンサーからの生データと自車のエンジンの速度のみに基づいて走行することを学習する。
このシステムの核となるのは、パターンを認識するように設計された一種のコンピュータプログラムであるニューラルネットワークであり、これは驚異的な速さで作られている。自律走行の世界では、時間はミリ秒単位で測定され、わずか数分の一秒の遅延であっても、車がターンを逃したり衝突したりする原因となる。研究者たちは、レースの急速な変化に追いつけるほど十分に速い、1ミリ秒未満で意思決定を行うようにこのネットワークを設計した。このネットワークを訓練するために、彼らはまず「行動クローニング」と呼ばれる手法を用いた。これは、コンピュータが72 of 8秒間のエキスパートによるデモンストレーションを分析し、ステアリングと速度の基本を学習するというものである。しかし、単にエキスパートを模倣するだけでは不十分であった。なぜなら、エキスパートも時にはミスをしたり、動いている対戦相手の予測不可能な性質に適応できなかったりするからである。これを解決するために、チームはその後、強化学習と呼ばれる手法を用いて、コンピュータにこれらのシナリオを通じて500回の対戦を行わせた。このフェーズにおいて、車は前進が速い場合には報酬を与えられ、衝突した場合には罰を与えられることで、自らの戦略を洗練させ、エキスパートが遭遇したことのない状況に対処する方法を学んだ。
これらの訓練の結果は驚くべきものであった。見たことがないトラックでテストされた際、学習した車は平均秒速8.5メートル以上の速度で走行することができ、これは従来の学習ベースの手法(多くの場合、秒速3メートル未満の速度に制限されていた)よりも大幅に速かった。より重要なことに、対戦相手とのヘッド・トゥ・ヘッドのレースにおいて、この新システムは、約98パーセントの安全性(セーフティ・レコード)を維持しながら、試みの約97パーセントでライバルを追い越すことに成功した。このパフォーマンスは、頻繁に衝突するか、あるいは対戦相手を全く追い越せないかのどちらかであった古いルールベースのシステムや他の学習手法よりもはるかに優れていた。このシステムは、たとえ対戦相手が障害物を避けるために異なるアルゴリズムを使用しているような、コンピュータがこれまで見たことのない方法で走行していたとしても、異なる対戦相手に適応できる能力を証明した。
研究者たちはまた、車がどのように意思決定を行っているかを詳細に調査した。あるシナリオでは、車は前方の減速している対戦相手を見つけると、隙に合わせてスムーズにサイドへシフトし、その後、追い越すために加速する。別のシナリオでは、鋭いターンに入る前に制御を維持するためにわずかにブレーキをかけ、カーブを抜けた直後に激しく加速する。これはプロのレーサーが用いるテクニックを反映した操縦である。このシステムは完璧ではなかった。二台の車が並走している間にトラックが突然狭くなった場合、コンピュータはトラックの将来の形状を予測できないため、衝突が発生した。しかし、これらの失敗は他の手法よりもはるかに少なく、全体的なパフォーマンスは、車が堅牢で適応力のあるドライビングスタイルを学習したことを示した。
この研究は、自律走行レース、そしておそらく高速自律走行全般の未来は、静的なルールに頼るのではなく、経験から学ぶことができるシステムにあることを示唆している。高速で効率的なニューラルネットワークと二段階の訓練プロセスを組み合わせることで、研究者たちは、機械が以前は到達不可能であったレベルの速度と安全性をもって、複雑で動的な相互作用をナビゲートできることを示した。このシステムは、どこへ行くべきかを知るためのマップを必要としない。ただ世界を見、交通の流れを理解し、瞬きする間に反応すればよいのである。研究者がこのシステムを他のチームとの実世界の競技会でテストする準備を進める中で、その影響はレーストラックを超え、自律走行車がいかにしていつの日か、共有道路の予測不可能な混沌を自信とスキルを持って対処できるようになるかという展望を提示している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。