← 最新の論文
💻 computer science

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

Drive-JEPAは、予測的表現学習のためのVideo Joint-Embedding Predictive Architecture (V-JEPA) と、単一の軌道による教師あり学習の限界を克服するためにマルチモーダルなシミュレータ生成軌道を蒸留するプロポーザル中心のプランナーを統合することにより、エンドツーエンドの自動運転における新たな最先端を確立します。

原著者: Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

公開日 2026-07-03
📖 1 分で読めます☕ さくっと読める

原著者: Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

自動運転車に対して、単に人間が運転するいくつかの例を見せるだけでなく、膨大な量の運転動画ライブラリを学習させ、さらに高度なビデオゲーム・シミュレーターの中で練習させる方法を想像してみてください。それが、まさにDrive-JEPAが行っていることです。

以下に、この新しいシステムの仕組みを、簡単な比喩を用いて解説します。

1. 問題点:「一本道」の罠

現在の多くの自動運転車は、人間の運転を観察することで学習しています。しかし、そこには落とし穴があります。例えば(黄色信号に近づいている時など)特定の状況において、人間は通常、ただ一つの具体的な行動しかとりません。しかし現実の世界では、その状況を処理するための安全な方法は他にもたくさんあります(例:緩やかに減速することもあれば、完全に停止することもあります)。

もし車がそのたった一つの人間の経路だけを学習してしまうと、「これ以外に道はない」と思い込んでしまいます。その結果、動きが硬直化し、他の安全で快適な選択肢を見逃してしまう可能性があります。これは**モード崩壊(mode collapse)**と呼ばれ、車が「問題解決には複数の方法がある」ということを忘れてしまう現象です。

2. 解決策:Drive-JEPA

研究者たちは、時間を操るマスターな運転指導員とビデオゲーム機を備えたような、3つのパーツからなるシステムを構築しました。

パーツA:「映画通」の事前学習(V-JEPA)

特定の曲がり方などを丸暗記する代わりに、車はまず数千時間の生の運転動画を視聴します。

  • 比喩: まだ何をすべきか教えられていないけれど、何千時間もの運転映画を見ている学生を想像してください。彼らは運転の「文法」を学びます。つまり、車がどのように動き、交通の流れがどうあり、世界が時間の経過とともにどう変化するかを学ぶのです。
  • 技術: 彼らはV-JEPAと呼ばれる手法を使用しています。これは、動画の「穴埋め問題」のようなものです。コンピュータは動画の一部を隠し、次に何が起こるかをAIに予測させます。これを何百万回も繰り返すことで、AIは個々の物体にラベルを貼ることなく、運転の世界がどのように機能しているかという、深く直感的な理解を構築します。これにより、ステアリングを学び始める前に、車は強力な「脳」を持つことができるのです。

パーツB:「シミュレーター・コーチ」(マルチモーダル・トラジェトリー蒸留)

AIが「脳」を手に入れたら、次は意思決定を学ぶ必要があります。通常、AIは人間が通った一つの経路しか目にしません。Drive-JEPAは、シミュレーター・コーチを導入することで、このゲームのルールを変えます。

  • 比喩: 運転の生徒がビデオゲームで練習しているところを想像してください。ゲームは、何千もの異なる「もしも」のシナリオを生成できます。あるバージョンでは車が左に回避し、別のバージョンでは急ブレーキを踏み、また別のバージョンでは渋滞の中を縫うように走るかもしれません。これらはすべて安全で合法的な動きです。
  • 技術: システムは、ルールベースのシミュレーターを使用して、あらゆるシーンに対して多くの異なる安全な経路(トラジェトリー)を生成します。そして、人間が取った単一の経路だけでなく、これらすべての異なる選択肢を認識し、価値を置くようにAIを教育します。これは**マルチモーダル・トラジェトリー蒸留(Multimodal Trajectory Distillation)**と呼ばれます。これはAIに対して、「正解は一つではない。この交差点には5つの異なる安全な対処法があるのだ」と教えているようなものです。

パーツC:「滑らかさフィルター」(モメンタム・アウェア・セレクション)

これで、AIには選ぶべき多くの経路が揃いました。では、どうやって最善のパスを選ぶのでしょうか?

  • 比喩: あなたが廊下を歩いているところを想像してください。もし突然、体が左へ、右へ、また左へと激しく揺れたら、気分が悪くなってしまいますよね。あなたはスムーズに動きたいはずです。
  • 技術: システムには、**モメンタム・アウェア・セレクション(Momentum-Aware Selection)**モジュールが含まれています。これは、車が直前の瞬間にどのような経路を通ったかを確認し、新しい選択肢をチェックします。もし選択肢が急激で、ガクガクとした方向の変化を必要とする場合、システムはその経路にペナルティを与えます。安全であるだけでなく、乗客にとってスムーズで自然に感じられる経路を選択するのです。これにより、「ぎこちない」運転を回避します。

結果

このシステムを標準的な運転ベンチマーク(NAVSIMやBench2Driveなど)でテストしたところ、結果は驚くべきものでした。

  • より賢い意思決定: 従来の最先端の手法を上回り、安全性と滑らかさにおいて新記録を樹立しました。
  • 「少ないことは、より豊かなこと」: すべての高度な「知覚」センサー(LiDARなど)を取り除き、フロント向きのカメラ一台だけに絞った場合でも、システムは他よりも優れた性能を発揮しました。これは、「映画通」による事前学習が、車に非常に強力な基礎を与えたことを証明しています。
  • よりスムーズな乗り心地: モメンタム・フィルターを使用することで、車はより快適に走行し、突然の激しい動きを避けることができます。

まとめ

Drive-JEPAは、自動運転車の生徒に対し、数千本の映画を見ることで運転理論の博士号を与え、あらゆる可能な安全な結末が見られるビデオゲームの中で練習させ、そして最もスムーズで快適な経路を選ぶ方法を教えるようなものです。その結果、地図上の一本の線をただコピーするロボットではなく、交通の流れを理解する熟練した人間のドライバーのように運転できる車が誕生しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →