← 最新の論文
💻 computer science

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

本論文は、幾何学的事前知識と潜在変数正則化を活用することで、実世界の屋外ロボットデータからより転移可能で堅牢な表現を学習する、深さ正則化されたJEPA世界モデルを導入し、推論オーバーヘッドを増やすことなく、ビジュアルオドメトリ、サプライズ検知、および多段階予測においてベースラインを大幅に上回る性能を実現している。

原著者: Usman M. Khan

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Usman M. Khan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに、畑の中でトラクターを運転する方法を教えているところを想像してみてください。そのロボットにはカメラが付いていますが、その世界は混沌としています。太陽の眩しい光、伸び縮みする影、風に揺れる葉、そして角を曲がるたびに変化して見える地面。もしあなたが、ロボットにすべての画像の全ピクセルを暗記するように求めたら、ロボットは圧倒され、混乱してしまうでしょう。代わりに、科学者たちはロボットに「世界モデル(World Models)」を教えようとしています。世界モデルとは、ロボットの内部にある「白昼夢」のようなものです。絵全体を書き直そうとするのではなく、簡略化され、抽象化された方法で、次に何が起こるかを予測することを学ぶのです。それは、盤上のすべてのマスの正確な色を暗記するのではなく、駒がどのように動き、ゲームがどのように展開するかという「ルール」を理解しているチェスプレイヤーのようなものです。

この論文が焦点を当てている特定の種類の「白昼夢」は、JEPA(Joint Embedding Predictive Architecture)と呼ばれるものです。想像してみてください。ある学生が、前の文章に基づいて物語の次の文章を推測するテストを受けているとします。ただし、文章全体を書くことは許されず、次の部分の「雰囲気(バイブス)」や「本質」だけを推測しなければなりません。これは素晴らしいことです。なぜなら、退屈な詳細(フォントの色など)を無視して、重要なこと(プロット)に集中できるからです。しかし、これらのロボットが実際の屋外ビデオから学習しようとすると、彼らの内部的な「雰囲気」の推測は、現実の世界があまりにも混沌としているため、しばれて崩れたり、無意味なものへと崩壊したりすることがよくあります。ここで大きな疑問が生じます。どうすれば、超複雑な脳によって処理を遅らせることなく、ロボットに現実世界の「物理学」、例えば物体が3D空間内でどのように配置されているかといったことを教えることができるのでしょうか?

この論文は、この問題を解決するための巧妙なトリックを紹介しています。研究者たちは、コンパクトなロボットの脳(1800万パラメータを持つLeWorldModelというモデル)を取り出し、特別な「訓練専用」の家庭教師として「深度情報(デプス)」を与えました。あなたが風景を描く練習をしていると想像してください。あなたには普通の写真(RGB)がありますが、同時に、木や岩がどれくらい離れているかを正確に示す3Dマップ(深度)もあります。研究者たちは、ロボットが学習している間、写真と3Dマップの両方を見るように指示しました。そして、「君の次のシーンに対する推測は、マップに見える3D構造と一致しなければならない」と伝えました。しかし、ここからが魔法です。ロボットが宿題を終えたとき、彼らは3Dマップを取り上げました。ロボットが実世界の仕事に出るとき、彼らは以前と同じようにカメラの写真のみを使用します。しかし、3Dマップと共に学習したおかげで、ロボットの内部的な世界の理解は、より鮮明になり、現実に基づいたものになったのです。

結果は、この単純なトリックが驚くべき効果を発揮することを示しました。深度を訓練時のみ使用することで、ロボットの内部的な「白昼夢」は、世界の動きを理解する上で非常に優れたものになりました。研究者がテストを行った際、ロボットの自己移動能力(ビジュアル・オドメトリ)は33%向上し、より正確になりました。また、ロボットは「奇妙なこと」を見つける能力も大幅に向上しました。もし突然、ロボットを別の場所にテレポートさせたり、ビデオを逆再生したりした場合、以前よりもはるかに大きく明確に、ロボットの内部アラームが鳴り響きました。驚くべきことに、これはロボットが照明や影の急激な変化といった、厳密には3Dではない事象を理解することにも役立ちました。これは、世界の形状を理解することが、他のあらゆることを理解するための助けになることを示唆しています。

また、この「深度訓練された」ロボットは、全く新しい環境(異なるロボット、異なる畑)に移動した際にも、非常に柔軟であることがわかりました。標準的なロボットは、新しい場所で予測の正確さを維持するのに苦労しましたが、深度訓練されたロボットは冷静さを保ち、その予測はより長い時間、正確に維持されました。研究者たちは、ロボットの学習を世界の物理的な幾何学に根ざさせることで、より堅牢で転用可能な脳を作り出したのだと考えています。それは、子供にバランス・ビームのそばにある滑らかで標識のあるトラックで自転車の乗り方を教えるようなものです。一度バランスを習得すれば、ビームがなくても、どんなデコボコした道でも走ることができるようになります。このアプローチは、実際に作業を行う際に高価なセンサーやスーパーコンピュータを必要とせずに、小さく効率的なロボットの脳をより賢く、適応力のあるものにするための実用的な方法を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →