← 最新の論文
🤖 AI

UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning

UniJEPA は、指示動画の大規模な事前学習を活用して連続表現と離散表現を統合的に学習する統一ロボットポリシーフレームワークであり、既存の視覚言語モデルや生成アプローチと比較して、シミュレーション環境および実世界の分布外タスクの両方において優れた性能を発揮します。

原著者: Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

公開日 2026-05-14
📖 1 分で読めます☕ さくっと読める

原著者: Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがロボットに家事を教えることを想像してみてください。この論文は、これらのロボットをより賢く、柔軟にし、これまで見たことのない状況にも対処できるようにするための新しい手法「UniJEPA(Unified Joint Embedding Prediction and Action:統合的結合埋め込み予測と行動)」を紹介しています。

以下に、簡単なアナロジーを用いた仕組みの解説を示します。

課題:「二つの頭」を持つロボット

現在、ロボットの頭脳は通常、2 つの派閥に分かれており、どちらも弱点を持っています。

  1. 「話者」(視覚言語モデル): これらのロボットは言語や画像の理解に優れています。「赤いカップを持って」と言われれば、カップが何か、そして「赤」が何を意味するかを理解します。しかし、物理的な予測が苦手です。カップを強く掴んだらどう揺れるか、テーブルの上をどう転がるかを直感的に理解していません。
  2. 「予測者」(生成モデル): これらのロボットは次に何が起こるかを推測するのが得意です。ボールが転がっているのを見れば、1 秒後にどこにいるかを予測できます。しかし、「常識」や言語理解が欠如していることが多いです。どのように動くかは知っていても、なぜ動いているのか、あるいは人間に何を頼まれたのかを理解していない可能性があります。

ほとんどのロボットは、どちらか一方を使用するか、あるいは両者の長所を失うような方法で無理やり組み合わせようとしています。

解決策:「バイリンガルの夢見る者」(UniJEPA)

UniJEPA は、2 つの言語を話し2 つの形で夢を見ることを同時に学ぶようなロボットです。これは「話者」と「予測者」を 1 つの頭脳に統合したものです。

車を運転することを学ぶ学生に例えてみましょう。

  • 離散学習(「話者」): これは交通規則や語彙を学ぶことに相当します。「一時停止標識は止まることを意味する」「緑は進むことを意味する」などです。ロボットは複雑な指示を理解し、言葉を使って自分が何を見ているかを説明することを学びます。
  • 連続学習(「夢見る者」): これは車の「感覚」を学ぶことに相当します。規則だけでなく、動きの滑らかな流れを予測することです。ハンドルを少し切ると、車はどのように横滑りするか?UniJEPA は、ぼやけた動画としてではなく、次に何が起こるかの高位の「感覚」や地図として、未来の視覚シーンを予測することを学びます。

訓練方法(2 段階のプロセス)

第 1 段階:「図書館と映画館」フェーズ(事前学習)
ロボットが実際に物体に触れる前に、膨大な量のデータを「読み」、「見る」ことを許可します。

  • 彼らはロボットに、人間やロボットがタスク(引き出しを開ける、おもちゃを拾うなど)を行っている100 万本以上の動画を与えました。
  • トリック: 彼らはロボットに同時に 2 つのことを行わせました。
    1. 質問に答える: 「ロボットは何をしているか?」(これにより言語と理解が鋭くなります)。
    2. 未来を予測する: 「ロボットが腕をこのように動かしたら、1 秒後の画像はどう見えるか?」(これにより物理と運動の理解が鋭くなります)。
  • 両方を行うことで、ロボットは言葉と物理的な動きが完璧にリンクしたメンタルモデルを構築します。

第 2 段階:「運転学校」フェーズ(微調整)
ロボットが一般的な知識を得た後、彼らはロボットが自らの身体を動かす方法を具体的に教えます。

  • 実際のロボットアームやハンドからのデータを見せます。
  • ロボットは、その「夢」(未来の予測)と「理解」(言語指示)を直接行動トークン(モーターを動かす具体的なコマンド)に変換することを学びます。
  • 衝突することなく実際の腕を動かすための複雑な数学処理を処理するために、特別な「専門家」システム(専門家チームのようなもの)を使用します。

結果:なぜ優れているのか

この論文は、このロボットを 2 つの方法でテストしました。

  1. ビデオゲーム内(シミュレーション): 彼らは、特定の物体を特定の方法で動かすなど、これまで見たことのないタスクを与えました。UniJEPA は、他のすべてのトップロボットを大幅に上回る成績(約 9〜12% 優位)で打ち破りました。
  2. 現実世界: 彼らはそれを実際のロボットアームと、精巧な 12 本指のロボットハンドに搭載しました。
    • 魔法: 彼らがロボットにこれまで見たことのない全く新しい物体(例えば、見たことのないおもちゃや奇妙な色)のタスクを与えたとき、UniJEPA は混乱しませんでした。特定の画像を単に暗記するのではなく、「把持」や「移動」という概念を学んでいたため、競合他社よりもはるかに優れた方法で、これらの「分布外(奇妙な)」状況に対処することができました。

結論

UniJEPA は、単に指示を暗記するだけ、あるいは物理を推測するだけのロボット頭脳ではありません。それは言語を通じて世界を理解すると同時に、運動を通じて未来をシミュレートすることを学びます。この二重のアプローチにより、それは「汎用性」を持つことができます。つまり、毎回ゼロから再学習する必要なく、新しいタスクや新しい物体に適応できるロボットです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →