← 最新の論文
💻 computer science

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAMは、従来の再構成重視のアプローチと比較して、優れた指示追従性とクローズドループのロボット操作性能を可能にする、整列された意味的潜在空間を学習するための新しい視覚・行動トークナイザーを活用した表現中心の世界アクションモデルを導入する。

原著者: Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

公開日 2026-06-16
📖 1 分で読めます☕ さくっと読める

原著者: Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに果物を拾ったり引き出しを開けたりといった家事のやり方を教えていると想像してください。これを行うために、ロボットには、見たものを理解し、次にどのような動きをすべきかを判断できる「脳」が必要です。この論文では、RepWAMと呼ばれる新しい種類の脳を紹介しています。

以下は、日常的な例えを用いた、その仕組みの簡単な解説です。

問題点:「ピクセル・パーフェクト」と「意味」の間のギャップ

現在の多くのロボットの脳は、ビデオ生成AI(偽の動画を作るAIのようなもの)の上に構築されています。これらの生成器は、**ピクセルの完璧さ(pixel perfection)**に執着しています。

  • 従来の方法: 例えば、車の写真を見つめることで運転を学ぼうとしている学生を想像してください。彼らは塗装の正確な色、道の質感、そして影を暗記しようとします。しかし、実際にハンドルを握ったとき、彼らはステアリングがどのように車を動かすのか、あるいはなぜ車が動くのかという仕組みを理解していません。彼らは世界の「見た目」に囚われており、「論理」に到達していないのです。
  • 問題点: 既存のロボットモデルは、将来の予測を行う際に、すべてのピクセルがどのように見えるかを正確に推測しようとします。これは詳細すぎて、重要なことを見落としてしまいます。*「どの物体が動いているのか? 引き出しは開いているのか? 果物は拾われているのか?」*といったことです。

解決策: 「意味的(セマンティック)」な翻訳機

著者らは、RepWAMを作成しました。これは、**視覚的・行動的トークナイザー(Visual-Action Tokenizer)**と呼ばれる特別な翻訳機を使用しています。これは、ロボットの生のカメラ映像を、「ピクセル」ではなく「意味」の言語へと変換する翻訳機のようなものです。

  1. 視覚的翻訳機(「何が」の部分):
    単に画像をコピーするのではなく、このシステムはビデオを見て、「ここでのメインストーリーは何だろうか?」と問いかけます。そして、ビデオを**セマンティック・トークン(意味的トークン)**へと圧縮します。

    • 例え: 猫の写真を、毛の一本一本の色を列挙して説明するのではなく、「マットの上に座っている猫。左を向いている」と表現するようなものです。重要なアイデンティティや関係性は保持しつつ、不要なノイズを削ぎ落とします。
  2. 行動的翻訳器(「どのように」の部分):
    ここが巧妙な点です。このシステムは単に「見る」ことを学ぶのではなく、「変化」を見ることを学びます。これは**潜在的行動トークン(Latent Action Tokens)**を作成します。

    • 例え: ページをめくるパラパラ漫画を想像してください。従来の方法は、すべてのフレームを完璧に描こうとしました。しかし、RepWAMは、ページ1をページ2へと変える「矢印」を学習します。「引き出しを押す」という動作が、「閉まっている状態」から「開いている状態」へと状態を遷移させる特定の*移行(トランジション)*であることを学習するのです。彼らは、アクションを、二つの意味のある画像をつなぐ架け橋として扱います。

これらがどのように連携するか

RepWAMは、これら二つの翻訳機を一つの部屋に入れます。

  • 学習: ロボットはビデオを観察し、「もしこれ(意味のある画像)が見えて、これ(意味のあるアクション)を行えば、次の画像はあのようになる」という予測を学習します。
  • 結果: ロボットが「ピクセルや色」ではなく、「物体と動き」の観点で思考するため、ロボットは「果物を拾って」や「引き出しを押して」といった指示に従うのが非常に上手くなります。

結果:うまくいくのか?

著者らは、実物のロボットとシミュレーションを用いてテストを行いました。

  • 現実世界: デュアルアーム・ロボットにおいて、RepWAMは従来のモデルよりもはるかに上手く、果物のピックアップ、引き出しのプッシュ、チューブのラックへの挿入を行うことができました。
  • シミュレーション: 複雑なビデオゲームのようなシミュレーション(RoboTwin 2.0)において、膨大なビデオデータセットで事前学習されたモデルをも上回る高いスコアを記録しました。
  • 鍵となる発見: この論文は、優れたロボットになるために、正確なピクセルを暗記する必要はないということを示しています。必要なのは、シーンの**「意味的なストーリー」**を理解することです。ロボットが見ているものと、その「意味のある空間」で行う行動を一致させることで、ロボットはより信頼性の高いものになります。

まとめ

従来のロボットモデルは、シーンの仕組みを理解するために、絵画の筆致を一点一点模写しようとする芸術家のようでした。RepWAMは、プロット(筋書き)、登場人物、そしてアクションを理解している映画監督のようなものです。動きの「テクスチャ(質感)」ではなく、動きの「ストーリー」に焦点を当てることで、ロボットはより知的に行動し、指示をより正確に実行できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →