← 最新の論文
💻 computer science

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Discrete-WAMは、世界のダイナミクスと意思決定ポリシーを共有された離散拡散プロセスを通じて共同でモデリングすることにより、視覚トークンとアクショントークンを整合させ、自動運転のための構成的な因果推論、制御可能な生成、および反事実的プランニングを可能にする統一された離散潜在フレームワークを導入する。

原著者: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

公開日 2026-06-05
📖 1 分で読めます☕ さくっと読める

原著者: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに車の運転を教えていると想像してみてください。現在の手法の多くは、完璧なドライバーの動画を見せて、「見たままを正確にコピーしなさい」と教えるようなものです。ロボットは動きを模倣することを学びますが、なぜドライバーがハンドルを切ったのか、あるいはその回転によって次に何が起こるのかという「理由」までは理解していません。それは単にパターンの暗記に過ぎないのです。

他の手法は、「世界モデル」――つまり未来の精神的なシミュレーション――を構築しようと試みます。しかし、これらはしばしば、ぼやけた連続的なデータの雲を使って天気を予測しようとするようなものです。データを「もし左に曲がれば、隣の車は右に動く」といった具体的で論理的なステップに分解するのは困難です。

Discrete-WAM(Xiaomiによる)は、これら両方の問題を解決しようとする新しいアプローチです。その仕組みを簡単に説明します。

1. 「レゴ」のアプローチ(離散トークン)

世界を滑らかでぼやけたビデオや複雑な数式として捉える代わりに、Discrete-WAMはすべてをレゴブロック(「離散トークン」と呼ばれます)へと分解します。

  • 視覚情報: カメラ画像のあらゆる部分が、特定のレゴブロックに変換されます。
  • アクション: 車が行うあらゆる動き(加速、旋回など)も、また特定のレゴブロックになります。
  • 魔法の仕組み: 画像とアクションの両方が同じ種類のレゴブロックで作られているため、AIはそれらを簡単に組み合わせることができます。AIは道路の画像を見つめ、「左に曲がる」というブロックを手に取り、それを画像にパチッとはめ込むことで、未来がどのようになるかを視覚化できるのです。

2. 「編集」ボタン(統合された生成)

このAIを、単に未来を予測するだけの機械ではなく、「検索と置換」ツールを備えた**エディター(編集者)**だと考えてください。

  • プロセス: AIは、未来の下書き(道路と車の経路のぼやけた推測)からスタートします。
  • 反復的な洗練: その後、作家が物語を推敲するように、この下書きを何度も何度も修正していきます。各ラウンドにおいて、AIは間違っている、あるいは不確かな部分にある「レゴブロック」を見つけ出し、より適切なものへと入れ替えていきます。
  • なぜ役立つのか: これにより、AIはさまざまな「もしも(what-if)」のシナリオを試すことができます。「ここで左に曲がったらどうなるか?」と問いかけ、即座に未来の画像を編集してその結果を表示させ、「もし右に曲がったら?」と問いかけ、それについても編集することができます。一度に一つの経路に決めてしまう必要はないのです。

3. 「船長と乗組員」(階層的プランニング)

この論文では、意思決定を2つの役割に分けるスマートな方法を紹介しています。

  • 船長(高レベルの意思決定): この部分は、AIに「車線を変更する」や「停止する」といった、大きく単純な選択をさせます。これは、船長が一般的な命令を叫ぶようなものです。
  • 乗組員(低レベルのアクション): 船長が命令を出した後、乗組員はその命令を実現するための、滑らかで詳細な動きを考え出します。彼らは具体的なステアリングや速度の調整を担当します。
  • メリット: これにより、AIが混乱するのを防ぎます。もしAIが一度にすべての微細な車輪の動きを解決しようとすれば、行き詰まってしまうかもしれません。「大きなアイデア」と「細かい詳細」を分離することで、安定性と安全性を保つのです。

4. 「安全シミュレーター」(反事実的推論)

AIは未来を非常に簡単に編集できるため、車のフライトシミュレーターのように機能します。

  • 車が通常通り走行するシミュレーションを実行し、それが安全かどうかを確認できます。
  • 次に、シミュレーションを「編集」して、「もし歩行者が飛び出してきたら?」「もしブレーキが遅すぎたら?」といった問いを投げかけることができます。
  • もしシミュレーションが衝突(AIが予想していなかった「驚き」)を示した場合、システムはその経路が危険であることを理解します。これにより、危険なシナリオを脳内で事前にテストすることで、事故を未然に防ぐことができます。

結果

このシステムは、膨大な実走行シナリオのデータセットを用いてテストされました。

  • パフォーマンス: 現在のトップシステムと同等、あるいはそれ以上の性能を発揮しました。
  • 安全性: 衝突回避や交通ルールの遵守において優れた結果を示しました。
  • 創造性: 単に見たものをコピーするだけの他のシステムとは異なり、このシステムは見たことがない新しい、かつ安全な走行経路を生成することができました。これは、AIが道路のルールを実際に理解していることの証明です。

要約すると: Discrete-WAMは、自律走行車に「レゴブロック」で考えることを教えています。これにより、ビデオエディターのように未来を編集し、大きな決定と細かな詳細を分離し、実際に動作を行う前にその動きが安全かどうかを確認するために、頭の中でシミュレーションを実行できるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →