← 最新の論文
🤖 AI

PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

PACT-WAMは、階層的時系列エンコーディングと条件付きフローサンプリングを用いることで、16ステップの行動軌跡とそれに対応するマルチビュー視覚予測を効率的に予測し、ロボット操作タスクにおいて高い成功率を達成すると同時に、さらなる性能向上のための視覚言語ベースのプロポーザルレビューを可能にする、コンパクトなワールドアクションモデルである。

原著者: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

公開日 2026-09-17
📖 1 分で読めます☕ さくっと読める

原著者: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約: PACT-WAM

問題提起

ロボットの操作ポリシーには、動作の文脈や過去の相互作用を提供するための**履歴(history)と、状態の変化を予測し提案されたアクションを評価するための視覚的な先読み(visual foresight)**という、2つの形式の時間情報が必要である。World-Action Models (WAMs) は、履歴、アクション、および将来の観測を効果的に結びつけるが、重大な計算上のボトルネックに直面している。過去および将来の観測の密な表現は、多大な処理コストを発生させる。例えば、16フレームの履歴をそれぞれ64トークンでエンコードすると、1ビューあたり1,024トークンが必要となり、マルチステップの予測は別途、視覚的潜在変数シーケンスを追加することになる。既存の手法は、履歴を圧縮するか、別個のコントローラーを備えたモジュール式の視覚的先読みを使用するか、あるいは推論中に将来の生成を省略するかといった、これらの課題を個別に解決することが多い。核心となる課題は、履歴のカバー範囲を維持しつつ、各遷移において独立してデコード可能な状態を提供できるコンパクトな表現を設計すること、そして、過度な計算オーバーヘッドなしに、これらの予測を実行のガイドとして使用するためのプロトコルを確立することである。

手法: PACT-WAM

著者らは、条件付きフローサンプリングを通じて、16ステップのアクション・トラジェトリとその時間的に対応するマルチビューの視覚的予測を共同生成する世界・アクションモデルであるPACT-WAM(Predicting Actions and Visual Foresight with Compact Temporal Encoding)を提案する。このアーキテクチャは、以下の3つの主要な設計上の選択に基づいている。

1. 階層的履歴エンコーディング

一様なエンコーディングの代わりに、PACT-WAMは**新近性に基づく履歴割り当て(recency-based history allocation)**を採用している。これは、古い観測には粗い空間表現を、新しい観測には細かい表現を割り当てるものである。

  • メカニズム: 固定されたDINOv3 ViT-B/16バックボーンを使用し、モデルは16フレームの履歴を処理する。最も古い8フレームはビューあたり4トークンに圧縮され、中間の6フレームは16トークン、最新の2フレームは64トークンに圧縮される。
  • 効率性: これにより、16個の観測すべてをビューあたり256トークンのみで保持することができ、密なエンコーディング(1,024トークン)と比較して75%の削減を実現しながら、高い時間的カバー範囲を維持している。
  • 統合: これらの圧縮された特徴量はマージされ、タスク指示とともにQwen3-VL-4B言語モデルへと投影され、共有コンテキスト hth_t を形成する。

2. 共同アクション・ビジュアル・フロー生成

PACT-WAMは、連続的なアクションと視覚状態を共同で更新するために、**遷移ごとの因果的アテンション(transition-wise causal attention)**を備えた共有フロー・トランスフォーマーを利用する。

  • 視覚的潜在変数: 将来の画像は、時間的なダウンサンプリングを行わない連続的なTiTok-VAE潜在変数(画像あたり K=32K=32 の位置)によって表現される。これにより、すべてのステップのアクションが、独立してデコード可能な後続の視覚状態とペアになることが保証される。
  • 共有バックボーン: トランスフォーマーは、ノイズを含むアクションと視覚状態、フロータイム埋め込み、および固定されたコンテキストを受け取る。これは、ブロック jjjj 番目の遷移を表す)内のクエリが、すべての kjk \leq j のブロック内の全ポジションにアテンションを払えるようなブロック因果的マスクを使用する。
  • デュアルヘッド: 2つのモダリティ固有の速度ヘッド(アクション用の gag_a と視覚用の gvg_v)が、正規化された空間における速度を予測する。これらのモダリティは、許可された時間的プレフィックス内のノイズを含む状態への共有依存関係を通じて、サンプリング中に情報を交換する。
  • 学習: モデルは、条件付きフローマッチングと線形パス速度回帰目的関数を用いて学習される。これにより、DINOv3およびTiTok-VAEのエンコーダ/デコーダを凍結したまま、圧縮ブランチ、コンテキスト経路、フロー・トランスフォーマー、および出力ヘッドを最適化する。

3. プロポーザル・レビュー (PR)

実行をガイドするために、PACT-WAMは視覚言語モデル(VLM)を用いた**プロポーザル・レビュー(Proposal Review)**メカニメントを導入している。

  • プロセス: 4つの並列なVLMリクエストが、4、8、12、16ステップにおける入れ子状の予測プレフィックスを評価する。これらは、タスクに一貫した進捗を評価し、目に見える失敗(例:位置ずれ、衝突)を検出する。
  • 実行ロジック: コントローラーは、報告された拒否(veto)よりも前にある、連続して承認された最大のプレフィックスを選択する。もしプロポーザルが拒否された場合、システムは限定された予算内で共同リサンプリング(最大3回の試行)を行う。すべての試行が失敗した場合、エピソードは終了する。

主な貢献

  1. 新近性に基づく履歴割り当て: 本論文は、最近のフレームを優先することで、ビューあたり256トークンを割り当てる戦略を導入している。LIBEROベンチマークにおいて、これは一様なエンコーディング(16フレーム)よりも優れた性能を示し(98.6% 対 87.5%)、かつ密なエンコーディング(98.0%)に匹敵する性能を、75%少ない履歴トークンで達成している。
  2. コンパクトな潜在空間における共同生成: PACT-WAMは、コンパクトな画像あたりの潜在空間においてアクション・トラジェトリと視覚状態を共同生成し、物理的な遷移ごとに独立してデコード可能な予測を提供する。これにより、コンパクトな履歴エンコーディングとプロポーザル・レビューを統合することで、統一されたワールド・アクション・フレームワークを拡張し、予測プレフィックスの検証を可能にしている。
  3. テスト時強化によるパフォーマンス: ベースとなるポリシーは、シミュレーションおよび実世界のベンチマークにおいて高い成功率を達成している。プロポーザル・レビューの追加は、コアポリシーの再学習なしに堅牢性を向上させ、テスト時の大幅なブーストを提供する。

実験結果

モデルは、LIBERORoboTwin 2.0、および実世界のAgileX Piperプラットフォームで評価された。

  • LIBERO (シミュレーション):
    • PRなし: 平均成功率 98.6%
    • PRあり: 平均成功率 99.5%(ObjectおよびGoalスイートでは100%に到達)
  • RoboTwin 2.0 (シミュレーション):
    • PRなし: 50の二腕タスクにおける平均成功率 92.3%
    • PRあり: 平均成功率 93.4%
  • 実世界のPiper:
    • PRなし: Sorting、Handover、Cleanupタスクにおける平均成功率 78.0%
    • PRあり: 平均成功率 86.7%
  • アブレーション研究:
    • 履歴: 8:6:2のトークン階層は、効率と成功率の両面において、一様エンコーディングおよび密なエンコーディングを大幅に上回る。
    • 共同生成: アクションと視覚を共同で学習することは、アクションのみ(93.6%)や視覚補助(96.4%)のバリアントと比較して、制御の成功率(98.6%)を向上させる。
    • 視覚容量: 潜在容量を K=32K=32 から K=64K=64 に増やすと、予測の忠実度(PSNR, SSIM)は向上するが、制御の成功率はわずかに低下する(97.3% 対 98.6%)。これは、デフォルトの K=32K=32 が性能と計算コストのバランスを取っていることを示唆している。
    • プロポーザル・レビュー: PRは失敗したトラジェトリを効果的にフィルタリングする。現在の観測のみを使用する場合と比較して、予測プレビューを使用することで誤拒否率が減少する。

意義と主張

本論文は、PACT-WAMが表現コストと、実行決定のための視覚的先読みの可用性の間のトレードオフをうまく解決していると主張している。階層的な履歴エンコーディングとコンパクトでデコード可能な視覚的潜在変数を組み合わせることで、モデルはアクションと予測を時間的にペアリングした共同サンプリングを可能にする。このアーキテクチャにより、入れ子状のプレフィックスを検証することで実行をガイドするプロポーザル・レビュープロトコルが可能になり、複雑な操作タスクにおける信頼性が向上する。

著者らは、彼らのアプローチが、履歴のトークン数を劇的に削減しながら、アクション選択に必要な時間情報を保持していることを強調している。ベースとなるポリシーは競争力がある一方で、視覚的先読みをVLMベースのレビューメカニズムと統合することが、複雑な操作タスクの信頼性を向上させるための明確な道筋であることを述べている。また、予測の忠実度が高いことが必ずしも制御の成功率の向上に直結するわけではないことを指摘しており、意思決定における予測の「有用性」が、生の再構成品質よりも重要であることを示唆している。

著者らが指摘する限界: 現在のシステムは、タスクの関連性に適応しない固定された新近性ベースの割り当て、固定された16ステップのホライゾン、およびチェックポイント間の短い失敗を見逃す可能性のあるレビュープロセスを使用している。今後の課題として、タスク適応型の圧縮や可変ホライゾンの生成の探索が挙げられている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →