← 最新の論文
💻 computer science

Action with Visual Primitives

本論文は、視覚言語モデルが視覚プリミティブトークンを出力してフローマッチングに基づく動作専門モデルを条件付けることで、指令理解と空間理解を運動制御から分離するエンドツーエンドのアーキテクチャであるAVP(Visual Primitives を伴う動作)を導入し、これにより既存の pi_0.5 などの手法と比較して、ロボットによる把持・配置タスクにおける成功率、データ効率、および汎化性能を大幅に向上させるものである。

原著者: Weilong Guo, Yuchen Wang, Renping Zhou, Yunfeng Zhang, Rui Fang, Yue Meng, Wenda Xu, Yuan He, Gao Huang

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Weilong Guo, Yuchen Wang, Renping Zhou, Yunfeng Zhang, Rui Fang, Yue Meng, Wenda Xu, Yuan He, Gao Huang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な将棋のゲームをロボットに教えたり、ドミノを完璧に積み上げたりしようとしていると想像してください。ロボットに「赤い駒を隅へ動かして」と命令します。

現在のほとんどのロボット頭脳(VLA モデルと呼ばれる)では、ロボットはすべてを一度に行おうとします。言葉の意味を理解し、盤上の赤い駒の正確な位置を特定し、それを掴むための精密な筋肉の動きを計算する——これらすべてを、一瞬の思考の中で行わなければなりません。まるで、会話しながら地図を読み、車を運転し、駐車することを、一度も立ち止まって考えずに同時に行うように求めるようなものです。これは、盤の見た目がいささか異なったり、駒が新しい位置にあったりする場合、特に混乱を招くことがよくあります。

この論文の著者たちは、**AVP(Action with Visual Primitives:視覚的プリミティブを伴う動作)という、作業を分割するより賢い方法を提案しています。彼らはロボットの頭脳を、「戦略家(Strategist)」「実行者(Doer)」**という 2 つの明確な役割を持つチームのように扱います。

新しいチームワーク:戦略家 vs 実行者

1. 戦略家(ビジョン・ランゲージモデル)
この部分は「目と脳」と考えてください。その唯一の役割は、状況と指示を見て、何を行うべきか、どこで行うべきかを決定することです。

  • 言葉だけで考えるのではなく、戦略家は画像上に素早く見えないスケッチを描きます。駒の周りに小さな枠を描いたり、目標のマスに点を打ったりするかもしれません。
  • これらの描画は**「視覚的プリミティブ(Visual Primitives)」**と呼ばれます。これらは「ねえ、ここに集中して」と伝えるシンプルで明確なマーカーです。

2. 実行者(動作の専門家)
この部分は「手」と考えてください。将棋のルールや言葉の意味を理解する必要はありません。

  • 単に戦略家のスケッチ(視覚的プリミティブ)を見て、「わかった、枠が見える。その枠の中にあるものを掴むように腕を動かそう」と言います。
  • 「何を」「どこで」という部分はすでに戦略家によって解決されているため、実行者は物理的な動きに 100% のエネルギーを集中させることができます。

なぜこれがよりうまく機能するのか

この論文は、従来の方法では「実行者」が動くたびに、世界を見る方法と理解する方法を再学習することを強いられていると主張しています。新しい AVP 法では、「戦略家」が事前学習された知識を使って思考を処理し、「実行者」は視覚の手がかりに従うだけで済みます。

「ゼロ注釈」のスーパーパワー
通常、ロボットにこれらの枠を描く方法を教えるには、人間が数千枚の画像を手動でラベル付け(例:「これが駒です」)する必要があります。これは遅く、高価です。

  • AVP のトリック: ロボットはすでに自分の手がどのように動いているかを知っています(自らの関節を制御しているため)。システムは、訓練中にロボットの自らの手の動きを自動的に「視覚的プリミティブ(枠や点)」に変換します。
  • 比喩: これは、学生のために床に矢印を描く必要のないダンスのインストラクターのようなものです。インストラクターは学生の足元を見て、学生がすでに踏んでいるステップを自動的にハイライトするだけです。追加の描画は不要です。

結果:実世界での証明

チームは、2 本の腕を持つ実在のロボットで、3 つの困難なシナリオにおいてこれをテストしました。

  1. 将棋: 多くの似たようなアイテムが混在する混雑した盤上で駒を動かす。
  2. ドミノ: 非常に特定の角度でドミノを置く。
  3. 汎用のピック&プレース: 異なる形状のランダムな物体を掴んで移動させる。

スコアボード:

  • 従来の最良の方法(π0.5と呼ばれる)と比較して、AVP は成功率を**27.61%**向上させました。
  • 汎化能力: ロボットがある種類の盤で訓練され、全く異なる盤(または異なる物体)でテストされた場合でも、AVP はうまく機能しました。従来の方法は、新しい見た目によって混乱して失敗することがよくありました。
  • 速度: 物体を検出するために外部ツールを使用した古い方法はいくつか遅く(コマンドに 37 秒を要する)、AVP は高速(0.27 秒)であり、リアルタイムでの実用が可能でした。

要約

AVP は、思考実行を分離するロボット制御システムです。指示に基づいて単純な視覚的目標(プリミティブ)を描く「戦略家」と、それらの目標に従う「実行者」を使用します。この労働分担により、ロボットは人間がすべての詳細を手動で教えることなく、新しいタスク、新しい物体、混雑した環境を処理する能力が大幅に向上します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →