← 最新の論文
🤖 AI

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1は、公開されているRoboCasaのデモンストレーションに対してGroup Relative Policy Optimization(GRPO)を活用することで、追加のプライベートデータを必要とすることなく、フローベースのVision-Language-Actionモデルの性能と成功率を大幅に向上させる強化学習ポストトレーニングフレームワークである。

原著者: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットにコーヒーを淹れたり、扱いにくい引き出しを開けたりといった、複雑な料理(タスク)を教えていると想像してください。

問題点:「真似っこ」ロボット
これまで、ほとんどのロボットの訓練には「行動クローニング(Behavior Cloning)」という手法が使われてきました。これは、生徒が先生の完璧なビデオ映像だけを見て学習するようなものです。ロボットは、人間が成功している様子を観察し、その動きを正確にコピーしようとします。

  • 欠陥: もし生徒が小さなミス(例えば、取手を握る位置が数ミリずれたなど)をしたとしても、ビデオにはその修正方法までは映っていません。ロボットは途中で行き詰まり、どうやって立て直すべきか分からず、失敗してしまいます。学習中にミスをすることが許されていなかったため、自分の間違いから学ぶことができないのです。

解決策:Z-1(「試行錯誤」のコーチ)
この論文では、ロボットが「やってみる、失敗する、そしてやり直す」ことで学習できる新しい訓練システムであるZ-1を紹介しています。これは、キッチンで練習させて、失敗したら「次はこうすればいいよ」と具体的なフィードバックを与えるコーチのようなものです。

Z-1の仕組みを、簡単な比喩を使って説明します。

1. 出発点 (SFT)

まず、ロボットはドアを開けたりシンクを使ったりする人間の公開ビデオを観察することで、「短期集中コース」を受けます。これは、料理をする前にレシピを読むことに似ています。これにより、ロボットは何をすべきかの基本的な概念を理解します。

2. 「グループ練習」 (GRPO)

Z-1は、ロボットを一人で練習させるのではなく、**グループ相対方策最適化(GR口 relative Policy Optimization: GRPO)**という手法を用います。

  • 比喩: コーチが8人の生徒をキッチンに送り込み、同時にコーヒーを作らせる場面を想像してください。
  • 目的: コーチは単に「よくできました」や「ダメでした」と言うだけではありません。代わりに、コーチは8人の生徒を互いに比較します。もし7人がコーヒーをこぼし、1人だけが成功した場合、コーチはその成功した生徒に「あなたは違うやり方をしましたね。そのやり方を続けなさい」と伝えます。これにより、ロボットはどの微細な動きが違いを生んだのかを正確に把握できるのです。

3. スマートなテクニック(新しいモジュール)

この論文では、練習を効率的かつ安定させるための4つの巧妙なテクニックを紹介しています。

  • 共有プレフィックス(「同じスタート」のルール):

    • 問題点: 生徒Aが左に歩いてスタートし、生徒Bが右に歩いてスタートした場合、最終的なコーヒー作りのスキルの高さを比較するのは不公平です。スタート地点が異なっているからです。
    • 解決策: Z-1は、すべての生徒に全く同じ最初の数ステップ(例:カウンターへ歩いていく動作)を強制します。全員がカウンターの前に立ったところで、それぞれ異なる方法でマグカップを掴む練習を始めます。これにより、ロボットは「歩くこと」ではなく、タスクの「重要な部分(掴む動作)」から学習できるようになります。
  • ツリー構造の分岐(「分岐する道」のルール):

    • 問題点: 時には、「カウンターへ歩く」という部分自体も練習が必要です。もし全員を完全に同じ動きに強制してしまうと、歩き方のミスを修正する方法を学ぶことができません。
    • 解決策: Z-1は「ツリー(樹形図)」構造を使用します。全員が一緒にスタートしますが、その後、異なるポイントで小さなグループに分かれていきます。早く分かれるグループもあれば、遅れて分かれるグループもあります。これにより、練習の秩序を保ちつつ、小さなミスを修正する練習を行うことができます。
  • 成功を意識した報酬減衰(「スピードボーナス」):

    • 問題点: 標準的なシステムでは、ロボットがドアを開けるのに10分かかっても、1分で開けても、どちらにも同じ「よくできました」ステッカーを与えてしまうことがあります。
    • 解決策: Z-1は、より早く完了したロボットにより大きな「よくできました」ステッカーを与えます。遅い方を罰することはありませんが、速い方をより高く評価します。これにより、失敗を恐れることなく、効率的に動くよう促します。
  • 選択的結合訓練(「脳と手」の切り替え):

    • 問題点: ロボットが失敗する理由は、その「手(アクションの専門家)」が不器用だからかもしれません。あるいは、その「目(視覚と言語の脳)」がノブを明確に捉えられていないからかもしれません。
    • 解決策: 通常、Z-1は安定性を保つために「手」のみを訓練します。しかし、もしロボットが「見ること」や「対象を理解すること」ができずに失敗し続けている場合、Z-1はスイッチを切り替え、「脳」と「手」を同時に訓練します。これは、「生徒は不器用なのではなく、単に取手が見えていないだけだ!」と気づき、より良く見るように教えるようなものです。

結果

チームは、24種類の家庭内タスク(引き出しを開ける、シンクを使う、コーヒーを淹れるなど)でZ-1をテストしました。

  • Z-1の前(ビデオを見ているだけ): ロボットの成功率は約**67%**でした。
  • Z-1の後(新しいテクニックを用いた練習後): ロボットの成功率は**80.6%**に達しました。

この向上は非常に顕著であり、Z-1は秘密のプライベートデータを使用せず、公開されているビデオと自らの練習セッションのみを使用して、現在公開されている他のトップレベルのロボットモデルをも上回りました。

まとめ:
Z-1は、単なる「真似っこ」だったロボットを「問題解決者」へと変貌させます。グループでの練習、共通のスタート地点、スピードへの報酬、そして「目」と「手」のどちらを訓練すべきかの判断を通じて、ロボットは以前よりもずっと上手く、現実世界の家庭内の複雑な課題に対処できるようになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →