← 最新の論文
🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

本論文は、コンテキスト長の制限を克服するために完全な軌道を状態・行動サンプルに分解し、800 以上のマインクラフトタスクにおいて最先端の性能を達成するオープンワールドの視覚言語モデルエージェント向けにグループ相対方策最適化(GRPO)を適応させた強化学習フレームワーク GROW を紹介する。

原著者: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

マインクラフトのような複雑なビデオゲームをロボットに教える場面を想像してください。ロボットにはカメラ(目)があり、キーボードを打ったりマウスを動かしたりできます(手)。その目標は、「家を建てる」「金を掘る」「モンスターを倒す」といったタスクを完了することです。

長らく、これらのロボットを教える最良の方法は**教師あり微調整(SFT)**でした。これは、人間のプロが完璧にゲームをプレイしている動画を見せ、「彼らがやったことを正確に真似しなさい」と言うようなものです。問題点は?完璧な人間のプレイ動画の何時間分ものデータを見つけるのは高価であり、ロボットが単に動画を暗記してしまうと、ゲームが少し変わっただけで混乱してしまいます。

その後、研究者たちは強化学習(RL)、特にGRPOと呼ばれるアルゴリズムを試みました。これは、ロボットにゲームをプレイさせ、失敗し、成功し、その結果から学ぶようなものです。しかし、標準的な GRPO はオープンワールドゲームに適用された際、重大な欠陥を持っていました。それは、ゲームセッション全体を単一のレッスンとして扱っていた点です。

問題点:「長すぎる」レッスン

ケーキの焼き方を学ぼうとしている場面を想像してください。

  • 標準的な GRPOは、あなたの幼少期の物語、3 日前の天気予報、レシピ、そして隣人の犬の物語がすべて混ざり合った 500 ページの本を渡すようなものです。そして、「最後にあなたは良いケーキを焼いたのだから、この 500 ページの本のすべてが良いことだった」と言います。
  • この論文では、これを**「完全な軌道(full trajectory)」**と呼んでいます。ロボットがマインクラフトをプレイするにつれ、それが目にしたものや行ったものの履歴はどんどん長くなります。やがて、「本」はあまりにも巨大になり、ブロックを見つけるまでの 10 分間の歩き回りなどの無関係なノイズで満ち溢れるため、ロボットは圧倒され、どの特定の動きが実際に成功につながったのかを判断できなくなります。

解決策:GROW(「レシピカード」アプローチ)

著者たちは、GROW(状態 - 行動モデル化による GRPO の整合化)と呼ばれる新しいフレームワークを提案しています。

ロボットに 500 ページの本全体を与える代わりに、GROW はゲームセッションを小さく噛みやすいレシピカードに切り分けます。

  • 状態 - 行動分解:GROW は長いゲームセッションを個々の瞬間に分解します。「ブロックを見る」+「マウスをクリックする」+「ツルハシが当たる」。
  • 賢いフィードバック:ロボットが最後に成功した場合、GROW は「ゲーム全体が素晴らしかった」とは言いません。代わりに、勝利につながった特定のカードを見ます。「金を発見する 5 秒前に行った動きは非常に良かった。20 分前にただ歩き回っていた時の動き?あれはまあまあだったね」と言います。

仕組み(アナロジー)

サッカー選手を指導するコーチを想像してください。

  • 古い方法(標準的な GRPO):コーチは 90 分間の試合全体を見守り、選手がゴールを決めるのを見て、「よくやった!最初の一分から最後の一分まで、すべて完璧だった!」と叫びます。選手は混乱します。実際には、試合をほぼ失うほどだった 10 分目のパスはひどかったからです。
  • GROW の方法:コーチは試合を分解します。「10 分目のそのパスは乱雑だった。でも、80 分目に行ったランは完璧だった。89 分目のキックは素晴らしい」。選手は、どの特定の行動を繰り返すべきかを正確に学びます。

「魔法」の数学

この論文には、この「レッスンを切り分ける」アプローチが依然として有効であることを保証する数学的証明(代理分析)が含まれています。

  • 懸念点:この種の学習に関する標準的な数学では、通常、全く同じ開始点における異なる試行を比較する必要があります。GROW は時間の異なる瞬間を比較しますが、それらはすべて異なります。
  • 結果:著者たちは、開始点が異なっても、ロボットが得る「スコア」は依然としてその戦略の良さを正確に反映することを証明しました。これは、数学のテストで学生を評価するようなものです。問題が異なっても、最終的なスコアは彼らが数学の能力を向上させているかどうかをまだ教えてくれます。

結果:ゲームを制す

チームは、洞窟の探索からアイテムのクラフト、モンスターとの戦闘まで、800 以上の異なるマインクラフトのタスクで GROW をテストしました。

  • 成功率:GROW は以前の手法を大幅に上回りました。例えば、「GUI タスク」(ゲームのメニューを使ってアイテムをクラフトする)では、成功率は約 39% から**68%**に跳ね上がりました。
  • 効率性:ロボットは単に勝つ回数が増えただけでなく、より速く勝ちました。ノイズを無視し、実際に重要な動きに集中することを学んだため、タスクを完了するためのステップ数が少なくなりました。
  • 汎化能力:ロボットは練習した特定のゲームを暗記しただけではありませんでした。ターゲットを探す方法やメニューの使い方など、以前に一度も見たことのない新しいタスクでも成功できる一般的なスキルを学びました。

まとめ

GROWは、AI エージェントにオープンワールドゲームを教えるより賢い方法です。彼らをプレイセッション全体の長く messy な履歴で圧倒する代わりに、ゲームを小さく明確なステップに分解します。これにより、AI はどの行動が成功につながるか正確に理解できるようになり、より速く学び、より良くプレイし、混乱することなく新しい課題に対処できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →