← 最新の論文
🤖 machine learning

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPOは、バイナリの成功報酬に実行品質スコアを付加することで、同一結果のグループを分割し、破棄されたロールアウトから学習信号を回収することによって、Vision-Language-Actionポリシーの最適化を加速させ、目標成功率に達するまでのロールアウト数を最大56%削減します。

原著者: Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

視覚を持ち、言語を理解し、目的を持って動くことができるロボットは、もはやサイエンスフィクションではありません。これらは、「ビジョン・ランゲージ・アクション・モデル」と呼ばれる一種の人工知能を用いて構築されています。これらのシステムは、ロボットが見ているものと、指示された内容との間の架け橋として機能します。例えば、「赤いカップを手に取って」という言葉を聞き、テーブルの上にカップがあるのを見たロボットを想像してみてください。ロボットは、それを掴むために腕の精密な動きを計算しなければなりません。これらのロボットをより良く教えるために、研究者たちはしばしば「強化学習」と呼ばれる手法を用います。このプロセスでは、ロボットがタスクに挑戦し、成功すれば報酬が得られ、失敗すれば何も得られません。数千回の試行を経て、ロボットはどの動作が成功につながるかを学習します。しかし、この学習プロセスには膨大なコストがかかります。ロボットがタスクを試みるたびに、時間と計算資源が消費されるのです。もしロボットが繰り返し失敗したり、あるいは不器用な形で成功したりした場合、コンピュータはその試行を無用なデータとして捨ててしまうことがよくあります。この無駄は大きなボトルネックとなり、現実世界で安全かつ効率的に働くロボットの開発を遅らせています。

ある研究チームは、この無駄を解消するための新しいアプローチを開発し、かつては破棄されていたデータを価値ある教訓へと変えました。「Prism-GRPO」と呼ばれる彼らの手法は、ロボットが自身の試行を評価する方法を変更するものです。標準的な学習方法では、ロボットには単純な「合格か不合格か」のスコアが与えられます。もし一連の試行がすべて成功した場合、それらはすべて同じ満点のスコアを得ます。もしすべて失敗した場合、それらはすべて同じゼロのスコアを得ます。スコアが同一であるため、コンピュータはどの試行が他よりも優れていたのかを判別できず、時間を節約するためにそのグループ全体を破棄してしまうのです。研究者たちは、たとえロボットが失敗したときであっても、あるいは成功したときであっても、そこにはしばしば「どのように」実行したかという微妙な違いが存在することに気づきました。ある成功した試行は滑らかで優しかったかもしれませんが、別の試行はぎこちなく、周囲の物体を倒してしまったかもしれません。また、ある失敗した試行は目標に近かったかもしれませんが、別の失敗は大きく的外れだったかもしれません。こうしたニュアンスを無視することで、従来の方法は、ロボットをより精密にするために必要な情報そのものを捨て去っていたのです。

新しい手法は、第二のフィードバック層を追加することでこの問題を解決します。単に「うまくいったか?」と問うのではなく、システムは「どの程度うまくいったか?」とも問います。物理的な実行の質、例えば、どれだけの力が使われたか、動きがどれほど滑らかであったか、あるいはロボットが触れてはいけないものに誤ってぶつからなかったか、といった点に基づいて品質スコアを割り当てます。このスコアは、合格・不合格の結果と組み合わされます。これにより、たとえ一連の試行がすべて成功していたとしても、システムはどれがより洗練されていたかを識別し、それに応じて報酬を与えることができます。同様に、もしグループがすべて失敗していたとしても、システムはどの失敗が最も被害が少なかったかを特定し、それを学習信号として利用できます。この単純な変更により、ほとんどのデータが無駄になることがなくなります。ロボットは、成功したものや失敗したものといった稀なケースだけでなく、あらゆる試行から学習することができるのです。

研究者たちは、二本の腕で鍋を持ち上げることから、缶を移動させて鍋の横に置くことまで、4つの異なるロボットタスクでこのアイデアをテストしました。その結果、彼らの新しい手法を用いることで、標準的な方法よりも最大56パーセント少ない試行回数で、ロボットが同じ成功レベルに到達できることが分かりました。これは、時間と計算資源の大幅な節約になります。さらに重要なことに、この新手法で訓練されたロボットは、単に成功することを学んだだけでなく、優雅に成功することを学びました。彼らは「ショートカット(近道)」、あるいは「手抜き」を発展させる可能性が低くなりました。例えば、缶を持ち上げて鍋の横に置くというタスクにおいて、旧来の方法では、ロボットが缶を持ち上げる代わりに、単に鍋を缶の方へ押し出すように教えてしまうことがありました。これはコンピュータの成功判定を満たしてはいますが、人間が求めていた動作ではありませんでした。新しい手法は、このような荒っぽい押し動作にペナルティを課すことで、ロボットに正しい、優しく持ち上げて置くという動作を教え込んだのです。

研究者たちがシミュレーション内の最も優れた性能を持つロボットを実物の物理的なロボットに移したとき、その結果は維持されました。新しい手法で訓練されたロボットは、より信頼性が高く、シミュレーションでは通用したものの現実世界では失敗してしまうような不器用なショートカットを行う可能性が低いことが分かりました。この研究は、行動の最終的な結果だけでなく、その行動の「質」に注意を払うことで、ロボットをより速く訓練でき、より安全にできることを示しています。研究者たちは、このアプローチがメインのタスクを学習する能力を損なわないことを数学的に証明し、実験によって、それが速度と振る舞いの両方を一貫して改善することを確認しました。この成果は、ロボットが単に仕事をこなせるだけでなく、人間と共に働くために必要な配慮と精密さを持って仕事を遂行できるようにするための、明確な道筋を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →