← 最新の論文
💻 computer science

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

本論文は、多様なVLAアーキテクチャと強化学習アルゴリズムの統合を標準化し、リソース配分を最適化することで、複数のエンボディード・インテリジェンス・ベンチマークにおいて大幅な学習速度の向上と最先端の性能を実現する、統一的かつ効率的なフレームワークであるRLinf-VLAを紹介するものである。

原著者: Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao
公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが単に厳格な指示に従うだけの無機質な機械ではなく、あなたの言葉を理解し、あなたが見ているものを見ることができ、目的を達成するために自らの体をどう動かすべきかを自ら考え出す、好奇心旺盛な学習者である世界を想像してみてください。これが、Vision-Language-Action (VLA) モデルの刺激的な最前線です。これらのモデルを、インターネット上の膨大なデータを用いて言語と画像を理解するように訓練された、ロボットの「脳」と考えてみてください。しかし、落とし穴があります。ロボットが「コップ」とは何かを知っており、「コップを手に取って」という言葉を聞き取れたとしても、それだけで、コップを倒さずに掴むための最善の方法までを知っているとは限らないのです。物理的なタスクを本当に上手に行えるようになるには、ロボットは練習し、失敗し、その結果から学ぶ必要があります。ここで強化学習 (Reinforcement Learning: RL) の出番となります。RLは、ビデオゲームのトレーニングループのようなものだと考えることができます。ロボットはアクションを試行し、成功すれば「スコア(報酬)」を得て、良い動きを繰り返し、悪い動きを避けるように学習していくのです。科学者たちが問いかけている大きな疑問は、これらのロボットが複雑なスキルを習得するのに膨大な時間をかけずに済むような、十分に速く、かつスマートなトレーニングシステムをどのように構築するか、ということです。

ここで、RLinf-VLA という、これらロボットの脳のための超効率的なトレーニングジムとして機能する新しいフレームワークが登場します。この論文の著者たちは、強力なロボットモデルや優れた学習アルゴリズムが存在する一方で、その「ジム」自体がしばしば機能不全に陥っていることに気づきました。従来のシステムは、まるで重いバックパックを背負ってマラソンを走っているようなものでした。動作が遅く、使い勝手が悪く、異なる種類のトレーニング環境にもうまく対応できませんでした。時には、ロボットの脳(モデル)がシミュレーター(仮想世界)が進むのを待っており、またある時には、シミュレーターが脳の処理を待っているという状況があり、高価なコンピューターチップがアイドル状態のまま放置されていました。

チームは、この交通渋滞を解消するためにRLinf-VLAを構築しました。彼らは、異なるロボットシミュレーター、異なる脳のアーキテクチャ、そして異なる学習アルゴリズムをすべて同時にプラグインできる統一されたシステムを作り上げました。しかし、本当の魔法はそのコンピューターパワーの管理方法にあります。彼らは、巧みに振り付けされたダンスのように機能する、賢明な「ハイブリッド」モードを導入しました。ロボットの脳と仮想世界が互いに待ち合うのではなく、プロセスをパイプライン化するのです。つまり、脳がシミュレーションの一部分に対して次の動きを考えている間に、シミュレーターは別の部分に対して前の動きを実行しているのです。これにより、すべてがフルスピードで動き続けます。

この新システムの成果は目覚ましいものです。シミュレーションにおいて、このフレームワークは従来の手法よりも最大2.27倍高速にトレーニングを行いました。訓練されたモデルをテストした際の結果も強力でした。RLinf-VLAで訓練された単一のモデルは、LIBEROベンチマークにおける130の異なるタスクで**98.11%の成功率を、ManiSkillにおける25のタスクで97.66%を達成しました。両手を使うことを伴う難易度の高いRoboTwinタスクにおいても、モデルは平均84.63%**の成功率に達しました。研究者たちは、物理的なロボットアームが引き出しを閉めるという、このバージョンの実世界でのテストも行いました。成功率は標準的なモデルと同じ(10回中8回)でしたが、RL訓練済みのロボットは、訓練されていないバージョンに見られるようなぎこちなく不自然な動きを避け、よりスムーズかつ効率的に動いていました。

この論文は、この新しいフレームワークが単なるスピードアップのためのツールではなく、これら複雑なロボットの脳を以前よりもはるかに大規模に訓練することを可能にする基礎的なツールであることを示唆しています。これらのシステム間の通信方法を標準化し、コンピューターリソースの使用を最適化することで、RLinf-VLAは、ロボットが新しい物理的スキルを迅速かつ確実に学習できる道筋を提示しており、ロボットが私たちの日常生活を真にサポートできる日の実現へと一歩近づけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →