← 最新の論文
🤖 AI

RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models

RePO-VLA は、成功・失敗・回復の軌跡を区別してオンライン失敗検出器なしで実行ドリフトを自律的に修正可能な値条件付き方策を学習することにより、長視野かつ接触に富む操作における堅牢性を向上させるビジョン・言語・動作モデル向けの回復駆動型方策最適化フレームワークである。

原著者: Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun
公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun Wang, Min Wang, Liang Lin, Xiaodan Liang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに複雑な料理を作らせたり、繊細なタオルを折りたたませたりすると想像してみてください。あなたは、人間がそれを完璧に行っている動画を見せます。ロボットはそれを見て学び、あなたを真似ようとします。

問題:「完璧なレシピ」の罠
現在のロボット(ビジョン・言語・アクションモデルと呼ばれる)は、完璧な動画を模倣するのが得意です。しかし、現実は乱雑です。ロボットがスプーンを落としたり、濡れた床で滑ったり、カップを奇妙な角度で掴んだりすると、混乱します。なぜなら、それは「完璧な動画」だけで訓練されたため、物事がうまくいかない場合にどうすべきか知らないからです。状況が変わっても、元の「完璧な」シナリオに従い続け、最終的に衝突してしまいます。これは、空の高速道路だけで運転を学んだドライバーのようなものです。穴が開いた瞬間、それを避けるためのハンドル操作がわからないのです。

解決策:RePO-VLA(「回復コーチ」)
この論文は、RePO-VLAと呼ばれる新しい手法を紹介しています。ロボットに完璧な動画を見せるだけでなく、この手法は3つの具体的なことを教えます:

  1. 成功: 正しく行う方法。
  2. 失敗: 物事がうまくいかないときに何が起こるか。
  3. 回復: ミスを修正し、軌道に戻す方法。

これは、体操選手を訓練するようなものです。完璧な着地を見せるだけでなく、転倒する動画や、転倒後に自分でバランスを取り戻して立ち上がる動画も見せます。ロボットは、転倒が世界の終わりではないことを学びます。それは単に戦略を切り替えるシグナルに過ぎないのです。

仕組み:3つの簡単なステップ

  1. 「リセット」のトリック(回復感知初期化)
    ロボットが転倒すると、その転倒を引き起こしたミスを記憶していることが多いです。問題の修正を求めると、頭の中でそのエラーを再生し続けて立ち往生する可能性があります。

    • 解決策: RePO-VLAは動画の「回復」部分を取り出し、「ミス」部分を切り捨てます。修正が始まる直前でロボットのメモリをリセットします。まるでロボットに「転んだことを忘れろ。今いる場所だけを見て、どう立ち直るか考えろ」と言っているようなものです。これにより、ロボットは転倒の原因と解決策を混同することを防ぎます。
  2. 「進捗温度計」(セマンティック価値関数)
    システムは動画のすべての瞬間に「スコア」を割り当てます。

    • 高スコア(1.0): 目標に向かって進んでいる。
    • 低スコア(0.0): 目標から逸れているか、衝突しようとしている。
    • 魔法: ロボットが滑るとスコアは下がります。しかし、滑りを修正し始めるとスコアは再び上がります。ロボットはこの「温度計」を見ることを学びます。スコアが低い場合、現在の計画を中止し、スコアを再び高くするために別の動きを試すことを学びます。「必死に頑張っているが失敗している」状態と、「実際に問題を修正している」状態を区別することを学びます。
  3. 「目標指向」の駆動(値条件付き洗練)
    ロボットが実際に現実世界で作業しているとき、システムはこう伝えます。「可能な限り高いスコア(1.0)を目指せ」。

    • ロボットが軌道から逸れ始めると、「スコア」は下がります。ロボットは高いスコアを追いかけるように訓練されているため、自動的に「回復モード」に切り替わり、安全な経路に戻ろうとします。「止まれ!」と人間が叫んだり、衝突を検知する特別なセンサーが必要になるわけではありません。スコアが下がっているのを見て、本能的に自ら修正するのです。

テスト:FRBench
これが機能することを証明するため、研究者たちはFRBenchと呼ばれるテストを構築しました。ロボットが水を注いだりタオルを折りたたんだりしようとするビデオゲームを想像してください。ただし、ゲームマスターが密かにロボットを押したり、物体を滑らせたりします。

  • 従来のロボット: 押されると、空中に水を注ぎ続けたり、タオルを誤って折りたたんだりし、最終的に失敗します。
  • RePO-VLA ロボット: 押されると、スコアが下がっていることに気づき、悪い動きを止め、水を注ぐか折りたたむ新しい方法を見つけ出し、タスクを成功させます。

結果
テストにおいて、物事がうまくいかなかった場合、従来のロボットは約20%の成功率しかありませんでした。新しい RePO-VLA ロボットは約75%の成功率を達成しました。実際のロボットを用いた実世界の実験では、成功率は最大80%に達しました。

要約
RePO-VLA は、失敗を単なるデータとしてロボットに教えます。ミスを分解し、メモリをリセットし、ロボットに追うべき「スコア」を与えることで、簡単に壊れる脆いロボットを、自らの問題を修正できる回復力のあるロボットへと変えます。これは、答えのキーを暗記する学生と、質問が変わっても問題を解く方法を学ぶ学生の違いのようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →