← 最新の論文
💻 computer science

HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

本論文は、想像上のロールアウト中における予測ハルシネーション(幻覚)を推定および抑制することで汎用的なロボットポリシーを強化する、ハルシネーション認識型世界モデルに基づく方策最適化フレームワークであるHaWMPOを提案しており、これによりベンチマークおよび実世界のロボットの両方における複雑な長期ホライゾンの操作タスクでの成功率を大幅に向上させている。

原著者: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

公開日 2026-09-10
📖 1 分で読めます☕ さくっと読める

原著者: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ブロックを積み重ねることから洗濯物を畳むことまで、多種多様なタスクを実行することを学習できるロボットは、長らく人工知能の目標となってきました。これを実現するために、研究者たちは「ジェネラリスト」ポリシーを開発してきました。これは、本質的には言語と視覚を理解してロボットの動きを決定するように訓練された、脳のようなシステムです。しかし、これらのシステムを現実世界で教え込むことは、時間がかかり、コストが高く、かつリスクを伴います。ロボットが新しい動作を試みるたびに、何かを壊したり自分自身を損傷させたりする可能性があるため、試行錯誤のプロセスは危険なのです。この問題を解決するために、科学者たちは「ワールドモデル」に目を向けました。これは、ロボットがコンピュータの中で練習することを可能にするデジタルシミュレーターです。これらのモデルは、現在の行動に基づいて次に何が起こるかを予測し、学習のための安全な空間を作り出します。しかし、これらのデジタルシミュレーターは完璧ではありません。未来を遠くまで予測しようとするにつれて、実際には起こらなかった詳細を捏造し始めることがあり、これは「ハルシネーション(幻覚)」として知られる現象です。もしロボットがこれらの偽のシナリオから学習してしまうと、コンピュータ内では機能するものの、現実世界では完全に失敗してしまう動作を学習してしまう可能性があります。

ある研究チームは、不完全なデジタルシミュレーションによる間違いに惑わされることなく、ロボットが効果的に学習できる新しい手法を開発しました。彼らはこのアプローチをHaWMPOと呼び、デジタルな訓練場が嘘をついているときに、ロボットがそれを自覚できるように設計されたシステムです。すべての想像されたシナリオを等しく価値があるものとして扱うのではなく、この新しいシステムには、品質管理の検査官のように機能する特別なコンポーネントが含まれています。この検査官は、シミュレーターが生成する一連の画像を確認し、そのシーケンスがどれほど信頼できるかを示すスコアを割り当てます。もしシミュレーターが空想へと逸脱し始め、物理法則や期待される結果に一致しない画像を作成し始めた場合、検査官がそれをフラグ立てします。システムはその後、この情報を使用して学習プロセスを調整し、シミュレーションの中であまりにも信頼できない部分を無視し、より現実的に見える部分に集中するように、事実上ロボットに指示を出します。

研究者たちは、LIBEROと呼ばれるコンピュータ環境を用いた標準的なロボットタスクを用いて、この手法をテストしました。LIBEROは、物体を特定の場所に移動させることを含むものです。彼らは、ワールドモデルを使用しているものの、この品質管理機能を持たない他の手法と比較しました。その結果、新しいアプローチに明確な優位性があることが示されました。シミュレーションにおいて、ハルシネーションを意識したシステムを使用するロボットは、63.7パーセントの成功率を達成し、これは次に優れた手法を大幅に上回りました。この改善は、空間推論や物体操作を必要とするタスクで特に顕著であり、現実と偽のシナリオを区別するロボットの能力が、より堅牢な戦略の学習に役立ったことが分かりました。研究者たちは、高度にハルシネーションが発生したシナリオに依存したときにロボットにペナルティを与えることで、壊れたシミュレーション内でのみ機能するような悪い習慣をロボットが学習するのを防いだことを発見しました。

この手法がコンピュータの外でも機能することを確認するため、チームは現実世界の環境における物理的なロボットを用いてテストを行いました。彼らはロボットに、ティッシュを箱に入れることと、ヘッドフォンをスタンドに置くことという2つの特定の課題を与えました。新しいシステムがない場合、ロボットはヘッドフォンのタスクにおいて約60パーセントの確率で成功しました。ハルシネーションを意識したトレーニングを適用した後、成功率は平均でAUC 0.8に上昇し、ロボットはティッシュのタスクで85%、ヘッドフォンのタスクで75%を達成しました。このパフォーマンスの飛躍は、デジタル世界で学んだレッスンが実際に物理的な世界へと転移可能であることを証明しています。なぜなら、ロボットが通常これらのシステムを混乱させるデジタルノイズを無視することを学んだからです。研究者たちは、システムがシミュレートされた未来の一貫性を常にチェックすることで、物理的に妥当に見える軌道からのみ学習するようにしていると述べています。

この研究は、より優れたロボット学習の鍵は、単にシミュレーターを持つことではなく、それを信頼する方法を持つことにあることを強調しています。シミュレーションが現実との繋がりを失いつつあることを検知できるシステムを構築することで、研究者たちはロボットが向上するためのより安定した道を切り開きました。現在のテストは比較的短いタスクに対して行われましたが、この成功は、ロボットが多くのステップを前方に計画しなければならない、より複雑で長期的なミッションにおいて、このアプローチが極めて重要となる可能性を示唆しています。この研究は、ロボットが真の汎用ヘルパーになるためには、有用な予測と説得力のある嘘を区別して学習しなければならないことを確認しており、この新しい手法は、学習プロセス自体に自らの限界を認識させることで、そのスキルを提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →