← 最新の論文
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

本論文は、モデルベース制御と学習済み方策の架け橋となるSUN(Semantically UNified)プログラムおよびKuafuシステムを紹介するものであり、これらはMPCによる検証とRLによる学習を統合した、型定義され言語に接地された実行可能プログラムを自動合成することで、手動による稠密な報酬や人間によるデモンストレーションを必要とせずに、堅牢な長期的操作を実現するものである。

原著者: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長らく工場の床の達人であり、同じ正確な動作をエラーなく数千回繰り返してきました。しかし、引き出しを開け、ボトルを取り出し、それをテーブルの上に置くといった、散らかった予測不可能な家庭内での複雑で多段階のタスクを求められると、彼らはしばしばつまずいてしまいます。その困難さは、動きについての2つの異なる考え方の間の溝を埋めることにあります。一方のアプローチは、厳格な数学的ルールに依存してすべての関節の角度と力を計算し、ロボットが衝突しないようにするものですが、この手法は脆く、世界がわずかに変化すると失敗してしまいます。もう一方のアプローチは、試行錯誤による学習を用いており、ロボットがタスクのコツを掴むまで練習するものですが、これには多くの場合、人間のデモンストレーションの数千時間や、設計が困難な精巧に作られた報酬を必要とします。長年、これら2つの手法は別々のサイロの中で運用されており、厳格なプランナーは適応できず、学習者はタスクの深い論理を理解することができませんでした。

カリフォルニア大学ロサンゼルス校の研究者とその同僚たちは、これら2つのアプローチを織り合わせようとする「Kuafu」と呼ばれる新しいシステムを導入しました。指示を、一過性の目標や硬直したスクリプトとして扱うのではなく、プロセス全体における単一の真実の源として機能する、永続的で型定義されたプログラムを作成しました。彼らが「セマンティック・ユニファイド(意味論的に統一された)」または「SUNプログラム」と呼ぶこのプログラムは、引き出しのハンドルがどちらを向いているか、あるいはボトルをどれだけ持ち上げる必要があるかといった、オブジェクト間の物理的な関係をコンピュータが理解できる方法で記述されています。決定的なのは、この同じプログラムが、ロボットの動作の検証、動きの学習、そしてゼロから学習するためのデータの生成に使用される点です。初期の計画段階から最終的な学習フェーズに至るまで、タスクの核となる意味を一定に保つことで、システムはロボットが本来すべきことから逸脱することを防ぎます。

システムは、「引き出しを開けて、カップの中に置いてください」といった人間からの単純な言語指示を受け取るところから始まります。人工知能エージェントはこの指示を読み取り、物理的な動作や制約を記述する定義済みの構成要素を選択することで、SUNプログラムを構築します。次に、高度な制御手法を用いて、このプログラムを高忠実度のシミュレーション内でテストし、そのタスクが物理的に可能かどうかを確認します。もしシミュレーションによって指示に欠陥がある、あるいは実行不可能であることが判明した場合、システムは学習が始まる前にプログラムを自動的に修復します。このスクリーニング・プロセスは極めて重要です。なぜなら、ロボットが実行不可能なタスクを学習させられることを防ぎ、無駄な時間や計算資源を消費する前に、悪いアイデアを排除してくれるからです。

プログラムが検証されると、システムはそれを使用して、ロボットがタスクを実行する数千件の成功例を生成します。これらの例は単なるランダムな動きではありません。永続的なプログラムによって導かれており、グリッパーがハンドルに触れた瞬間から引き出しが完全に開いた瞬間まで、タスクのあらゆる段階を追跡しています。ロボットはまずこれらの例を模倣することによって学習し、次に、元のプログラムによって厳密に制限された試行錯誤のプロセスを通じて、それらを洗練させていきます。これにより、ロボットは柔軟かつ反応的になることを学びつつも、究極の目標を見失わないことが保証されます。その結果、従来のメソッドでは達成できなかったレベルの信頼性で、複雑な多段階タスクを実行できるポリシーが得られます。

キューブを積み重ねたり、ボトルを向きを変えたり、引き出しを開けたりといった、9種類の異なる操作タスクを含む一連のテストにおいて、このシステムは既存の手法に対して大幅な改善を示しました。希薄な報酬やオンライン・プランニングに依存する他のアプローチが成功率3分の1未満で苦戦する一方で、この新システムは82パーセントを超える成功率を達成しました。研究者たちは、このシステムが多くのステップを必要とするタスクにおいて特に効果的であり、シーケンスの複雑さが増してもパフォーマンスを維持していることを発見しました。さらに、このシステムによって生成されたデータは非常に高品質であったため、視覚学習モデルが46パーセントの試行で成功しましたが、これは他の生成手法から訓練されたモデルの成功率の2倍以上となる数値です。

あらゆるロボットシステムの真のテストは、コンピュータ・シミュレーションの安全性から現実世界へと移行できるかどうかです。これを検証するために、研究者たちは訓練されたポリシーをFrankaおよびKinova製の物理ロボットに展開し、特定のタスク構造に関する事前の知識なしに、カメラを使用してロボットの動作をガイドしました。追加のチューニングや実世界での練習なしに、ロボットは様々な構成において物理的な試行の34.7パーセントを成功させました。この、シミュレーション内で完全に訓練されたロボットが即座に実機のマシンで動作する「ゼロショット転移」は、永続的なプログラムがタスクの本質的な論理をうまく捉えており、学習された行動が物理世界に汎化できることを示唆しています。

研究者たちは、このアプローチには限界があることも認めています。現在は、定義済みの物理的動作のライブラリに依存しており、シーン内のオブジェクトに関する明確な理解を必要とするため、布や流体のような変形するオブジェクトを、大幅な新しいプログラミングなしに扱うことはまだできません。加えて、システムはタスクを単一の方向で進め、物理的なエラーが発生した場合にバックトラック(後戻り)することができないため、特定の種類の間違いからの回復能力が制限されます。しかし、これらの結果は、ロボット学習における新しい原則を確立しています。すなわち、計画、検証、学習のすべてにおいてタスクの意味論的な一貫性を保つことが、自動化の強固な基盤を作るということです。ロボットのタスクに対する理解が逸脱しないようにすることで、システムは厳格な制御と柔軟な学習の間の溝を埋め、現実世界で複雑なタスクを確実に実行できるロボットへの道筋を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →