SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
本論文は、オフラインデータを用いて、複雑で長期的なホライゾンを持つロボット操作タスクにおけるポリシー・ステアリングを向上させ、長いクレジット割り当てホライゾンを克服するために、自然言語によるアクティブなサブタスクを自己回帰的に予測することで汎用的な価値関数を学習するフレームワークであるSeeQを導入するものである。
原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: SeeQ: 長期的なロボット操作のための汎用価値関数の学習
問題提起
模倣学習を通じて学習される汎用ロボットポリシーは、複雑で長期的な(long-horizon)ロボット操作タスクにおいて苦戦することが多い。これらのタスクは、頻繁に複数の段階を含んでいたり、特定の段階において試行錯誤や熟考を必要としたりする。このような設定では、エラーが時間の経過とともに累積し、エキスパートのデータセットにはリカバリー動作が十分に表現されていない。Q値関数は、候補となるアクションをランク付けすることでポリシーを制御するメカニズムを提供するが、長期的なタスクに対してこれらを学習することは困難である。標準的なアプローチは主に3つの障壁に直面している:
- 長期的なクレジット割り当てのホライゾン(Long Credit-Assignment Horizons): タスクレベルの疎な報酬(最後に行われる成功または失敗)から学習する場合、長いシーケンスにわたって信号を伝播させる必要があり、困難なベルマン・バックアップを伴う。
- データカバレッジ: オフラインデータセットは、長い軌道中に遭遇する多様な状態・行動のペアを十分にカバーしていないことが多く、時間差(TD)学習を信頼できないものにする。
- 脆弱性(Brittleness): 効果的な価値学習がなければ、ポリシーは、進展をもたらすアクションと失敗につながるアクションを区別できない。これは、特に精密さが求められるタスクや多段階のタスクにおいて顕著である。
既存の手法は、モンテカルロ収益(データ分布を超えたポリシー改善を制限する)を用いてTD学習を回避するか、あるいは全タスクホライゾンにわたるTD学習に依存しているが、後者はエラーの累積という問題に悩まされる。
手法: SeeQ (Subtask-elicited Q-functions)
著者らは、タスク全体ではなく、現在アクティブなサブタスクに焦点を当てることで学習ホライゾンを短縮する、汎用Q関数を学習するためのフレームワークであるSeeQを提案する。
コアアーキテクチャと学習
SeeQは、事前学習済みの視覚言語モデル(VLM)バックボーン(具体的には3BのPaliGemmaモデル)を活用し、2段階の学習プロセスを導入している:
- 汎用的な事前学習: モデルは、サブタスクのアノテーションを含む多様なオープンソースのロボット操作データセット(例:RoboCOIN)を用いて事前学習される。この段階では、様々なエンボディメント(形態)におけるタスクの進行状況とアクションの条件付けに関するモデルの理解を正則化する。
- ダウンストリームのファインチューニング: モデルは、特定のターゲットタスクに対してファインチューニングされる。
主要な技術的革新
- サブタスクレベルの価値予測: Q関数は、最終的なタスク完了への収益を予測するのではなく、アクティブなサブタスク()に対する期待収益を推定する。これにより、予測ホライゾンが短縮され、TD学習がより安定し効果的になる。
- 自己回帰的なサブタスクデコーディング: テスト時に人間によるアノテーションや外部のサブタスク予測器を必要としないよう、Q関数のアーキテクチャを、自然言語でアクティブなサブタスクを自己回帰的に予測するように変更する。
- 学習中、モデルは正解のサブタスク・アノテーションに対する次トークン予測損失によって監督される。
- 推論時、モデルは現在の状態とタスク指示に基づいてサブタスクのテキスト()を生成し、その生成されたテキストに基づいて価値予測を行う。
- TD-BoN (Temporal-Difference with Best-of-N) 学習: 学習目的関数は、サブタスクレベルのTD学習と「Best-of-N」バックアップ戦略を組み合わせたものである。
- 候補となるアクションチャンクは、ベースポリシー()からサンプリングされる。
- ターゲット値は、個の候補の中で最も高い推定価値を持つアクションチャンクを用いて計算される。
- このアプローチは、学習時のバックアップをテスト時のステアリング手順と一致させ、Q関数がデータセット内に観察されたものよりも優れたアクションを評価することを可能にする。
- 境界を越えたブートストラップの排除: TDターゲットはサブタスクの境界を越えてブートストラップを行わない。アクションチャンクのホライゾン内にサブタスクが終了する場合、バックアップ項はゼロにされ、価値関数が厳密に現在のサブタスクの進行度を反映するようにする。
総損失関数は、サブタスクの価値に対するTD損失と、サブタスクのテキストに対する次トークン予測損失を組み合わせたものである:
テスト時の推論
展開時には、SeeQはBest-of-N選択を通じてベースポリシー()をステアリングする:
- 状態 とタスク指示 が与えられると、モデルはアクティブなサブタスク を自己回帰的に予測する。
- ベースポリシーが 個の候補アクションチャンクを提案する。
- Q関数は、、、および予測された に条件付けられた各チャンクのスコアを算出する。
- 最も高いスコアを持つアクションチャンクが実行される。
主な貢献
- サブタスクレベルの定式化: 長期的な価値学習を、短期的なサブタスクレベルの学習へと再定式化する手法を導入し、長期ホライゾンにおける疎な報酬の課題を効果的に回避した。
- 言語条件付きサブタスク推論: 自然言語でアクティブなサブタスクを明示的に予測する新しいアーキテクチャを導入し、テスト時にモジュール式のサブタスク予測システムや人間によるアノテーションを必要としないようにした。
- 汎用的な事前学習戦略: 多様なロボットデータでVLMバックボーンを事前学習することが、堅牢なアクション条件付けを学習し、ダウンストリームのファインチューニング中に特定の画像特徴への過学習を抑えるために極めて重要であることを示した。
- 実証的検証: 2つのロボットプラットフォームを用い、変形物体、精密な位置合わせ、多段階の協調を伴う4つの実世界の二腕操作タスク(シャツ掛け、蓋閉め、食料パッキング、レゴ分解)において広範な評価を行った。
結果
著者らは、変形物体、精密な位置合わせ、多段階の調整を伴う4つの実世界タスクでSeeQを評価した。
- ポリシー・ステアリング性能: SeeQは、すべてのタスクにおいてベースポリシーの成功率を大幅に向上させた。
- シャツ掛け (Shirt-hang): 10/24 (41.7%) から 22/24 (91.7%) へ向上。
- 蓋閉め (Lid-sealing): 10/24 (41.7%) から 15/24 (62.5%) へ向上。
- 食料パッキング (Grocery-packing): 9/24 (37.5%) から 17/24 (70.8%) へ向上。
- レゴ分解 (Lego-disassembly): 5/24 (20.8%) から 10/24 (41.7%) へ向上。
- 全体として、平均成功率は35.4%から66.7%へと増加した(1.88倍の向上)。
- アブレーション研究:
- 事前学習: ロボットデータの事前学習を除去すると、パフォーマンスが大幅に低下した(シャツ掛けにおいて22/24から8/24へ)。これは、汎用化のために多様なデータが必要であることを強調している。
- サブタスク条件付け: サブタスクを明示的にデコードし、それに条件付けることが極めて重要であった。サブタスク予測を除去すると、ベースポリシーを下回る性能(8/24)となり、予測のみを行い条件付けを行わない場合は15/24となった。完全なSeeQは22/24を達成した。
- ベースラインとの比較: SeeQは、タスクレベルのモンテカルロ回帰、タスクレベルのTD学習、および(データセット内のアクションを使用する)サブタスクレベルのSARSAを上回った。
意義と主張
本論文は、汎用Q関数を学習する際、疎な長期的な成功信号よりも、サブタスクレベルの価値がより効果的な学習ターゲットとなることを主張している。操作タスクを中間的なマイルストーンへと分解する性質を利用することで、SeeQは長期ホライゾンに伴うエラーの累積を伴わずに、効果的なTD学習を可能にする。
著者らは、タスクをサブタスクに分解できる限り、最小限のファインチューニングで新しいタスクに適用可能な汎用的な価値学習が可能であることを強調している。サブタスクを予測するために言語を明示的に使用することは、価値推定をVLMのテキスト生成能力と一致させ、サブタスクの遷移付近での堅牢性を向上させる。
本研究は、大規模なロボットデータを用いた多様な事前学習を活用する場合、短期的な学習目的と言語構造化された推論を組み合わせることが、より堅牢な長期的なロボット操作への有効な道筋であることを示唆している。著者らは、サブタスク境界の曖昧さや、ベースポリシーの候補アクションの質への依存といった限界を認めているが、彼らのフレームワークが複雑な実世界のロボティクスをより実用的なものにするための重要な一歩であると考えている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。