← 最新の論文
🤖 machine learning

VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching

本論文は、時間方向へのバックプロパゲーションや追加的なアルゴリズム上のオーバーヘッドを必要とせず、高密度な価値ベースのガイダンスを表現力豊かなフローマッチング・ポリシーに統合することで、多様な移動および操作タスクにおいて高い性能を達成する、スケーラブルなオフライン強化学習フレームワークであるValue-Guided Flow Matching (VGFM) を提案する。

原著者: Prajwal Koirala, Mark Campbell

公開日 2026-09-15
📖 1 分で読めます☕ さくっと読める

原著者: Prajwal Koirala, Mark Campbell

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長らく、反復的で予測可能なタスクの達人であり続けてきましたが、現実世界の混沌とした予測不可能な多様性に対処できるよう教え込むことは、依然として困難な課題のままです。長年、研究者たちは、ロボットに過去の動きの膨大なライブラリを読み込ませ、実世界で練習する必要なく人間のスキルを模倣できるようにすることを期待して、この問題を解決しようとしてきました。オフライン学習として知られるこのアプローチは、訓練において安全かつ効率的な経路を提供しますが、ロボットが訓練データとはわずかに異なる状況に遭遇すると、壁に突き当たります。ロボットはどのように行動すべきかを決定しなければなりませんが、複雑な交差点にいるドライバーが左折するか、直進するか、あるいは交通の隙間を縫って進むことができるように、多くの有効な動きの選択肢の間で判断を迫られます。従来の手法はこの豊かな選択肢の多様性を捉えるのが難しく、状況が変わると失敗してしまうような、単一で硬直した経路をロボットに強制してしまうことがよくありました。これらの限界を超えるために、科学者たちは、単一の行動ではなく、起こりうる幅広い行動のスペクトルを想像できる能力を持つ人工知能の一種である、生成モデルへと目を向けています。

核心となる困難は、これらの想像力豊かなモデルに対し、単に創造的であるだけでなく、賢明であるように教えることにあります。ロボットは、自分が想像した多くの行動のうち、どれが実際に成功につながるのかを知る必要があります。かつて、ロボットの想像力を良い結果へと導こうとする試みは、コンピュータがロボットの思考プロセスのあらゆるステップを後ろから辿り、どこで間違えたのかを確認しなければならないという、計算負荷の高いプロセスを必要としました。これは低速で不安定であり、しばしば訓練プロセスを複雑にしすぎてスケールを阻害しました。コーネル大学の研究者たちは、このボトルネックを完全に回避する「バリュー・ガイデッド・フロー・マッチング(Value-Guided Flow Matching)」と呼ばれる新しい手法を導入しました。この新手法は、コンピュータに時間を遡ってステップをやり直させる代わりに、ロボットが意思決定プロセスのあらゆる瞬間においてガイダンスを受け取れるようにし、その中間的な思考までもが成功へと導かれるように設計されています。

プレイヤー・コイララとマーク・キャンベル率いるチームは、ロボットのポリシー(動きの戦略)が、断絶されたジャンプの連続ではなく、連続的な流れとして構築されるシステムを設計しました。源泉から目的地へと流れる川を想像してください。ロボットは単純でランダムな動きのアイデアから始まり、それを徐々に特定の行動へと形作っていきます。ここでの革新は、システムが動きの終点だけでなく、川の経路上のあらゆる地点において、この行動の質をチェックすることにあります。各中間ステップにおいて動きの最終目的地を予測することで、システムは生成プロセス全体を解明する必要なく、「バリュー(価値)」信号(その行動がいかに優れているかの尺度)を適用できるのです。これにより、ロボットは生成プロセスを遡る重い計算コストを回避しながら、リアルタイムで行動の質を評価するクリティック(批評家)に導かれ、動きを継続的に洗練させていくことを学びます。

このアイデアをテストするために、研究者たちは、難易度の高い多様なタスクを含むOGBenchという標準的なベンチマークを用いて、このシステムを厳格な一連の挑戦にさらしました。これらのタスクは、四脚ロボットやヒューマノイドロボットを用いた複雑な迷路のナビゲーションから、ロボットアームによる物体の操作まで多岐にわたります。迷路のシナリオでは、ロボットは曲がりくねった廊下を通り抜ける必要があり、操作タスクでは、キューブを積み上げたり、散乱した環境の中で物体と相互作用したりすることが求められました。システムは過去の動きの静的なデータセットで訓練されており、つまり学習フェーズでは環境を一度も見ることなく、記録されたデータのみを見て学習しました。結果は驚くべきものでした。新しい手法は、これらほぼすべての多様なタスクにおいて、既存の最良の技術と同等か、それを上回る性能を一貫して示しました。AntMazeやHumanoidMazeの環境におけるナビゲーションで高い成功率を達成し、CubeやSceneの操作に求められる精密な動きにおいても優れた成果を上げました。

このアプローチの重要な特徴は、実際の使用時における柔軟性にあります。システムが一度訓練されると、エンジニアはモデルを再訓練することなく、一つの行動を生成するために使用する計算量を調整できます。研究者たちは、コンピュータが最終的な動きを計算するために踏むステップ数を増やすだけで、ロボットがより精密で複雑なタスクを実行できることを発見しました。このスピードと精度のトレードオフは、単純な状況では素早く動き、繊細な状況では慎重に動く必要がある実世界のアプリケーションにおいて極めて重要です。研究は、このスケーラビリティが時間の面でほとんど追加コストを伴わないことを示しており、意思決定の瞬間に、より多くの処理能力を使用するだけで、ロボットがより表現豊かで有能になれることを証明しました。

この手法の成功は、ロボット制御における新しい道筋を示唆しています。それは、安全性とデータの効率性の必要性と、複雑で適応可能な行動への要求とのバランスを取るものです。すべてのステップを後ろから辿るという重い計算負荷を取り除くことで、研究者たちは、これまで手の届かなかったレベルの表現力を持って、長く複雑な一連の行動を処理できるロボットを訓練することを可能にしました。このシステムは魔法や近道に依存しているのではなく、単にガイダンスがどのように適用されるかを再考したものであり、それによってロボットが意思決定の全行程を通じて、濃密なフィードバックの流れから学ぶことを可能にしています。ロボット工学の分野が、構造化されていない人間の環境で動作する機械へと突き進み続ける中で、このような手法は、可能性に満ちた世界の中から正しい行動を選択するという微妙な技術を教えるための、スケーラブルで効果的な方法を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →