← 最新の論文
💻 computer science

TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces

TraceFlowは、成功および失敗したロールアウトのトレースから得られるTraceBankに格納された進捗整合的な補正フィールドを活用することで、凍結されたフローマッチング・ロボット・ポリシーを強化するテスト時ガイダンス手法を導入し、モデルの重みの更新を一切必要とせずに、現実世界のパッキングおよび特定のシミュレーション・ベンチマークにおけるタスク成功率を大幅に向上させる。

原著者: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

公開日 2026-09-18
📖 1 分で読めます☕ さくっと読める

原著者: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

視覚を持ち、言語を理解し、複雑なタスクを完了するために腕を動かすことができるロボットは、もはやサイエンス・フィクションではなく、今日の研究所で構築されている現実です。これらの機械は、「ビジョン・ランゲージ・アクション・ポリシー」と呼ばれる一種のソフトウェアに依存しています。このポリシーを、カメラの映像を見、人間の指示を読み、次にどのような物理的な動きをするかを決定する「脳」だと考えてください。安全かつ信頼性を高めるために、エンジニアは多くの場合、トレーニングが終わった後にこれらの「脳」を「凍結(フリーズ)」させます。これは、ロボットが作業中に知っていることを誤って忘れてしまわないよう、内部設定を固定することを意味します。しかし、凍結された脳には盲点があります。もしロボットがタスク中にミスをしたとしても、その指示は固定されているため、その失敗を利用して直後の動きを変更することはできません。それは、ルートを完璧に暗記しているものの、突然路面の窪みを見つけたとしても、あらかじめ書かれた台本に手が縛られているためにステアリングを調整できないドライバーのようなものです。研究者が直面している課題は、どのようにすれば、脳全体を再学習させたり複雑な新しいセンサーを追加したりすることなく、ロボットにリアルタイムで自身のミスから学ばせるかということです。

香港大学と南方科技大学の研究チームは、この問題を解決するために「TraceFlow」と呼ばれる手法を開発しました。ロボットの凍結された脳を再学習させようとする代わりに、彼らは、過去の試行錯誤の単純な記録を用いて現在の行動を導く「一時的なガイド」として機能するシステムを構築しました。このシステムは、ロボットがタスクを試みるたびに、それが成功したか失敗したかを記録し、その過程で行った詳細な動きのログを保持することで機能します。ロボットが新しい試行を開始すると、TraceFlowは現在の状況を確認し、過去の類似した瞬間をログの中から素早く検索します。もし過去の試行が成功していたものが見つかれば、システムはロボットの現在の動きの計画を、以前うまくいった方向へと優しく引き寄せます。もし過去の試行が失敗していたものが見つかれば、その特定のミスから計画を遠ざけるように押し退けます。極めて重要なのは、このガイダンスには「境界(バウンド)」があることです。つまり、進路を修正するのに十分な強さでありながら、ロボットの核となる学習内容を上書きしない程度に弱く設定されており、機械の安全性と安定性を確保しています。

研究者たちは実世界の乱雑な部屋にあるロボットアームを用いてこのアプローチをテストし、テープを動かしてからキャビネットの上にハンマーを置くといった、特定のタスクのシーケンスを実行するよう求めました。ガイダンスシステムがない場合、ロボットは50回の試行のうち、全シーケンスを正しい順序で完了できたのはわずか21回であり、しばしば手順の順序を間違えました。TraceFlowが作動していると、ロボットは50回中39回成功しました。改善はさらに劇的で、研究者がロボットにもう一ラウンドのタスクを実行させ、その新しい成功と失敗をシステムにフィードバックさせた後、第2ラウンドでは、ロボットは50回中47回正しくシーケンスを完了し、手順の順序に関するエラーはゼロになりました。このシステムは、各過去の試行に対して成功または失敗を示す単一の「はい」または「いいえ」のラベルのみを使用しており、どこで具体的にミスが起きたかという複雑な分析を必要としませんでした。

コンピュータ・シミュレーションにおける結果はより限定的であり、この手法は手順の正しい順序を記憶する必要があるタスクや、新しい物体にスキルを転移させる必要があるタスクにおいて最も効果的であることを示しました。例えば、ブロックを積み重ねるシミュレーションでは、システムが自身の失敗から学習することを許可すると、成功率は約54%から62%へと上昇しました。しかし、研究者たちは、このガイダンスがすべてのタイプのタスクに役立つわけではないことも発見しました。ロボットが物体を数えたり、他の物の後ろに隠れているアイテムを見つけたりする必要がある場合、システムはパフォーマンスを向上させず、時にはわずかに悪化させました。これは、この手法が動作のシーケンスにおけるエラーを修正することには優れているものの、ロボットがそもそもシーンを見たり理解したりするために必要な情報が不足している場合には対処できないことを示唆しています。

この研究では、ロボットが自身の履歴からどの程度の期間学習し続けられるかについても調査されました。研究者たちは、各ラウンドの後に新しい経験をシステムに追加しながら、10ラウンドのタスクを実施しました。その結果、ロボットのパフォーマンスは最初は急速に向上しましたが、タスクに応じて第2ラウンドまたは第7ラウンドあたりで頭打ちになることが分かりました。これは、基礎となる脳を変更することなく、ロボットが自身の最近の履歴から得られる利益には限界があることを示しています。さらに、チームは、過去の成功と失敗の比率がシステムの性能を予測するものではないことも発見しました。ロボットは、記憶の中に失敗の方が成功よりも多い場合でも、自身の過去から学ぶことができるのです。この発見は、ロボットが過去から学ぶためには完璧な実績が必要であるという考えに疑問を投げかけるものです。

結局のところ、TraceFlowは、凍結されたロボット・ポリシーをより適応可能にするための実用的な方法を提供します。勝利と敗北の履歴に基づく単純な境界付きの修正を用いることで、ロボットはゼロから再学習することなく、複雑で順序立てられたタスクをより高い信頼性でナビゲートできます。研究者たちは、このアプローチが実機のハードウェア上で効果的に機能することを示し、手順の順序に苦戦していたロボットを、一連の動作を確実に完了できるロボットへと変貌させました。これは、特にカウントや隠れた物体に関するあらゆるロボットの課題に対する魔法の解決策ではありませんが、ロボットがその場でのミスから学ぶことを可能にすることで、現実世界におけるロボットの堅牢性を高めるための明確な道筋を示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →