← 最新の論文
🤖 machine learning

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCPは、視覚言語モデルを凍結したまま、マルチビュー観測に基づいてKKステップごとに自身のPython制御コードを動的に書き換えることでクローズドループ制御を可能にする、トレーニングフリーのロボット操作ポリシーを導入しており、エピソード内の失敗からのリカバリを通じて、オープンループのベースラインに対して10倍の成功率向上を実現している。

原著者: Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボット工学の世界には、コンピュータが理解できることと、実際に実行できることの間に存在する、根強い隔たりがあります。長年、科学者たちはロボットに動きの言語を教え込み、強力な人工知能モデルに新しい専門的な運動コマンドの語彙を学習させることで、この溝を埋めようと試みてきました。このアプローチには膨大な量の訓練データを必要とし、しばるとロボットから推論能力を奪い、状況を理解するのではなく、特定の動作を暗記させる結果を招きます。より最近のアイデアは、ロボットに新しい言語を教えるのではなく、ロボットがすでに最も得意としている言語、すなわちコンピュータ・コードを話させるべきであると示唆しています。AIに、ロボットの動き方を指示する短いプログラムを書かせることで、AIの推論能力を損なわずに済むのです。しかし、この手法の大きな欠点は、ロボットが動き始める前にプログラムが一度だけ書かれるという点でした。もしロボットが掴み損ねたり、何かにぶつかったりしても、プログラムは盲目的に実行され続け、その間違いを最後まで引きずってしまうのです。

新しい研究は、VLCPと呼ばれるシステムを紹介しており、作業中に自らの指示を書き換えさせることで、そのルールを変えています。研究者たちは、凍結された(学習済みの)事前学習済み人工知能モデルが監督者として機能するフレームワークを構築しました。最初に一連のコマンドを送る代わりに、このシステムは50ステップごとに一時停止し、カメラやセンサーを通じてロボットの現在の状況を確認します。そして、今見たものに基づいて、次の50ステップを処理するための新しい短いPython関数をAIに書かせます。もし前のフェーズでロボットが物体を掴むことに失敗した場合、AIは画像の中からその失敗を察知し、アプローチを修正するための新しいコードを書き、同じ試行の中で再び挑戦します。これにより、単にロボлоットの動きを調整するのではなく、制御ソフトウェア自体がリアルタイムで編集されるという、クローズドループが作成されます。

研究者たちは、単純な物体のピックアップから、キッチンやリビングルームの設定における複雑な一連の動作に至るまで、57種類の異なるタスクを含むシミュレーション環境でこのシステムをテストしました。彼らは、この手法を、最初に一度だけコードを書き、二度と振り返らないバージョンのシステムと比較しました。その差は歴然でした。進行しながらコードを書き換えるシステムは35%のタスクに成功しましたが、当初の計画に固執したシステムはわずか3%しか成功しませんでした。この10倍の向上は、テストされたすべてのシーンにおいて同様に見られました。この成功の鍵は、ロボットが自分の間違いを見ることができたことだけでなく、その間違いを引き起こした指示そのものを変更できたことにあります。ロボットが物体を掴むことに当初失敗したケースの約30%において、システムはエラーを検知し、アプローチを書き換え、同じ試行の中で後にアイテムを持ち上げることに成功しました。コードを編集する能力がなければ、これらの失敗は決定的なものとなっていたはずです。

このプロセスが実用的であることを確認するため、チームはどれほどの計算能力が必要かを測定しました。AIは毎回ほとんど同じ背景情報を再利用しているため、システムは毎回ごく少量の新しいデータのみを処理すればよいのです。これにより、ロボットは動作が遅くなったりコストが高くなったりすることなく、一つのタスク中に約10回、停止して考え、指示を書き換えることができました。また、この研究は、この手法がロボットに特定のフレーズや指示を暗記させることに依存していないことも示しました。研究者がタスクの説明の言い回しを変更しても、システムの性能は安定していましたが、訓練データに依存していた他のモデルは、言語がわずかに変わるだけで大幅に苦戦しました。これは、システムが単にパターンを一致させているのではなく、真に目標を理解していることを示唆しています。

研究者たちは、自分たちの結果が実世界の部屋における物理的なロボットではなく、コンピュータ・シミュレーションによるものであることを注意深く明記しました。現在のシステムは、物体の位置に関する完璧なデジタル情報に依存しており、これは実世界のカメラでは必ずしも確実に提供できるものではありません。さらに、AIが新しいコードを生成する時間は、このアプローチが瞬時の反応を必要としないタスクに適していることを意味します。こうした制限はあるものの、この研究は明確な進むべき道を示しています。AIをコードの言語に留め、発生しているミスを自ら修正できるようにすることで、ロボットは何千もの人間のデモンストレーションによる再学習を必要とせずに、より有能になることができるのです。この研究は、ロボット制御の未来が、機械に新しい動き方を教えることではなく、学習しながら自らの計画を編集する自由を与えることにある可能性を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →