← 最新の論文
🤖 AI

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

本論文は、クローズドウェイトの基盤モデル(Gemini Robotics On-Deviceなど)を使用するヒューマノイドロボットが、デプロイ時の報酬フィードバックをAPIベースのポリシー改善のための教師ありデータへと変換することで、モデルの内部へのアクセスを必要とせずに純粋な模倣学習の限界を克服し、ほぼ完璧なタスク習熟を実現することを可能にする、非侵襲的なクローズドループ反復微調整手法であるCLIFTを紹介するものである。

原著者: Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはロボットに複雑なダンスを教えようとしていると想像してください。人工知能の世界には、これを行うための主に2つの方法があります。1つ目は「オープンソース」です。これは、ロボットの脳全体、コード、そして内部の配線までを手に入れることができ、ネジ一本に至るまで自分自身で微調整できる方法です。2つ目は「クローズドソース」です。これは、ロボットがブラックボックスである状態を指します。中を見ることも、配線に触れることも、コードを変更することもできません。あなたにできるのは、単に指示のリスト(例えば「このように踊って」など)をロボットに渡し、それに基づいて学習させることだけです。これは、現在利用可能な最も強力なロボットの脳における標準となりつつあります。それらは驚くほど賢いのですが、デジタルな扉の向こう側に閉じ込められているのです。

科学者たちが直面している大きな疑問は、「もしロボットの脳の中を覗き見ることができないとしたら、それでも難しい現実世界のタスクをマスターするように教えることはできるのか?」という点です。通常、中が見えない場合、目に見えるものを単に模倣すること(模倣学習)に限定されてしまいます。しかし、現実の世界は混沌としています。ロボットはビデオの中で人間を完璧にコピーしたとしても、もし床がぐらついていたり、滑りやすいコップがあったりすると、わずかな遅延や計算に入れられていない物理現象のせいで失敗してしまうかもしれません。真に優れたものになるためには、ロボットは練習し、失敗し、何が間違っていたのかを理解し、そして再び挑戦する必要があります。これは「クローズドループ学習」と呼ばれるプロセスです。課題は、「ロボットの内部にある学習メカニズムに触れることが許されていない状態で、どうやってロボットに自分自身のミスから学ぶように教えるか?」ということです。

CLIFTと題されたこの論文は、まさにその問題に取り組んでいます。研究者たちは、「Gemini Robotics On-Device」と呼ばれる強力でロックされたロボットモデルを、一度も「モデルの箱」を開けることなく、皿を積み重ねたり箱に詰めたりといった接触を伴う難しいタスクの達人に変えられるかどうかを検証したいと考えました。彼らは、単に人間のビデオをコピーする手法(教師あり微調整)は、他のオープンソースのロボットよりはるかに優れたものを作りましたが、現実世界の機敏さに対してはまだ完璧とは言えないことを発見しました。ロボットはしばしば物を落としたり、最後のステップで手こずったりしてしまうのです。

これを解決するために、チームはCLIFT(Closed-Loop Iterative Fine-Tuning:クローズドループ反復微調整)と呼ばれる巧妙なトリックを考案しました。これは、ゲームのコードを変更することはできないけれど、プレイヤーに教えることはできるビデオゲームのコーチのようなものだと考えてください。仕組みは以下の通りです。

  1. 練習走行: ロボットが現実世界でタスクを試みます。成功する場合もあれば、失敗する場合もあります。
  2. スコアカード: 単に「良かった」や「悪かった」と言う代わりに、特別なAI審判(報酬モデル)がビデオを観察し、動きのあらゆる微細なスライスに対してスコアを付けます。どの部分がスムーズで役に立ったのか、そしてどの部分がぎこちなかったり危険であったりしたのかを特定します。
  3. 魔法のラベル: チームは、これらのスコアが付いたビデオを新しいトレーニングレッスンへと変換します。彼らは良い部分には特別な「バッジ」(金メダルのようなもの)を付け、悪い部分には「警告」を付け加えます。
  4. レッスン: この新しいラベル付きのレッスンを、API(デジタルメニュー)を通じて、ロックされたロボットの脳へと送り返します。ロボットは、この新しいデータを用いて再学習を行い、「金メダル」を求め、「警告」を避けるように学習します。

研究者たちは、このサイクルを、フライホイールが回転してどんどん速くなっていくように、2回実行しました。結果は目覚ましいものでした。最後までには、ロボットはもはや単に人間をコピーするだけでなく、独自の巧妙な動きを編み出し始めました。例えば、箱に荷物を詰める際、ロボットは持ち上げる前に、より良いグリップを得るために指で箱を押し、回転させることを学びました。これは、人間の教師が一度も見せていない動きでした。ボトルをカップに入れようとする際、もし一度目に失敗しても、諦めてしまうのではなく、やり直すことを学んだのです。

この論文は、この「非侵襲的」な手法が素晴らしい効果を発揮したことを示しています。難しいタスク(皿の積み重ねやボトルの挿入など)において、ロボットの成功率は約50〜70%から、ほぼ100%へと跳ね上がりました。さらに驚くべきことに、彼らが同じトリックを、コードに触れることができたはずの別のオープンソースのロボットに対して試したところ、ロックされたロボットの方が優れたパフォーマンスを示しました。これは、非常に強力な事前学習済みの「脳」を持っていることの方が、コードへの完全なアクセス権を持っていることよりも重要であることを示唆しています。

要約すると、この論文は、ロボットの脳を壊す必要はないということを証明しています。現実世界の練習セッションをスマートなラベル付きレッスンに変えることで、ロックされたロボットを専門家へと導き、単純な「試行、採点、再学習」の反復ループを通じて、複雑な物理的タスクをマスターさせることができるのです。著者たちは、このアプローチによって、一度も「モデルの箱」を開けることなく、わずか2回のサイクルでロボットを完璧に近い習熟へと押し上げられることを見出しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →