Native Video-Action Pretraining for Generalizable Robot Control
LingBot-VA 2.0は、ロボットの身体性を念頭に置いてゼロから設計されたビデオ・アクション基盤モデルであり、セマンティックな視覚・行動トークナイザー、因果的事前学習、スパースなMoEバックボーン、および非同期推論スキームを特徴とし、現実世界の環境において堅牢で少数の事例による汎用的な制御を実現します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにビデオゲームの遊び方を教えようとしている場面を想像してみてください。今日、多くの人々は、超高性能な映画制作AIを用意し、そこに「左へ動く」や「拾う」といった追加のボタンをいくつか付け加え、「あとは自分でやり方を理解してくれ」と期待するという方法をとっています。しかし、この論文の著者たちは、それはまるで魚にサドルを載せるだけで自転車に乗れるように教えようとするようなものだと主張しています。それは、道具として間違っています。
その代わりに、彼らは物理的な世界がどのように動き、どのように反応するかを理解するためにゼロから設計されたロボットの脳、LingBot-VA 2.0を構築しました。これは、単なる「映画監督」ではなく、シーンを観察し、それが一瞬後にどのように変化するかを正確に予測し、その未来を実現するためにロボットが何をすべきかを正確に指示する「未来視」のコーチだと考えてください。
なぜ従来の方法ではうまくいかなかったのか
この論文は、現在の「ビデオ生成器の転用」というトレンドに対して明確に反対しています。これまでのモデルは、見た目がリアルに見えることを目的とした美しい映画を作るために訓練されてきました。それらは「双方向的」であり、過去を予測するために未来を見返すことができます。これは映画の編集には素晴らしいことですが、「今、目の前にあるもの」に基づいて行動しなければならないロボットにとっては最悪です。
著者らは、従来のアプローチには3つの大きな問題があることを発見しました。
- 美しすぎて、物理的ではない: 旧来のモデルは、ピクセルを綺麗に見せることに集中しており、「コップを押せば滑る」といった理解がありません。彼らは「原因と結果」を本当に理解していません。
- 遅すぎる: 本物のロボットは、1秒間に数百回考える必要があります。旧来のモデルは、ビデオフレームを「デノイズ(ノイズ除去)」して綺麗にするのに時間がかかりすぎ、ロボットの動作をフリーズさせたりラグを生じさせたりします。
- ルールを忘れる: 映画制作AIにロボットの動きを無理やり学習させようとすると、インターネット上の何十億時間もの動画から学んだ一般的な知識を忘れてしまうことがよくあります。
新しい秘訣:4つの魔法のトリック
これを解決するために、チームは4つの巧妙な設計原則を用いてLingBot-VA 2.0を構築しました。
1. 「意味のある翻訳者」(セマンティック・トークナイザー)
言葉だけでなく、文章の「感覚」をも翻訳する翻訳者がいると想像してください。従来のモデルはビデオを単なる小さなピクセルの塊へと翻訳していました。しかし、LingBot-VA 2.0は、ビデオを「何が」「どのように」動くのかを理解する、コンパクトで高レベルな要約へと翻訳する新しい「トークナイザー」を使用しています。これにより、ロボットの視覚を巨大な事前学習済み「ビジョン脳」と一致させ、「カップ」が単なる色の集まりではなく「カップ」であることを理解させます。決定的なのは、これが「潜在アクション(latent actions)」、つまり人間がすべての動きにラベルを貼らなくても、手でカップを掴む時の見えない力のような「二つの瞬間の間の変化」を表す秘密のコードを学習できる点です。
2. 「一方通行の道」(因果的事前学習)
映画の編集者は時間を前後に飛び越えることができます。しかし、ロボットはできません。著者らは、厳格な「一方通行(因果的)」の経路でモデルを訓練しました。モデルは過去から学び、未来を予測することだけを行います。彼らは単に古いモデルを微調整したのではなく、ウェブスケールのデータを用いてシステム全体をゼロから訓練しました。これにより、ロボットの脳は自然に「未来に向かって考える」ように配線され、後ろ向きのモデルを無理やり前向きに動かそうとした時に起こる「記憶喪失」を回避しています。
3. 「働き者のネットワーク」(スパースMoE)
飛んでくるボールを捕まえるのに十分な速さを実現するため、モデルは「混合エキスパート(Mixture of Experts: MoE)」バックボーンを使用しています。これは、巨大な図書館において、すべての司書がすべての本を読むのではなく、その仕事に必要な特定の専門家だけが呼ばれるような仕組みです。これにより、モデルは巨大でスマート(130億パラメータ!)でありながら、各ステップでは脳のわずかな部分(約19億パラメータ)だけを「起動」させることができます。これにより、知能を失うことなく、驚異的なスピードを維持できます。
4. 「水晶玉の推論」(フォサイト・リーズニング)
これが最もクールな部分です。通常、ロボットはコンピュータが思考を終えるのを待ち、次に動き、次にカメラの更新を待ち、再び思考します。これは遅すぎます。LingBot-VA 2.0は「フォサイト・リーズニング(先見的推論)」を使用します。ロボットが物理的に腕を動かして「タスクA」を実行している間に、コンピュータはバックグラウンドで既に「タスクB」を予測しています。
しかし、ここにはセーフティネットがあります。もしロボットの予測が現実からズレた場合(例えば、実際には床にあるのに、カップがまだテーブルの上にあると想像している場合など)、システムは最新の実際のカメラ画像を使用して即座に「再接地(re-grounding)」します。これは、窓の外を見て計器も同時にチェックしながら、現実が予測と一致しない場合に即座にコースを修正するパイロットのようなものです。
実際にどの程度機能するのか?
著者らは単にこれを夢想したのではなく、厳格にテストしました。
- 現実世界において: 彼らはラボにロボットを置き、果物の仕分け、ペンの回収、引き出しの整理などのタスクを行わせました。LingBot-VA 2.0は、従来の最高モデル(やオリジナルのLingBot-VAなど)を大幅に上回りました。例えば、「果物の仕分け」では、次に優れたモデルの成功率64%に対し、77%の成功率を記録しました。
- シミュレーションにおいて: 彼らはRoboTwinと呼ばれる複雑な両腕ロボットのシミュレーションでテストを行いました。そこで**93.6%**の成功率を達成し、他のすべての競合を打ち破りました。
- 速度: 彼らのスピードアップの技術により、ロボットはピーク時で225 Hzの頻度で意思決定が可能です。これは1秒間に200回以上であり、エアホッケーをしたり、落下する物体をキャッチしたりするのに十分な速さです。
- 学習の速さ: ロボットは非常に少ない例から新しいタスクを学ぶことができます。あるテストでは、わずか15回のデモンストレーションで皿やカップの整理を学習し、さらに人間のビデオを見るだけで(「インコンテキスト学習」と呼ばれる手法)、見たことがないオブジェクトの組み合わせにも適応することができました。
結論
この論文は、真に汎用的なロボットを構築するためには、古いビデオツールをロボットアームに継ぎ接ぎするだけでは不十分であることを示唆しています。私たちは、物理学を理解し、高速に動き、インターネット上の膨大なビデオと実際のロボットデータの両方から同時に学ぶことができる、新しい種類の「脳」を構築する必要があります。LingBot-VA 2.0は、ロボットが「速い思考」と「精密な実行」の両方を備え、わずかな指示だけで、現実世界の複雑な雑務に取り組めることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。