← 最新の論文
💻 computer science

Flex-π\pi: A Multi-Stream World-Action Model with Compute Flexibility

Flex-π\piは、凍結されたビデオ生成VAEを活用することで、RGBと共に3D幾何学およびオブジェクトのセマンティクスを暗黙的にエンコードし、新たなセンサーや事前学習を必要とせずに、現実世界の両手操作タスクにおいて優れた汎化性能と効率性を実現する、60億パラメータのワールドアクションモデルである。

原著者: Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

シャツの畳み方や壊れたおもちゃの直し方を学ぼうとしているロボットを想像してみてください。長い間、科学者たちはロボットにタスクの動画を何千本も見せることで、ロボットがその動きを単に「コピー」することを期待して教えてきました。しかし、これは車のダッシュボードのライトだけを見て運転を学ぼうとするようなものです。速度計が上がっていくことは見えますが、道路やカーブ、あるいは他の車については理解できません。 「ワールド・アクション・モデル(World-Action Models)」と呼ばれる、より新しくスマートなアプローチがこの問題を解決しようとしています。単にコピーするのではなく、これらのモデルは「次に何が起こるか」を予測しようとします。彼らは、「もし私がこのように腕を動かしたら、1秒後の世界はどう見えるだろうか?」と自問自答します。未来を推測することで、ロボットは物理法則や物体の相互作用を学び、膨大な数の例示を必要とせずに新しいタスクをこなす能力を向上させるのです。しかし、ほとんどの賢いロボットは、平らな2Dの画像(標準的なカメラのようなもの)しか見ていません。これは、何かの後ろに隠れているかもしれない3Dオブジェクトを掴もうとする際に、混乱を招くことがあります。

ここで、このパズルを解く巧妙なトリックを備えた新しいロボットの脳、FLEX-πが登場します。FLEX-πを、スープの味見をした瞬間に、たとえスプーン一杯の液体であっても、そこにどんなスパイスが入っていて、温度がどのくらいで、粘度がどの程度かを正確に言い当てることができるマスターシェフだと考えてみてください。過去には、ロボットに3Dの形状(奥行きなど)や物体の意味(「これはボールではなくカップである」など)を理解させるために、科学者たちは高価な3Dカメラを与えたり、全く新しい見方を教えたりしなければなりませんでした。しかし、FLEX-πは「フリーランチ(無料の昼食)」を発見しました。それは、平らな画像を理解するために使っているのと同じ脳が、追加のトレーニングや新しいハードウェアなしで、3D形状や物体の意味をもほぼ完璧に理解できるという事実です。

研究者たちは、3つのことを同時に予測するように学習する60億パラメータのモデル(非常に大きなデジタル脳)を構築しました。それは、次の画像がどのように見えるか、シーンの3D形状がどうなるか、そしてシーン内の重要なオブジェクトが何か、という3つです。魔法は、ロボットがこれら3つを同時に想像するように訓練された点にあります。もしロボットがカップの画像を見たら、単に平らな画像を見るのではありません。同時にそのカップの3Dの奥行きを想像し、それが「カップ」であることを理解します。さらに優れたことに、彼らはロボットに柔軟性を教えました。訓練中、彼らは時々3Dデータやオブジェクトの名前を隠し、平らな画像のみを使ってそれらを推測するように強制しました。これにより、実際にロボットが作業しているとき、カメラのみを使用して(3Dやオブジェクトのデータを無視して)「高速モード」で動作させても、依然として非常にスマートであり続けることができます。また、時間がある場合には、すべてのデータを使用して「スーパーモード」で動作させることも可能です。

結果は驚くべきものです。ドライバーを使って自分のグリッパーをミリ単位の精度で修理したり、柔らかくて形が変わるペンケースのジッパーを閉めたりといった、トリッキーなタスクを行う実機のロボットでテストした際、FLEX-πは既存の最高のロボット脳を大幅に上回り、時には2倍から7倍も優れた性能を発揮しました。FLEX-πは、人間がそのタスクを行う様子を何百回も見る必要はなく、非常に少ないデモンストレーションでこれらの複雑なスキルを習得しました。おそらく最も驚くべきことは、FLEX-πが「高速モード」に設定され、カメラのみを使用していた場合(学習した追加の3Dやオブジェクトのデータを無視している場合)でも、他のトップクラスのロボットよりも速く、かつ成功率が高かったことです。この論文は、ロボットに3Dと物体の意味を持って未来を想像させることで、新しいセンサーや速度低下を招くことなく、よりスマートで適応力の高いロボットにできることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →