← 最新の論文
💻 computer science

Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control

Enfoldは、世界生成モデルのマルチレベルな計算プロセスを、現在の視覚的および言語的な文脈のみから推論された予測表現へと蒸留する新しいフレームワークであり、将来の軌跡を各ステップで具現化する必要なく、将来の生成構造を内面化することで、エンボディド・エージェントが大幅に低減されたレイテンシで強力な制御を実現することを可能にする。

原著者: Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにサンドイッチの作り方を教える場面を想像してみてください。これまでのやり方は、ロボットに「水晶玉」を与えるというものでした。ロボットは手を一つ動かす前に、その水晶玉を使って、パンがスライスされ、チーズがパンの上に滑り込み、皿が置かれる様子までを描いた、高精細な未来のビデオ全体を生成していました。そして、このビデオを脳内ですべて見終えてから、次に何をすべきかを決めていたのです。それはまるで、ハンドルを切る前に、前方の道の全編映画を観て運転しようとするようなものです。強力ではありますが、非常に遅く、計算コストも膨大です。単に左に曲がるべきかどうかを決めるためだけに、ブロックバスター映画をレンダリングしようとしているようなものなのです。

この論文は、ロボティクスと人工知能の分野、特に「世界モデル(world models)」に焦点を当てたものです。世界モデルとは、本質的には、「次に何が起こるか」を予測することで物理的な世界の仕組みを学習するAIのことです。著者たちが試みている鍵となるアイデアは、「予測的表現(predictive representations)」です。これは、映画の台本を丸ごと暗記することと、物語の「ルール」を理解することの違いだと考えてください。グラスを落としたら割れるということを知るために、わざわざ映画を最初から見直す必要はありません。重力と脆さという物理法則を理解していれば済む話です。著者たちは大きな問いを投げかけています。「未来のフルビデオを毎回生成させることなく、ロボットに未来の『構造』を理解させることはできるだろうか?」と。

この論文は、Enfoldと呼ばれる新しい手法を紹介しています。名前は、未来を「展開する(unfolding)」ことと、その未来の知識を現在の中に「包み込む(enfolding)」ことの遊び心ある組み合わせです。ロボットが行動する前に未来のフルビデオを生成させる代わりに、Enfoldは「予測エンコーダー」に対し、その未来がどのように見えるかという「計算」を吸収することを教えます。

その仕組みはこうです。研究者たちは、未来を想像することに長けた強力な「教師」AI(ビデオ生成器)を使用します。この教師AIが起こりうる未来のビデオを処理する際、AIはシーン、物体、そして相互作用を整理しながら、多くの内部ステップを経由します。Enfoldはこれらの内部ステップを観察し、現在の画像とロボットへの指示のみを用いて、それらを予測することを学習します。それは、熟練のシェフが複雑な料理を作る様子を見ている生徒のようなものです。生徒は、サンドイッチを作りたいと思うたびに、毎回料理全体を一から作ろうとするのではなく、シェフの内部にある「筋肉の記憶」や「キッチンの論理」を学びます。彼らは、食事全体のシミュレーションを頭の中で行う必要なく、現在のフライパンの状態に基づいて次のステップを予測できるようになるのです。

論文によれば、このアプローチは速度と効率においてゲームチェンジャーとなります。テストにおいて、Enfoldロボットは、従来の最先端手法であるFast-WAMよりも3.7倍速く意思決定を行うことができ、最適化されたバージョンであるEnfold-Flashは10.1倍速い結果を出しました。これほど高速でありながら、賢さを失ったわけではありません。実際、複雑なタスクにおいて、あるベンチマークで97.8%、もう一つのベンチマークで**91.77%**の成功率を達成し、以前よりもわずかに優れたパフォーマンスを発揮しました。

極めて重要な点は、ロボットが知的に行動するためには、必ずフルビデオを生成しなければならないという考えに対し、この論文が異を唱えていることです。彼らは、未来をコンパクトな表現の中に「包み込む(enfold)」ことで、ロボットが変化する世界に適応できることを示しています。例えば、ロボットが皿を掴もうと計画している間に人間が皿を動かした場合、Enfoldは単にあらかじめ録画されたスクリプトを再生するのではなく、新しい現実に基づいて即座に未来を再計算し、行動を調整します。著者たちは、これがロボットが固定された経路を暗記しているのではなく、柔軟で予測的な世界の理解を学習していることの証拠であると示唆しています。

要するに、Enfoldは、ロボットを制御するために未来のすべてをレンダリングする必要はないということを示唆しています。私たちはただ、未来の「論理」をポケットに入れて持ち運べるように教えればよいのです。これにより、ビデオレンダリングという遅いプロセスを、電光石火の直感的な意思決定へと変えることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →