← 最新の論文
🤖 machine learning

LpWM: A Case for Sparse Representations in World Models

本論文は、Rectified Distribution Matchingによって正則化された疎で非負の潜在表現を利用することで、従来の密な表現と比較して予測器の複雑さを大幅に軽減し、プランニングの成功率を向上させると同時に、解釈可能でモード分解された動的構造を明らかにする、結合埋め込み型予測アーキテクチャであるLpWMを導入するものである。

原著者: Yilun Kuang, Yash Dagade, Quentin Le Lidec, Lucas Maes, Randall Balestriero, Yann LeCun

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Yilun Kuang, Yash Dagade, Quentin Le Lidec, Lucas Maes, Randall Balestriero, Yann LeCun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

機械がいかにして世界の中を移動することを学ぶのかを理解するために、子供に部屋の歩き方を教える場面を想像してみてください。子供は単に静的な地図を暗記するのではなく、椅子を押したりドアを開けたりしたときに、部屋がどのように変化するかというメンタルモデル(精神モデル)を構築していきます。人工知能の分野では、このメンタルモデルは「ワールドモデル(世界モデル)」と呼ばれます。コンピュータが経路を計画したりタスクを実行したりするためには、現在の状態と自身が行うアクションに基づいて、次に何が起こるかを予測する必要があります。一般的な手法としては、複雑な視覚的世界を、「潜在空間」として知られる、より単純な内部的な数値の言語へと変換することが挙げられます。この隠れた空間において、コンピュータはこれらの数値を前方に進めることで未来を予測します。しかし、長年の課題となっていたのは、これらの内部表現がしばしば過度に「密(デンス)」になりすぎ、集合内のあらゆる数値が何らかの値を持ってしまうことで、予測タスクが非常に困難になり、エラーが起きやすくなることでした。

研究者たちは、この内部的な言語を構築するためのより優れた方法があるのではないかと、長い間考えてきました。もし、すべてのスロットに情報を詰め込むのではなく、ほとんどの数値がゼロであり、ごく一部の数値だけが意味を持つような「疎(スパース)」な言語を使用したらどうなるでしょうか。このアイデアは、システムに選択性を強制させることで、世界の変わり方を支配するルールがより学習しやすくなる可能性を示唆しています。これが、ニューヨーク大学、デューク大学、ブラウン大学などの機関の研究チームによる新しい研究で探求されている中心的な問いです。彼らは、これらの疎な表現を学習するように設計された「LpWorldModel」という新しいシステムを用いて、内部的な数値の幾何学的な構造がタスクの難易度にどのように影響するかを検証しました。

チームは、これらの疎な表現を学習するために設計された「LpWorldModel」という新しいシステムを導入しました。内部コードのあらゆる部分を活性化させることを推奨する従来の手法とは異なり、このシステムは、コード内のほとんどの数値が正確にゼロであり続けるように、特定の数学的な制約を使用しています。彼らはこのシステムを、ドットがドア口を通り抜ける単純なナビゲーション・タスクと、ロボットアームがT字型のブロックを目標地点まで押すという、より複雑な操作タスクという2つの異なる環境で訓練しました。より単純な環境では、内部コードが密であっても疎であっても、動きのルールが単純であったため、基本的な予測器でも対処可能であり、システムはうまく機能しました。しかし、結果はより困難な「押す」タスクにおいて劇的に変化しました。

研究者がさまざまな複雑さを持つ予測器を用いてシステムをテストしたところ、疎なアプローチが明確な優位性を持つことがわかりました。予測モデルが、密集して乱雑な表現を処理するには十分な強力さを備えていない「中程度の複雑さ」の範囲において、疎なシステムは、密なシステムが失敗した場面で成功を収めました。具体的には、押すタスクにおいて、中程度の容量を持つ予測器を使用した際、疎なシステムは密なシステムと比較して、計画の成功率を最大57パーセント向上させました。これは、情報を疎な形式に整理することで、システムが世界のダイナミクスをモデル化するために必要な複雑さを軽減できたことを示唆しています。密なシステムは複雑な相互作用の網を学習しなければならず苦戦しましたが、疎なシステムは、より単純で直接的な一連のルールに頼ることができました。

研究者たちは、疎な表現が驚くほど解釈可能な形で情報を整理していることも発見しました。システムは、世界の「モード(様態)」と、状態の具体的な詳細を自然に分離していました。エージェントがいるゾーンによって物理法則が変わるテスト環境において、システムは特定の数値の有無(サポート)を利用して、自分がどのゾーンにいるかを識別し、事実上、適用される物理学の種類を切り替えるスイッチとして機能しました。そして、ゼロではない数値の実際の値が、そのゾーン内におけるエージェントの正確な位置といった連続的な詳細を捉えていました。この分離により、システムは単なる変化するピクセルの塊としてではなく、世界のルールが変わったことを理解することができたのです。

ロボットアームが立方体と相互作用するより複雑なシナリオでは、疎なシステムは、アームが立方体に触れているかどうかといった、物体の物理的な状態を追跡できることがわかりました。しかし、追加のガイダンスがない場合、システムは、接触というより重要で緩やかな出来事よりも、アームのような最も速く動いている部分に焦点を当てる傾向がありました。そこで、システムが時間の経過に対して安定するように促す単純な制約を加えることで、焦点をシフトさせ、アームと立方体の間の接触を追跡させることに成功しました。これは、疎な表現が最も物理的に意味のある出来事を強調するように調整可能であることを示しており、内部コードを世界のダイナミクスの読み取り可能なマップへと変貌させたのです。

本研究は、疎な表現が、現在人工知能で使用されている密な手法に代わる強力な選択肢であることを結論づけています。システムに選択性を強いることで、研究者たちは、未来を予測するタスクを大幅に容易にし、より単純なモデルがより良い結果を達成できることを示しました。この知見は、内部言語の幾何学的な構造が極めて重要であることを示唆しています。疎で構造化されたアプローチは、密で非構造化されたものよりも、システムの背後にあるルールをより明確に明らかにすることができます。システムが正しい物理的イベントを追跡するためには、依然として注意深いチューニングが必要ですが、今回の結果は、疎性がより効率的で解釈可能なワールドモデルへの有望な道であり、マシンがより少ない計算能力で複雑な行動を学習することを可能にする可能性を示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →