← 最新の論文
🤖 AI

Towards Zero-Shot Task Transfer with Neurosymbolic World Models

本論文は、構造化された記号的コンポーネントを用いて観測の再構成と報酬予測を分離するニューロシンボリック・ワールドモデルを導入するものであり、これにより、さらなる環境との相互作用を必要とせずに新しい報酬関数へのゼロショット適応を可能にし、純粋なニューラル手法と比較して優れた汎化性能を実証している。

原著者: Isidoro Tamassia, Lennert De Smet, Giuseppe Marra

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Isidoro Tamassia, Lennert De Smet, Giuseppe Marra

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能エージェントが、まるで歩き方を学ぶ子供のように、複雑な世界をナビゲートすることを学習している様子を想像してみてください。機械学習の分野において、これらのエージェントはしばしば「世界モデル」に依存します。これは、特定の行動をとったときに次に何が起こるかを予測することを可能にする、内的なメンタルマップです。これらのエージェントは、頭の中で将来のシナリオをシミュレーションすることで、現実の世界で物理的にあらゆる可能性を試すことなく、動きを計画することができます。このアプローチは非常に強力となり、ビデオ映像のような高次元の感覚データから学習することで、コンピュータがゲームをマスターしたりロボットを制御したりすることを可能にしてきました。しかし、大きな障害が依然として残っています。それは、これらのメンタルマップの多くが、単一の特定の仕事のために構築されていることです。もし目標が変われば(例えば、赤いドアに向かうことから青いドアに向かうことへ)、エージェントは世界の理解を最初から学び直さなければならないことがよくあります。なぜなら、その内的なマップは、トレーニング中に追い求めていた特定の報酬と密接に結びついているからです。

ベルギーのルーヴェン・カトリック大学の研究者たちは、この硬直性を解決するための新しいアプローチを開発し、即座に新しい目標に適応できるシステムを作り上げました。彼らの研究は、「ニューロシンボリック(神経記号的)」な世界モデルという、パターンの認識能力を持つニューラルネットワークと、明確で論理的な構造を持つ記号的推論を組み合わせたハイブリッドシステムを導入しています。単一の、絡まり合った環境表現を学習する代わりに、これらのモデルは、環境の生の感覚的な詳細と、成功を決定づける高レベルの事実を分離して学習します。この分離により、エージェントは世界がどのように動き、変化するかという理解を維持したまま、何が「勝利」にあたるかというルールを単に入れ替えるだけで済むようになります。その結果、エージェントは複雑な環境を一度学習すれば、基本となる事実を用いて目標を再定義するだけで、全く新しいタスクにその知識を適用できる、すなわち「ゼロショット転移」と呼ばれる能力を獲得します。

核心となる革新は、モデルの情報処理方法にあります。従来の世界モデルは、人間にとって解釈が難しく、再利用も困難な、圧縮された抽象的なバージョンの世界を学習します。対照的に、この新しいニューロシンボリックモデルは、エージェントの座標や物体の位置といった、状態に関する具体的かつ構造化された特性を特定し、予測することを強制します。これらの特性は架け橋として機能します。モデルはニューラルネットワークを使用して、乱雑で視覚的な世界を理解し、それを明確な記号的事実へと翻訳します。一旦モデルがこれらの事実を把握すると、それとは別の論理的コンポーネントを使用して報酬を予測します。報酬の予測はこれらの明確な事実のみに依存するため、研究者が報酬関数を別の目標を対象とする新しいものに置き換えるだけで、モデルは即座にそのための計画を立てられるようになります。エージェントは新しい目標を目にする必要も、それを試す必要もありません。単に、同じ内的なマップを用いて、新しいルールに基づいたメンタルシミュレーションを再実行するだけなのです。

このアイデアをテストするために、研究者たちはグリッドベースのナビゲーション・タスク(エージェントが目標を見つける必要がある)、連続的な動きを伴う3D版の同様のタスク、そして箱を特定の場所に押す必要があるソコバンというパズルゲームを含む、いくつかの異なる環境でモデルを訓練しました。これらの訓練フェーズにおいて、エージェントは移動しながら特定の目的(例えば、固定された目標地点に到達すること)を達成する方法を学習しました。その後、研究者たちは、環境の移動ルールは全く同じであるものの、目標が変化した新しいタスクでモデルに挑戦しました。あるシナリオでは、目標が別の部屋に移動したり、別のシナリオでは、単一の点ではなく特定の物体の配置に到達する必要があったりしました。モデルは、現実の環境とのさらなる相互作用なしに、これらの新しい目的へと適応することができました。これらは、頭の中で可能性を探る探索アルゴリズムを用いて新しい経路を計画するか、あるいは内部シミュレーション内で意思決定ポリシー全体を洗練させるかのいずれかの方法によって達成されました。

結果は、このアプローチが機能するだけでなく、標準的な手法よりも効率的に機能することも示しました。ニューロシンボリックモデルは、より少ない例で訓練タスクを学習しており、これは情報の構造化された処理方法が、環境をより速く把握するのに役立っていることを示唆しています。さらに重要なことに、新しいタスクに直面した際、それらは即座に適応しました。従来のモデルでは、新しい目標を把握するために再学習の期間や膨大な量の新しいデータが必要でしたが、ニューロシンボリックエージェントは、既存の世界に関する知識を新しい目標に適用するだけで済みました。これは、訓練中にこれらの記号的事実に関する部分的な情報しか提供しなかった場合や、それらの事実に対する直接的な教師あり学習を全く行わず、モデル自体の構造に学習をガイドさせた場合でも当てはまりました。

この研究は、より柔軟で再利用可能な人工知能に向けた重要な一歩を示しています。世界がどのように機能するかという理解と、エージェントが達成しようとしている特定の目標を切り離すことで、研究者たちは、専門化されたツールというよりも、汎用的な学習者のように振る舞うシステムを作り上げました。エージェントは単に目的地への経路を暗記するのではなく、地形と移動のルールを学習するため、その地形内で定義されたあらゆる目的地へとナビゲートすることができるのです。このシステムは、新しい目標が学習された一連の高レベルな事実を用いて記述可能である必要がありますが、タスクが変わるたびにコストのかかる再学習を行う必要性は取り除かれます。これは、インテリジェントなシステムが動的な環境に配戦され、新しい課題が生じた瞬間に、単に「何を探すべきか」を教えられるだけで、それを見通す方法を学び直すことなく対処できる未来を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →