← 最新の論文
🤖 machine learning

PriorZero: Bridging Language Priors and World Models for Decision Making

PriorZero は、モンテカルロ木探索の根において LLM のガイダンスを注入して焦点を絞った探索を実現し、かつ世界モデルの学習と LLM の適応を分離して安定した微細なクレジット割り当てを可能にすることにより、静的な大規模言語モデルの事前知識と動的な世界モデルの間のギャップを埋める統合フレームワークであり、これによって長期的タスクにおける意思決定の効率性と性能を大幅に向上させる。

原著者: Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、非常に頭が良く、読書家である図書館司書(LLM)に、『Zork』や『Detective』のような複雑なテキストベースのアドベンチャーゲームの遊び方を教えるところを想像してみてください。その司書は、世界、物語、論理について多くの知識を持っていますが、実際にゲームをプレイしたことは一度もありません。彼らは特定のルール、隠された罠、あるいはゲーム世界があらゆる動きにどう反応するかを知りません。

論文PriorZeroは、この司書を狂わせたり、すでに知っていることを忘れさせたりすることなく、ゲームの遊び方を教える新しい方法です。

以下に、問題と解決策を簡単なアナロジーを用いて解説します。

問題:「知」と「行」のギャップ

著者らは、司書の知識とゲームプレイを組み合わせる既存の方法が、主に以下の 2 つの点で失敗していることを発見しました。

  1. 「静的なガイド」の問題: 司書に一般的な知識に基づいて何をすべきか尋ねるだけだと、論理的には正解であっても、実際にはゲーム内の罠である回答を返す可能性があります。彼らは「ドア」が通常どう機能するかは知っていますが、ゲーム内の「この特定のドア」が底なしの穴につながっていることは知りません。彼らはゲームの特定のルールに対して「盲目」なのです。
  2. 「無限の試行錯誤」の問題: 司書にゲームを何千回もプレイさせ、失敗するたびに修正する(これを「ファインチューニング」と呼びます)ことで教えようとすると、大惨事になります。ゲームは宝箱を見つけるような報酬をほとんど与えないため、司書は混乱します。彼らはランダムに推測し始めたり、ゲームの特定のルールがあまりにも奇妙であるため、優れた一般的な知識を「忘却」してしまったりするかもしれません。

解決策:PriorZero

PriorZero は、司書の一般的な知恵と、専門的な「ゲームシミュレーター」(World Model と呼ばれます)の間の架け橋として機能します。これは 2 段階の戦略を使用します。

1. 「ループリアン注入」(賢いスタート)

司書とゲームシミュレーターが、巨大な決定木(MCTS と呼ばれます)を使って次の手を一緒に計画しているところを想像してください。

  • 従来の方法: 司書は未来の経路のすべてのステップを推測しようとします。これは遅く、かつ司書がゲームの物理法則を知らないため、しばしば誤りになります。
  • PriorZero の方法: 司書は最初のステップ(木の根元)でのみ助言を与えます。「私の知識に基づくと、へ進むのが良さそうだ」と言うのです。
  • シミュレーターの役割: 司書が「北」と提案すると、ゲームシミュレーターが引き継ぎます。それは、その提案から始まる数千の可能な未来をシミュレートし、それが実際に宝につながるのか、それとも罠なのかを確認します。司書は深いシミュレーションには干渉しません。彼らがするべきことは、明らかに悪い経路を探す時間を浪費させないよう、検索を正しい方向へ導く手助けをすることだけです。

アナロジー: 司書を、街の歴史を知っている観光ガイドだと考えてください。彼らはあなたを「歴史地区」(根元)へと案内します。そこに着くと、GPS(World Model)が引き継ぎ、ガイドが知らない渋滞を避けて、通りの正確で最速のルートを計算します。

2. 「交互トレーニング」(安全なレッスン)

これが、司書の脳を壊すことなく、より良くする方法を教える方法です。

  • フェーズ A(シミュレーターが学ぶ): まず、ゲームシミュレーターがゲームをプレイし、ルール、報酬、そしてあらゆる行動の結果を学びます。それは未来を予測することに非常に優れるようになります。
  • フェーズ B(司書が学ぶ): シミュレーターが賢くなると、それは厳格だが公平な教師として振る舞います。「あなたは『北』を提案しましたが、それがどれだけの報酬につながったか、ここにあります」と伝えます。シミュレーターがすでに難しい計算を済ませているため、フィードバックは明確で混乱しません。司書はこの具体的なフィードバックから学びます。
  • サイクル: 彼らは交互に行います。シミュレーターが賢くなり、次に司書を教え、次に司書が賢くなり、それがシミュレーターにより良い探索を可能にし、というように続きます。

アナロジー: 何百万回もゲームをプレイしてきたチェスコーチ(シミュレーター)を想像してください。コーチは、生徒(司書)がランダムにプレイしてイライラさせる代わりに、生徒のためにゲームをシミュレートします。コーチは「ここで動けば、5 手以内に勝てる」と言います。生徒は、自分自身でゲーム全体をプレイしてストレスに耐えることなく、その手の価値を学ぶことができます。

結果

著者らは、この手法を 2 種類のゲームでテストしました。

  1. テキストアドベンチャー(Jericho): コマンドを入力して世界を探索するゲーム。
  2. グリッドワールド(BabyAI): グリッドを移動してオブジェクトを見つけるゲーム。

何が起こりましたか?

  • PriorZero は、司書だけ、あるいはシミュレーターだけを使用した方法よりも速く学習しました。
  • 長期的には、より高いスコア(より多くの宝を見つけること)を達成しました。
  • エージェントが同じ部屋を行き来して立ち往生する「デッドループ」の問題を解決しました。司書の初期ヒントが、シミュレーターがこれらのループから抜け出すのを助けました。

まとめ

PriorZero はチームワークの戦略です。これは、LLM(司書)に、最も得意とすること、つまり共通感覚を使って良い出発点を提案することをさせます。また、World Model(シミュレーター)に、最も得意とすること、つまりそれらの動きの複雑な長期的な結果を計算することをさせます。これらを分離しつつ接続することで、司書をゲームエンジンに無理やり変えたり、ゲームエンジンを哲学者にしたりすることによる過ちを回避しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →