← 最新の論文
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

本論文は、「探索の崩壊(exploration collapse)」を、強化学習においてLLMエージェントが未知の環境で新しい解を発見する能力を失う主要な失敗モードとして特定し、報酬の最適化を行う前に、自己経験による状態および遷移予測を通じてエージェントを接地させることで性能を向上させる手法であるSPAを提案している。

原著者: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

公開日 2026-09-10
📖 1 分で読めます☕ さくっと読める

原著者: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

パズルを解いたり、仮想世界をナビゲートしたり、あるいはウェブブラウザを使用して情報を検索したりすることができる、人間のように考え行動するように設計されたコンピュータプログラムを想像してみてください。これらのプログラムは、大規模言語モデルとして知られており、インターネット上の膨大なテキストから学習し、文章の中で次にくる単語を予測することを学びます。研究者がこれらのモデルに、目標を達成するためにステップを踏む「エージェント」として振る舞うよう求める際、しばしば強化学習と呼ばれる手法が用いられます。これは、エージェントがさまざまな行動を試し、成功したか失敗したかのフィードバックを受け取り、成功につながる行動を繰り返すように徐々に学習していくプロセスです。これは、機械に対して、明示的にプログラムされていないことを教えるための強力な方法です。しかし、これらのエージェントを新しい、未知の状況に置いたとき、重大な問題が発生します。彼らは以前に見た特定のパズルを解くことはできるかもしれませんが、全く新しい環境をどのように探索すべきかを理解することに苦労することが多く、最善の解決策を見つけることを妨げるような、狭い思考の枠組みに陥ってしまいます。

ある研究チームは、なぜこれらの知的なエージェントが未知のものに遭遇したときに失敗するのかを理解しようと試みました。彼らは、「探索崩壊(exploration collapse)」と呼ぶ特定の現象を発見しました。簡単に言えば、エージェントが新しいタスクに対して訓練される際、しばしば成功へのたった一つの特定の経路を見つけ出し、それ以外の可能性を無視してしまうのです。エージェントは、その単一のルートに集中しすぎるあまり、異なるアプローチを試みる能力を失ってしまいます。研究者たちは、これを2つの異なるスコアを用いて測定しました。一つはエージェタの「最も優れた推測」が機能するかどうかを追跡するもの、もう一つは「多くの異なる推測」のいずれかが機能するかどうかを追跡するものです。慣れ親しんだタスクでは、学習が進むにつれて両方のスコアが向上します。しかし、箱を特定のターゲットに押し込む必要があるグリッドベースのパズルのような、新しく困難な環境では、単一の最善の推測のスコアはわずかに上昇しますが、多くの異なる経路を試すスコアは実際には低下します。エージェントは、より柔軟になるのではなく、悪い習慣に対して自信を深めているのです。これは、エージェントがその中の新しい世界のルールを真に理解していないために起こります。つまり、確固たる基礎を持たずに推測しているのです。

これを修正するために、研究者たちは「SPA(Self-Experience Agent:自己経験エージェント)」と呼ばれる新しい訓練方法を開発しました。エージェントに報酬を得る方法をすぐに教えるのではなく、まず、周囲の世界を理解する方法を教えました。彼らは、エージェントに報酬を得るというプレッシャーを与えることなく、自律的に環境を探索する機会を与えました。このフェーズにおいて、エージェントは自分が見ているものを記述し、特定の行動をとった場合に次に何が起こるかを予測することを求められました。例えば、もしエージェントが特定の場所に箱があるのを見て、それを押すと決めた場合、まず箱がどこにあるかを述べ、次にその箱がどこへ移動するかを予測しなければなりませんでした。研究者たちは、環境からの実際の正しい結果を用いて、エージェントの予測を修正し、事実上、その特定のゲームにおける物理法則を教え込みました。このプロセスにより、エージェントの精神の中に、一種の内部地図、あるいは「世界モデル」が構築されました。これにより、漠然とした推測ではなく、現実に根ざした理解が形成されました。

エージェントが世界の仕組みに関するこの内部理解を構築した後、研究者たちは、どのように勝つかを教えるための標準的な訓練プロセスを開始しました。結果は驚くべきものでした。箱をターゲットに押し込む必要がある「ソコバン(Sokoban)」というパズルゲームのテストでは、標準的な訓練方法ではエージェントの成功率は約25パーセントにとどまりました。しかし、この新しい方法を用いると、成功率は6割近くまで跳ね上がりました。凍った湖を扱う別のパズルでは、成功率は約22パーセントから70パーセント以上に向上しました。おそらく最も驚くべきことに、この方法で訓練された非常に小さなコンピュータモデルが、従来の標準的な方法で訓練された、より大きく強力なモデルを凌駕することができました。ゲームのルールを先に学んだその小さなモデルは、単に報酬に向かって推測を繰り返していた巨大なモデルよりも、複雑なパズルをより効果的にナビゲートすることができたのです。

研究者たちはまた、数独のような論理パズルや、家事を行うシミュレーション環境など、他の種類のタスクでもこのアプローチが機能するかどうかをテストしました。あらゆるケースにおいて、エージェントに勝利を試みる前に世界の状態を理解させる方法が、より良い結果をもたらしました。彼らは、成功の鍵は単に、より多くのデータを持つことや、より大きなコンピュータを持つことではなく、学習が行われる「順序」にあることを見出しました。エージェントに環境の構造を最初に学習させることで、単一の脆い戦略へと崩壊する罠を回避させたのです。エージェントは、自分の行動の結果を理解することで、選択肢を広げ続けることを学びました。このアプローチは、人工知能が真に新しく複雑な状況に適応するためには、成功のために最適化を図る前に、現実に対する信頼できる理解を構築する必要があることを示唆しています。この研究は、エージェントが環境の実際のメカニズムに根ざしているとき、より効果的に探索し、以前は手の届かなかった問題を解決できることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →