Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
本論文は、インタラクティブなストーリーテリングにおける長期的一貫性を評価するために設計された100の物語環境からなるベンチマークであるNCP-Benchを紹介し、最先端のLLMであっても、制約のないユーザーの介入に対して論理的なコミットメントの保持と物語の完全性を維持することに著しく苦慮することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが、物語が決して終わることのない、巨大で果てしないロールプレイングゲームをプレイしているところを想像してみてください。そこでは、あなたは絶対的な自由を持って、あらゆることを行うことができます。ドラゴンにパンチを入れることも、王の冠を盗むことも、あるいは悪党を説得してパン屋にさせることもできるでしょう。これを可能にする魔法は、「大規模言語モデル(LLM)」と呼ばれる、超スマートなコンピュータの脳です。これらのモデルを、これまでに書かれたほぼすべての本を読み込んだ、非常に才能のある即興劇の俳優だと考えてください。彼らは自然に聞こえるようにすること、雰囲気を作り出すこと、そして会話の流れを維持することに長けています。しかし、一つ落とし穴があります。彼らは物語を構築するルールを「理解しているように聞こえる」ことには非常に優れていますが、実際にそのルールを「記憶しておく」ことには苦労することがよくあります。もしコンピュータが「ドアはロックされている」と言ったとしても、数分後には、まるで開いていたかのように、あなたがそのドアを通り抜けてしまうことがあったり、あるいはあなたがすでに鍵を見つけたことを忘れてしまったりするのです。これは、プレイヤーがどれほど突飛な行動をとったとしても、世界がリアルで一貫したものであることを望むゲームデザイナーやストーリーテラーにとって、大きな問題となります。
「Can LLM Agents Stick to the Script?(LLMエージェントは脚本を守れるか?)」と題されたこの論文は、まさにこの問題について深く掘り下げています。研究者たちは、AIのストーリーテラーが、長く混沌としたゲームセッションの中で約束を守り続けられるかどうかを検証するために、「NCP-Bench(Narrative Commitment Preservation Benchmark:物語へのコミットメント維持ベンチマーク)」という特別なテスト環境を作成しました。彼らは、『アイアンマン』や『ボーン・アイデンティティ』のような有名な映画のプロットに基づいた100通りの異なる物語の世界を設定しました。各世界において、AIは「ゲームマスター」として物語を進行させる役割を担い、もう一つのAIは「トラブルメーカー」のプレイヤーとして、物語をスキップしたり、ルールを破ったり、物語を不可能な方向へと強制的に進めようと試みます。目的は、ゲームマスターが、プレイヤーがゲームを壊そうとしているときでも、事実を把握し、起きたことを記憶し、プロットで要求される節目を守りながら、一貫性を保てるかどうかを確認することでした。
結果は、AIコミュニティにとって厳しい現実を突きつけるものでした。この研究では、最先端の高度なAIモデルであっても、物事が複雑になると、脚本を守るのが驚くほど下手であることを明らかにしました。これらのモデルは、美しく流暢で刺激的な物語を書くことはできますが、ゲームが長く続くにつれて、プロットを見失ってしまうことがよくあります。テストでは、最も優れたパフォーマンスを示したモデル(GPT-5.2のバージョン)であっても、わずか20ターン経過した時点で、論理的なエラーを起こさずに生存できたのはわずか42%でした。ゲームが進むにつれて、生存率は急激に低下しました。ゲームが100ターンの制限に達する頃には、ほとんどのモデルが、自分自身で矛盾を起こしたり、主要なプロットポイントを忘れたりすることなく、物語を完結させることができませんでした。
研究者たちは、最も一般的なミスは、AIが悪意を持っていたりプレイヤーを無視したりすることではなく、単に以前に確立した事実を忘れてしまうことであることを見出しました。失敗の40%から68%は「事実の衝突」であり、AIが以前に言ったことと直接矛盾する発言をするものでした。例えば、物語の中であるキャラクターが負傷していると設定されたにもかかわらず、AIが後にそのキャラクターが傷一つなくマラソンを走っている様子を描写するといったケースです。たとえAIが、プレイヤーが物語の退屈な部分をスキップすることを助けようとしたとしても、それはしばらの世界の論理を壊すような形で歴史を書き換えることによって行われることがよくありました。
興味深いことに、この論文では、より良く記憶するための「メモリ(記憶)」システムを備えた特殊な種類のAIについてもテストを行いました。このメモリシステムは、AIがゲーム内で少し長く生き残る助けにはなりましたが、問題を解決することはありませんでした。実際、メモリシステムは、AIが物語を大きな塊として要約することに忙しくなりすぎて、細かい詳細を見落としてしまうため、プレイヤーの具体的な行動に対して聞き分けが悪くなる(指示に従わなくなる)こともありました。この研究は、単にAIを賢くしたり、より多くのメモリを与えたりするだけでは不十分であることを示唆しています。私たちは、これらのモデルに対し、物語のルールを単なる「提案」ではなく、決して破ることのできない「絶対的な法則」として扱う方法を教える、新しい手法が必要なのです。
要約すると、この論文は、現在のAIストーリーテラーは即興を得意とし、格好よく聞こえることには長けているものの、長期戦を戦う能力については極めて低いと結論付けています。プレイヤーがルールを破ろうとしたとき、彼らは信頼できる形で脚本を守ることができません。著者たちは、このベンチマークを提供することで、他の研究者がこれらを修正するためのより良いツールを構築できるようにすることを期待しています。そうすることで、いつの日か、プレイヤーが何をしても世界が道理にかなった、真に無限で一貫性のある、魔法のようなインタラクティブな物語が実現することを願っています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。