← 最新の論文
🤖 AI

DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

本論文は、Dungeons & Dragonsの戦闘における戦術的推論を評価するための包括的なベンチマークであるDungeonBenchを導入するものであり、これは、単発の遭遇および複数日にわたる遭遇の両方において、複雑なルール、幾何学、およびリソース管理をナビゲートすることを最先端の言語モデルに要求し、即時的な戦術的優位性と長期的な戦略的持続可能性とのバランスを取る能力における重大な欠落を明らかにしている。

原著者: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにゲームの遊び方を教えようとしている場面を想像してみてください。長い間、科学者たちは、グリッド上で駒を動かしたり的に向かって撃ったりするように、ルールが単純で目標が明確なゲームにおいて、ロボットに教えることに長けてきました。しかし、教えるのがはるかに難しい特別な種類の思考があります。それが「戦術的推論」です。これは単にルールを知っていることではありません。ルール同士がどのように「衝突」するかを理解することです。それは、「ジャンプできる」と知っていることと、「今ジャンプすると、滑ってしまう水たまりに着地してしまうかもしれない」あるいは「後でジャンプすれば、タイマーが切れる前にパワーアップアイテムを掴めるだろう」ということを知っていることの違いです。この種の思考には、幾何学(物事がどこにあるか)、タイミング(物事がいつ起こるか)、そして乏しいリソース(限られたエネルギーや弾薬など)を同時に扱うことが求められます。科学者がこれを重視するのは、コンピュータにこうした複雑で「もし〜だったら」という選択肢を扱えるようにすることができれば、あらゆるものが相互に関連し、決して単純ではない現実世界の課題を解決できるAIの構築に近づけるからです。

そこで登場したのが、人工知能がこのような、ルールが入り組んだ泥臭い思考を本当にマスターできるのかを検証するために設計された新しい「テストコース」、DungeonBenchです。研究者たちは、有名なテーブルトークゲームである『ダンジョンズ&ドラゴンズ』に基づいたデジタルシミュレーターを構築しましたが、そこからストーリーテリングや人間のゲームマスター(審判)の要素を削ぎ落としました。その代わりに、あらゆる動き、呪文、モンスターの能力がハードコードされたルールとなっている、厳格で数学的な戦闘バージョンを作成しました。彼らは単にAIに一つの戦闘に勝つことを求めたのではありません。最初の戦闘で魔法を使いすぎると、最後の戦闘でチームが無力になってしまうかもしれないといった状況を含め、複数の戦闘が続く「冒険の一日」を生き延egきることを求めたのです。

この論文では、現在利用可能な最もスマートなAIモデル(GPT-5.5やGemini 3.1 Proなど)を用いて、それらが熟練したダンジョンマスターのように振る舞えるかどうかをテストしています。セットアップは公平です。AIは戦場全体を把握し、すべてのルールを知っており、選択可能な合法的な手の一覧を持っています。タスクは、例えば「ここでファイアボールを放ったら、ボスに当たる一方で仲間を焼き尽くしてしまうのではないか?」や「今、回復ポーションを使うべきか、それともこの戦闘を早く終わらせるために取っておくべきか?」といったことを考慮しながら、数百ある選択肢の中から最善の一手を選ぶことです。

結果は、目覚ましいスキルと滑稽な失敗が混在したものとなりました。AIが単一の戦闘に直面したとき(「エンカウンター」トラック)、トップモデルは非常に優秀で、約**82%から83%の確率で勝利しました。彼らは位置取りを適切に行い、呪文を効果的に使うことができました。しかし、研究者がこれらの戦闘を繋ぎ合わせて一日の流れにしたとき(「デイ」トラック)、AIのパフォーマンスは急落しました。このより困難なモードでは、トップモデルでも一日の行程をクリアできたのはわずか40%**であり、一つのモデルに至っては一日たりともクリアできませんでした。

なぜ失敗したのでしょうか?論文は、これらのAIは「今、ここ」については非常に優れているものの、「リソースの予算管理(配分)」に苦労していることを示唆しています。彼らは最初の簡単な戦闘に勝つために、最強の呪文や回復ポーションを使い切ってしまう傾向があります。その結果、手元には何も残らず、体力も減った状態で、最後にある手強いボスを迎えることになります。彼らは戦闘には勝ちますが、戦争には負けるのです。研究者たちは、たとえAIが将来のスケジュールをすべて事前に把握していたとしても、力を温存する方法を見つけ出すことができなかったことを発見しました。

要するに、DungeonBenchは、現在のAIがルールの遵守や局所的な意思決定には非常に長けているものの、長期的な戦略の術をまだ習得できていないことを示しています。それは、相手を騙して一局のチェスの試合には勝てるものの、トーナメントが終わる前に駒を使い果たしてしまうチェスプレイヤーのようなものです。この論文は、私たちは進歩しているものの、AIが「いつ引き、いつ攻めるべきか」を知っている戦術的天才のように真に思考できるようになるまでには、まだ長い道のりがあるという結論を下しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →