← 最新论文
🤖 AI

DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

本文介绍了 DungeonBench,这是一个用于评估《龙与地下城》战斗中战术推理能力的全面基准测试,它挑战前沿语言模型在单次遭遇以及跨多日遭遇中,应对复杂规则、几何空间及资源管理的各种能力,并揭示了它们在平衡即时战术优势与长期战略可持续性方面存在的显著差距。

原作者: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何玩游戏。长期以来,科学家们一直擅长教机器人玩那些规则简单、目标明确的游戏,比如在网格上移动棋子或射击目标。但有一种特殊的思维方式要难教得多:战术推理。这不仅仅是了解规则,而是理解这些规则是如何相互“碰撞”的。这就像是不仅知道你可以跳跃,还知道如果现在跳,可能会落在让你会打滑的水洼里,或者稍后跳跃才能在计时器结束前拿到强化道具。这种思维需要同时处理几何(物体在哪里)、时机(事情何时发生)以及稀缺资源(如有限的能量或弹药)。科学家之所以关注这一点,是因为如果我们能教会计算机进行这种复杂的、“如果……会怎样”的选择,我们就离构建能够解决现实世界中复杂且相互关联问题的 AI 更近了一步。

于是,DungeonBench 应运而生,这是一个旨在测试人工智能是否真的能掌握这种混乱且规则密集的思维方式的“测试赛道”。研究人员基于著名的桌面游戏《龙与地下城》(Dungeons & Dragons)构建了一个数字模拟器,但他们剥离了叙事成分和人类地下城主(DM)。相反,他们创建了一个严格的、数学化的战斗版本,其中每一个动作、法术和怪物能力都是硬编码的规则。他们不仅仅要求 AI 赢得一场战斗;他们要求它在充满多次战斗的整个“冒险日”中生存下来——因为在第一场战斗中过度使用魔法,可能会导致团队在最后的战斗中束手无策。

该论文测试了当今最聪明的 AI 模型(如 GPT-5.5 和 Gemini 3.1 Pro),看它们是否能表现得像一位经验丰富的地下城主。实验设置非常公平:AI 能看到整个战场,了解所有规则,并拥有一份合法的动作列表供其选择。任务是从数百个选项中挑选出最佳动作,同时考虑诸如“如果我在这里施放火球术,会击中 Boss 但同时也烧到我的队友吗?”或者“我应该现在就使用治疗药水,还是留着它来快速结束这场战斗?”之类的问题。

结果呈现出一种惊人的技能与滑稽的失败并存的状态。当 AI 面对单场战斗(“遭遇战”赛道)时,顶尖模型表现相当出色,胜率约为 82% 到 83%。它们足够聪明,能够做好定位并有效地使用法术。然而,当研究人员将这些战斗串联成完整的一天(“全天”赛道)时,AI 的表现大幅下滑。在这种更难的模式下,表现最好的模型也仅能完成 40% 的全天挑战,甚至有一个模型连一天都没能闯过。

它们为什么失败了?论文指出,虽然这些 AI 非常擅长处理“此时此刻”,但它们在资源预算方面表现挣扎。它们倾向于在第一场简单的战斗中使用最强的法术和生命药水,导致在最后的强力 Boss 面前空手应对且血量低迷。它们赢得了战斗,却输掉了战争。研究人员发现,尽管 AI 能够预先看到整个战斗日程,但它无法想出如何为以后保留力量。

简而言之,DungeonBench 表明目前的 AI 在遵循规则和做出局部决策方面做得非常好,但在长期战略方面仍未完全掌握。这就像是一个能在单局比赛中通过诡计取胜的棋手,却在整个锦标赛进行过程中不断耗尽自己的棋子。论文总结道,虽然我们正在取得进展,但距离 AI 真正像一个懂得何时收敛、何时出击的战术天才那样思考,还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →