Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
本文介绍了 NCP-Bench,这是一个包含 100 个叙事环境的基准测试,旨在评估交互式叙事中的长程一致性,并揭示了即使是尖端的语言大模型在面对不受约束的用户干预时,在维持逻辑承诺保留和叙事完整性方面也存在显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一场宏大的、无止境的角色扮演游戏,故事永不结束,你可以做任何你想做的事情。在这个世界里,你可能会决定揍一头巨龙,或者偷走国王的王冠,亦或是说服一个反派去当一名面包师。让这一切成为可能的魔法是一种被称为“大语言模型”(LLM)的超智能计算机大脑。把这些模型想象成才华横溢的即兴表演演员,他们几乎读过人类写过的每一本书。他们非常擅长听起来很自然、营造氛围并保持对话的流畅性。但问题在于:虽然他们非常擅长表现得像是“知道”故事内容的样子,但他们往往难以真正“记住”他们正在构建的世界规则。如果计算机说“门锁上了”,几分钟后它可能又会让你直接穿门而过,仿佛门一直是开着的一样,或者它可能会忘记你已经找到了钥匙。对于那些希望创造一个无论玩家如何天马行空都能保持真实感和一致性的游戏设计师和故事讲述者来说,这是一个大问题。
这篇题为《LLM智能体能坚持剧本吗?》(Can LLM Agents Stick to the Script?)的论文深入探讨了这一问题。研究人员创建了一个特殊的测试场,称为 NCP-Bench(叙事承诺保持基准),以观察这些 AI 故事讲述者能否在一段漫长且混乱的游戏过程中保持承诺。他们根据著名的电影情节(如《钢铁侠》或《谍影重重》)搭建了 100 个不同的故事世界。在每个世界中,AI 扮演“游戏主持人”(Game Master),负责掌控全局,而第二个 AI 则扮演“捣蛋鬼”玩家,试图跳过剧情、破坏规则或强行让故事走向不可能的方向。目标是观察游戏主持人是否能够保持一致性——即记录事实、记住发生过的事情,并严格遵守剧情所要求的里程碑——即使在玩家试图破坏游戏的情况下也是如此。
研究结果给 AI 社区带来了一次现实的警醒。研究发现,即使是最先进的、顶尖的 AI 模型,在情况变得复杂时,也难以维持剧本的连贯性。虽然这些模型可以写出优美、流畅且令人兴奋的故事,但当游戏进行得太久时,它们往往会“丢掉剧情”。在测试中,表现最好的模型(GPT-5.2 的一个版本)在仅经过 20 轮互动后,仍能保持没有逻辑错误地运行的时间仅为 42%。随着游戏的进行,生存率急剧下降。当游戏达到 100 轮的上限时,几乎没有模型能在不产生矛盾或忘记重大情节的情况下完成整个故事。
研究人员发现,最常见的错误并不是 AI 变得刻薄或忽视玩家,而是 AI 仅仅是忘记了它之前建立的事实。大约 40% 到 68% 的失败属于“事实冲突”,即 AI 会说出与它十分钟前所说的话直接矛盾的内容。例如,如果故事设定某个角色受伤了,AI 随后可能会描述该角色在毫无损伤的情况下跑完马拉松。即使当 AI 试图通过帮助玩家跳过枯燥部分来表现得乐于助人时,它也经常通过改写历史的方式来破坏世界的逻辑。
有趣的是,论文还测试了一种专门设计的带有“记忆”系统的 AI,旨在帮助它更好地记忆事物。虽然这种记忆系统帮助 AI 在游戏中坚持得稍久了一些,但并没有解决问题。事实上,这种记忆系统有时会让 AI 在听取玩家具体行动方面表现得更差,因为它太忙于将故事总结成大块的内容,从而忽略了微小的细节。这项研究表明,仅仅让 AI 变得更聪明或给它更多的记忆是不够的;我们需要一种新的方法来教导这些模型如何将故事规则视为不可逾越的法律,而不仅仅是建议。
简而言之,论文得出结论:虽然我们目前的 AI 故事讲述者在即兴发挥和听起来很酷方面表现出色,但它们目前在应对长期挑战方面表现得很糟糕。当玩家试图破坏规则时,它们无法可靠地坚持剧本。作者希望通过提供这个基准测试,其他研究人员可以构建更好的工具来修复这个问题,以便有一天,我们能拥有真正无穷尽、连贯且充满魔力的互动故事,无论我们做什么,那个世界都能自圆其说。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。