← 最新论文
💬 NLP

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

该论文介绍了 SIMMER,一个利用人工构建的符号世界模型的厨房领域基准测试,旨在揭示当前的 LLM 规划器经常遭受未被察觉的潜在失效并导致不可逆的伤害,同时证明了显式的反事实状态推理可以显著降低这些风险。

原作者: Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位才华横溢但有点丢三落四的机器人厨师来为你做鸡肉沙拉。你给它一个简单的指令:“做一份鸡肉沙拉。”机器人点了点头,掏出菜刀,切开生鸡肉,将其煎熟,然后——在没有清洗案板的情况下——直接用同一个案板切新鲜生菜。

对机器人来说,每一个步骤看起来都是完美的。它抓取了鸡肉,切开了它,烹饪了它;它抓取了生菜,切开了生菜。没有任何一步是“违规”的。机器人没有试图去切石头,也没有试图去抓取虚无。但结果呢?一份沙拉现在被生鸡肉细菌污染了。机器人失败了,但并不是因为它犯了某种响亮的、明显的错误。它失败是因为它没有意识到案板的“历史”很重要。

这就是 SIMMER 这篇论文试图解决的核心问题。

问题所在:“无声”的错误

大多数针对 AI 规划器(机器人背后的“大脑”)的测试只检查即时失败(Immediate Failures)。这些是响亮的、明显的错误,比如试图在另一只手拿着刀的同时切蔬菜,或者试图打开一个已经打开的冰箱。如果 AI 犯了这些错误,测试会立即停止,并给 AI 一个“失败”的分数。

但论文指出,真正的危险在于潜在失败(Latent Failures)。这些是无声的杀手。

  • 类比: 把这想象成玩叠叠乐(Jenga)。即时失败是在第一回合就把塔撞倒。而潜在失败是抽走了一个看起来没问题、但却削弱了结构,导致塔在三回合后倒塌的积木块。
  • 现实情况: 在厨房里,潜在失败就是用脏海绵擦拭干净的盘子。海绵看起来工作正常(它是湿的且有肥皂水),盘子也被擦过了。但细菌现在到了盘子上。AI 并没有“违反”游戏的规则,但它破坏了结果的安全性。更糟糕的是,其中一些失败是不可逆的。一旦细菌进入了生菜,你就无法“撤销”这个动作。沙拉毁了,任何重新规划都无法挽回。

解决方案:SIMMER(超级严格的厨房模拟器)

作者构建了一个新的测试场,名为 SIMMER。他们不仅仅是要求 AI 写出一份步骤清单,而是构建了一个符号化世界模型(Symbolic World Model)

  • 世界模型: 想象一本极其详尽的厨房规则手册。它知道有 77 种不同的动作(切、煎、洗)和 262 种不同的物体(鸡肉、刀、案板)。它追踪着 46,800 种可能的交互。它知道生肉会让表面变得“脏”,并且“脏”的表面会让其他食物也变“脏”。
  • 状态机执行器(State Machine Executor): 这是裁判。它不只是阅读 AI 的计划;它会在模拟中逐步“运行”这个计划。它观察案板如何变脏,观察细菌如何传播,并且即使计划中的每一步都遵循了基本规则,它也会将该计划标记为失败。

他们的发现:AI 很聪明,但不安全

研究人员在 100 个不同的烹饪任务中,对六个目前最智能的 AI 模型(包括顶尖的商业模型和开源模型)进行了测试。结果令人警醒:

  1. “完美计划”非常罕见: 即便是最好的 AI 模型,产生完全无误计划的概率也低于 17%
  2. 潜在失败无处不在: 大约 56% 的计划包含了这些无声的、潜在的失败。
  3. 不可逆陷阱: 很大一部分此类潜在失败导致了不可逆的灾难(如受污染的沙拉)。AI 并不知道自己正在制造健康隐患,因为它追踪的是“步骤”本身,而不是世界的“状态”。

它们为什么会失败?
论文发现,AI 模型擅长处理“做什么”(切鸡肉),但极其不擅长处理“语境”(鸡肉是生的,所以案板现在是脏的)。它们把动作视为孤立的数学问题,而不是一系列物理事件的链条。它们会忘记,如果你拿着一个碗,你的手就满了,在放下碗之前你无法抓取鸡蛋。

修复方法:“穿越时空”式思考

论文测试了一个聪明的技巧来修复这个问题。他们要求 AI 使用反事实预见模拟(Counterfactual Foresight Simulation)

  • 类比: AI 不再只是说“我会做 X”,而是被迫说:“如果我做 X,世界看起来会像 Y。Y 安全吗?如果安全,那么我会执行 X。”
  • 结果: 这种“穿越时空”式的思考(在行动前预测未来的状态)改变了局面。
    • 它将潜在失败减少了高达 72%
    • 它将不可逆灾难减少了高达 75%

底线

论文得出结论:虽然 AI 规划器在遵循指令方面变得越来越聪明,但它们在理解这些指令在混乱的现实世界环境中的后果方面仍然很差。它们需要停止仅仅进行“规划”,而是开始“模拟”未来,以便在造成不可逆的伤害之前捕捉到那些无声的错误。

SIMMER 是一个全新的工具,它迫使 AI 证明自己理解世界的隐藏规则,而不只是表面的规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →