← 最新论文
💻 computer science

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

本文介绍了用于分析大语言模型(LLM)智能体技能中逻辑关系的框架 SkillLogic,并提出了基准测试 SLBench,该基准测试揭示了当前的智能体频繁违反这些逻辑关系从而导致安全风险,同时证明了轻量级脚手架(SLGuard)可以显著缓解此类违规行为。

原作者: Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一个超级聪明的机器人助手来帮你盖房子。你给了它一份“技能手册”——一套关于如何铺砖、粉刷墙壁和修理漏水的指令。你可能会想:“太棒了!它只需要阅读手册并执行任务即可。”

但转折在于:这份手册不仅仅是一份步骤清单。它是一个隐藏规则的网络,比如“在底漆干透之前不要粉刷墙壁”或者“如果油漆洒了,你必须在离开房间之前将其清理干净”。这些就是逻辑关系

一篇名为 SLBench 的新论文(以及其背后的框架 SkillLogic)发现,这些机器人助手非常不擅长遵循规则之间的连接,即使它们能完美地执行主要步骤。

“无声灾难”场景

作者设置了一个令人毛骨悚然的场景来测试这一点。想象一个机器人被要求在一次医疗预约后清理混乱的房间。

  • 主要规则(条款 A): “提取医疗笔记,进行总结,并将总结交给用户。”
  • 隐藏规则(条款 B): “永久删除原始笔记和所有临时文件,即使发生意外情况也是如此。”

机器人阅读了主要规则,完成了工作,递交了总结,并说道:“全部完成!”它因此获得了一颗代表“乐于助人”的金星。但它悄无声息地将原始医疗笔记留在了硬盘上

对人类来说,这看起来像是成功。但对安全专家来说,这是一场灾难。机器人遵循了“动作”,但忽略了“逻辑关系”——即动作并未完成,直到清理工作结束为止。论文将这种现象称为后置条件违规(postcondition violation)

重大发现:70% 的手册都设有陷阱

研究人员并不只是在凭空猜测这是一个问题;他们进行了一场大规模的搜寻。他们扫描了超过 5,000 份公开的技能文件(这些机器人使用的手册)。

他们发现,70% 的手册至少包含一个这类棘手的逻辑连接。他们将这些连接分为八种类型,例如:

  • 前置条件: “在拿到钥匙之前,你不能开门。”
  • 约束条件: “你可以驾驶,但速度只能在每小时 50 英里以下。”
  • 回退机制: “如果主引擎故障,请立即切换到备用引擎。”

论文指出,目前的机器人助手无法连接这些点。它们擅长做“有趣”的部分(主要任务),但经常忘记“枯燥”的安全部分(清理、检查或限制)。

实测阶段:SLBench

为了证明这一点,团队构建了 SLBench,一个拥有 86 个特定场景的测试场。这些不仅仅是选择题;它们是真实的、可执行的测试,机器人会在其中运行代码、操作文件并更改设置。

他们测试了两个著名的机器人助手(Codex 和 Claude Code),使用了六种不同的脑模型(LLM 底层模型)。结果令人心惊:

  • 机器人在高达 70% 的案例中未能遵循逻辑规则。
  • 一些模型的安全性仅为 44%
  • 这些失败导致了现实世界的噩梦:隐私数据留在磁盘上、不安全的设置被更改以及杂乱的文件被遗留。

该论文明确排除了这些机器人只是“数学不好”或“愚笨”的可能性。事实上,当人类阅读相同的手册时,能够完美理解这些规则。问题不在于指令令人困惑,而在于机器人跳过了句子之间的逻辑联系。它们看到了“做这个”,却忽略了“然后你必须做那个”。

是否有解决方法?(“安全支架”)

作者尝试了一种被称为 SLGuard 的聪明技巧。他们没有重写整个手册,而是给机器人提供了一份“清单”。这份清单强调了隐藏规则:“记住,你必须在完成任务之后删除文件!”

当使用这份清单时:

  • 在他们测试的具体案例中,灾难减少了 63%
  • 然而,论文谨慎地指出,这并不是万能药。它对某些类型的规则(如“如果引擎故障则停止”)很有帮助,但在处理复杂状态跟踪或长期记忆时,它并不能解决所有问题。

论文说了什么,以及没说什么

  • 它证明了: 机器人目前无法遵循技能手册中的逻辑连接,从而导致像隐私泄露这样的不安全后果。这是一个截然不同的问题,不同于仅仅是“不遵守指令”。
  • 它排除了: 手册对人类来说太难理解(人类轻松通过了测试);也不是机器人仅仅因为“懒惰”;而是它们在主动忽略指令之间的关系
  • 它建议: 我们需要设计更好的“支架”(如 SLGuard 清单),以帮助机器人看到全貌,而不仅仅是主要任务。

底线

论文的结论是,要让机器人助手真正安全,它们不能仅仅是“指令遵循者”。它们需要成为逻辑遵循者。它们需要理解“步骤 A”和“步骤 B”之间由隐形的线索紧紧相连,如果它们剪断了这些线索,整个房子就会倒塌。

目前,它们仍在学习如何握住这些线索。论文建议,在此问题得到解决之前,我们在让这些机器人处理敏感任务(如清理医疗数据或管理安全设置)时应当非常谨慎。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →