← 最新论文
💻 computer science

Beyond End-to-End Success: Diagnosing Failures in Long-Horizon Security LLM Agents

本文介绍了一种利用检查点和受控干预来精准定位长程安全大语言模型智能体上游瓶颈的诊断方法论,揭示了失效模式及引导策略的有效性会随模型代际发生显著变化,从而表明有必要进行细粒度的失效分析,而非仅依赖聚合成功指标。

原作者: Wei Shao, Chongzhou Fang, Zuxiong Tan, Zequan Liang, Setareh Rafatirad, Avesta Sasan, Houman Homayoun

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Shao, Chongzhou Fang, Zuxiong Tan, Zequan Liang, Setareh Rafatirad, Avesta Sasan, Houman Homayoun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,出现了一类全新的软件智能体,它们能够像人类一样通过与数字环境交互来执行复杂的、多步骤的任务。这些系统基于大语言模型构建,可以接受指令去探索网络、寻找隐藏信息并执行安全测试。然而,当这些智能体被要求解决那些跨度很长、涉及许多依赖性步骤的问题时,仅仅询问“它们是否成功了?”往往无法提供完整的信息。在一段漫长旅程的最后时刻失败,并不一定意味着智能体缺乏完成工作的技能;它可能意味着智能体甚至在找到起点之前就迷失了方向。理解这些数字探索者在哪里以及为什么跌倒,对于提高它们的性能,以及了解它们的实际能力水平至关重要。

加州大学戴维斯分校和罗彻斯特理工大学的研究人员开发了一种观察这些失败的新方法。他们没有仅仅计算智能体从头到尾完成任务的次数,而是构建了一个在过程中设置检查点的诊断系统。想象一条蜿蜒穿过森林的长路,目标是找到一种特定的稀有花朵并将其带回。如果一名徒步旅行者连第一英里都没走过,他们就永远没有机会发现那朵花,而他们未能带回花朵的事实,并不能说明他们识别或携带该花朵的能力。研究人员将这一逻辑应用于安全智能体,通过标记任务变得可能的确切时刻——即智能体找到必要信息或状态的时刻。通过将发生在这一时刻之前的失败与发生在这一时刻之后的失败区分开来,他们可以辨别出一个智能体究竟是单纯地迷失了方向,还是在找到正确的路径后才偏离了航向。

该团队使用四种不同类型的安全挑战测试了这种方法,每种挑战都旨在探测特定的长期技能。其中一个主要测试被称为“受控状态重用”(Controlled State Reuse),它要求智能体发现一段特定的数字信息,执行一系列无关的操作,然后利用最初的这段信息来完成最终目标。当他们最初使用名为 Gemini 2.5 Flash 的模型进行这些测试时,结果看起来令人沮丧:智能体在大多数情况下都未能完成任务。然而,当研究人员查看检查点时,他们发现了真正的症结所在。在绝大多数失败的尝试中,智能体甚至从未找到它本应记住的初始信息。它不是在比赛中途失败,而是在未能到达起跑线。

为了证明这一点,研究人员引入了一项受控干预。他们创建了一个场景,在任务的特定点,智能体会收到一条针对性的微小提示,该提示澄清了如何区分不同类型的数字服务。他们将这种“救援”信息与一条外观相似但并不包含任何有用信息的“安慰剂”信息进行了对比。结果令人震惊。当智能体收到有用的提示时,它找到初始信息的能力从大约三分之二的尝试跳升到了几乎全部。一旦智能体找到了信息,它几乎总能成功完成任务。这证实了智能体早期的挣扎并非由于缺乏记忆或推理能力,而仅仅是因为它对如何找到起始线索感到困惑。

当研究人员使用一个更新、更先进的模型 Gemini 3.7 Flash 重复进行完全相同的实验时,故事发生了出人意料的转折。他们使用了相同的任务、相同的检查点以及相同的有益提示,并未根据新模型的行为做出任何改变。这一次,结果却截然相反。那个有用的提示实际上让新模型的寻找初始信息的能力变差了。此外,当这个较新的模型设法找到信息后,它经常在完成任务的过程中失败。瓶颈发生了转移。对于旧模型来说,问题在于寻找起点;而对于新模型来说,问题在于找到它之后发生的事情。

这种反转凸显了一个关键教训,对于任何构建或评估这些智能系统的人来说都是如此。失败的来源并非静态的;它会随着技术的发展而改变。对于一代模型完美的诊断工具,对于下一代模型可能会产生误导。研究人员发现,仅仅依赖最终的成功率会完全掩盖这些细微差别。如果没有检查点分析,人们可能会误以为新模型只是更擅长寻找线索,或者更不擅长记忆,反之亦然。相反,详细的分解揭示了难度的本质已经发生了根本性的变化。

该研究还检查了其他类型的长程任务,例如从失败策略中恢复,或在结果不明朗时做出决策。在某些情况下,智能体非常擅长这项任务,以至于它们从未失败,这使得无法判断测试是否真的具有挑战性。在另一些情况下,智能体始终避开了测试旨在衡量的特定路径,这意味着测试结果无法告诉研究人员关于它们试图测试的技能的信息。这些发现表明,对于长程、复杂的任务,过程与终点同样重要。

最终,这项工作为理解人工智能智能体提供了一张更清晰的地图。它表明,成功不是一个单一的数字,而是一系列步骤的集合,每一步都有其潜在的失败可能。通过精准定位智能体停止的位置并测试原因,研究人员可以超越猜测,开始解决正确的问题。研究表明,看起来像是记忆或规划方面的失败,实际上可能是发现能力的失败,并且对于一个版本的 AI 有效的解决方案,对于下一个版本可能并不是合适的工具。随着这些系统变得越来越强大,诊断它们特定失败点的方法将与构建它们本身一样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →