When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry
本文介绍了 AGENTCHAOSBENCH,这是一个包含 275 条注入运行时故障的智能体执行轨迹基准数据集,旨在证明目前的基于大语言模型的方法仅凭遥测数据难以准确检测和定位多样化的运行故障。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代软件不再仅仅是运行在计算机上的单个程序,它通常是由一组人工智能智能体(agents)协同工作的团队。想象一下这样一个数字劳动力:一个智能体负责规划行程,另一个负责预订机票,第三个负责检查天气,它们彼此通信并使用地图或日历等外部工具。这些系统依赖于一个复杂的连接网络:智能体之间相互交谈,向大语言模型寻求建议,调用外部工具执行任务,并遵循严格的安全规则以确保不会说出或做出有害的行为。当一切运转正常时,这个团队会产生一个正确的答案。但当出现问题时,最终结果可能会出错,或者系统可能会直接停止工作,而不给用户留下任何关于原因的线索。问题在于,仅仅观察最终结果并不能告诉我们故障发生的细节。究竟是因为 AI 做出了错误的决策,还是因为所需的某个工具响应过慢,亦或是某个安全检查被意外跳过了?为了修复这些系统,工程师需要看到整个旅程,而不仅仅是终点。
多伦多大学的一组研究人员构建了一个新的测试场,以帮助解开这个谜团。他们创建了一个名为 AgentChaosBench 的基准测试,这本质上是一个受控环境,旨在通过故意破坏这些 AI 团队来观察诊断工具是否能找到问题所在。研究人员选取了五个不同的现实应用场景——包括编写 SQL 代码、撰写书籍、管理社交媒体、创建落地页以及辅助招聘的系统——并模拟了十种不同的失效方式。这些失效包括工具拒绝回答、工具响应过慢、智能体之间的消息丢失以及安全规则被绕过。对于每一个损坏的场景,他们还使用完全相同的初始指令运行了一个完美的、无故障的版本。这种配对方式使他们能够准确知道哪里出了错以及错在哪里,从而创建了一套包含 2{75}条详细数字旅程记录的数据集。
他们工作的核心是观察自动化系统能否通过查看失败执行的记录来正确识别原因。他们剥离了任何可能泄露答案的标签,只留下发生的原始数据:调用时机、消息内容以及每个步骤的状态。随后,他们要求各种人工智能模型(从较小的本地模型到最强大的前沿模型)充当侦探。这些模型必须阅读记录,判断发生了哪种类型的故障,并精准定位是系统的哪个部分出了问题。研究人员还测试了向“侦探”提供一份完美的、无故障的运行记录进行对比是否会有所帮助。
结果表明,这项任务比人们预想的要困难得多。即使是最先进的模型(那些能够创作诗歌并解决复杂逻辑难题的模型)在诊断这些运行时故障方面也表现得相当吃力。当被要求从单条记录中识别故障类型时,表现最好的模型正确率还不到 25%。对于较小的模型,成功率甚至更低,维持在 13% 到 19% 左右,这几乎仅仅比随机猜测好一点。当模型必须指出失效的具体组件时,问题变得更加困难。它们定位正确系统部件的成功率仅为 31% 左右。当要求同时完成两项任务——命名故障类型并找到位置时,表现最好的模型的成功率降至仅 22%。
研究显示,某些故障比其他故障更容易被察觉。产生明显信号的错误(例如工具返回了清晰的错误信息或连接超时)被识别得更为频繁。然而,最危险且最隐蔽的故障仍然几乎无法被察觉。当安全规则被绕过,导致本应被拦截的请求得以执行时,模型几乎总是无法察觉。同样,当工具响应发生损坏或系统耗尽内存空间时,模型也无法可靠地将这些问题与正常行为区分开来。研究人员发现,提供一个完美的参考运行版本进行对比,在某些情况下确实有所帮助,例如识别工具响应异常缓慢或系统尝试占用过多内存的情况。然而,这种对比对于安全绕过或数据损坏并不起作用,因为损坏后的输出看起来依然合理,且安全检查看起来依然已经通过。
这项工作证明,虽然我们已经构建了能够协调多个 AI 智能体的复杂系统,但我们尚未建立起能够可靠理解其失效原因的工具。当前这一代诊断模型,即使是规模最大、能力最强的模型,也无法持续分辨出什么是损坏的工具、缓慢的网络、跳过的安全检查以及正常的运行。研究人员得出结论,修复这些系统需要超越“仅仅要求大语言模型阅读日志”的新方法。他们建议,未来的解决方案可能需要依赖于将当前执行过程与已知的良好运行过程进行对比,或者开发专门用于寻找这些运行故障的专业化工具,而不是仅仅依赖通用的智能。前进的道路在于构建更好的方法,以便在数字机器发生整体崩溃之前,看清其中那些隐形的裂痕。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。