Automata from Agent Traces: Failure and Next-Step Prediction
本文提出了一种将大语言模型(LLM)智能体执行轨迹压缩为紧凑且与模型无关的有限状态机的方法,该方法能够有效捕捉共享的行为拓扑结构,从而实现卓越的下一步预测以及用于安全审计和运行时监控的早期故障检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个人工智能代理不再仅仅是回答问题的聊天机器人,而是能够独立解决复杂问题的自主工作者的世界。这些数字员工可以浏览网页、编写和调试计算机代码、管理客户服务查询,甚至控制桌面软件。它们通过将一个宏大的目标分解为一系列较小的步骤来运作,思考每一个步骤并采取行动。然而,随着这些代理变得更加强大,它们也变得越来越难以理解。它们的内部决策过程通常是一个黑盒,当它们失败时,很难判断它们是陷入了循环、犯了一个简单的错误,还是在一条毫无意义的混乱路径上徘徊。对于部署这些系统的公司和研究人员来说,这种不透明性是一个重大的安全风险。如果没有关于这些代理行为的清晰图谱,几乎不可能在错误造成损害之前捕捉到它们,也无法预测代理何时即将失败。
一组研究人员开发了一种新的方法来绘制这些自主代理的行为图谱,将它们杂乱、无结构的动作转化为清晰、紧凑的蓝图。研究人员并没有试图理解代理大脑中复杂的推理过程,而是将注意力集中在代理留下的外部行动轨迹上。他们将成千上万个这样的行动轨迹视为一个单一的数据集,并提出了一个简单的问题:我们能否找到一种隐藏的结构,来解释这些代理是如何从一步走向下一步的?通过分析行动序列——例如搜索信息、编辑文件或与用户交谈——他们发现,尽管代理的选择看似具有随机性,但其行为却遵循着一种惊人地严密且可预测的模式。研究人员构建了一个有限状态机,这本质上是一个捕捉代理可能采取的所有路径的流程图。这个流程图并非凭空猜测;它是根据真实世界数据提炼出的对代理实际行为的数学重建。
最令人震惊的发现是这些流程图是多么之小且高效。即使对于执行数千种不同任务的代理,研究人员发现其行为也可以被压缩成一个仅包含七到四十三个不同步骤的地图。这实现了复杂性的巨大降低。为了直观理解,请想象尝试通过列出每一条街道和每一栋建筑来描述一座庞大城市的布局;而研究人员则找到了一种方法,仅通过几个主要交叉口以及车辆如何在它们之间移动的规则,就能描述这座城市的交通流。在测试中,这些紧凑的地图能够以 0.997 的 AUC 值重现代理过去的行动。如此高的准确度表明,代理行为的结构更多是由它所使用的工具和被赋予的任务决定的,而不是由驱动它的特定语言模型决定的。
这种结构化地图不仅能描述过去,还能作为预测未来的强大工具。因为该地图捕捉了代理工作的逻辑流,所以它可以用来识别代理何时偏离轨道。研究人员展示了通过观察代理在地图中的移动,他们可以在任务完成前很久就预测任务会成功还是失败。在某些情况下,系统在代理仅完成工作四分之一时就能识别出失败的运行,从而实现早期干预。这比以往通常要等到结束才能判断成功或失败的方法有了显著改进。该地图在预测代理下一步行动方面也优于其他现有技术,能够基于代理当前在工作流中所处的位置,提供关于其可能采取何种行动的更清晰图景。
研究人员在涵盖了从编码、网页导航到客户服务和桌面管理的十二个不同数据集上测试了他们的方法。在每种情况下,该方法都生成了一个紧凑、可靠的地图,并且表现优于其他方法。不像旧技术经常创建包含数千个不必要状态的过度复杂模型,或者创建过于简单而无法投入使用的模型,这种方法找到了平衡点。它创建的模型既足够小,以便快速且易于分析,又足够详细,能够捕捉到代理行为的细微差别。这些地图的构建速度极快,仅需毫秒级即可完成,这意味着它们可以用于实时监控正在工作的代理。
这项工作的意义不仅在于让代理变得更安全。通过揭示这些复杂系统的行为受控于一个简单的底层结构,研究人员为审计和理解人工智能提供了一种新途径。这种结构并不依赖于所使用的特定 AI 模型类型;它在不同的模型和不同类型的任务中均保持一致。这表明环境的约束和代理可用的工具是其行为的主要驱动力,而非 AI 本身的内部逻辑。对于开发者和安全审计员而言,这提供了一种实用的、与模型无关的方法,用于监控代理、及早检测故障,并确保这些自主系统在安全且可预测的边界内运行。这项工作证明,即使是现代 AI 代理最复杂且看似混乱的行为,也可以被简化为一套清晰、可理解且可控的规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。