Runtime Continuation after Faults in Partially Executed Agent Workflows
本文提出了一种针对部分执行的语言模型智能体工作流的运行时延续机制,该机制通过重建可信前沿、从规范契约中推导剩余义务,并仅通过由有效、新鲜且唯一匹配的证据所支持的授权效应来推进状态,从而确保从故障中安全恢复。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字化景观中,人工智能已从一个单纯编写文本的系统演变为能够主动执行任务的系统。这些智能体可以代表用户搜索网页、编辑文件、发送消息以及更新数据库。它们通过遵循一系列步骤(通常称为工作流)来运行,其中每一个动作都会改变现实世界的状态。然而,这种行动能力也带来了独特的脆弱性。如果智能体犯了错、被陷阱误导或在已经更改了文件或发送了消息后遇到了系统错误,那么仅仅尝试重新开始或从头开始可能是危险的。重放失败的序列可能会重复有害的操作,而从混乱的状态中继续运行则可能建立在错误的假设之上。核心挑战在于确定历史记录中的哪一部分是值得信赖的,哪些工作仍未完成,以及需要什么样的证明才能在不重复错误或不落入欺骗陷阱的情况下安全地向前推进。
研究人员李增及其团队(来自国家移民管理局信息技术研究所及香港科技大学)开发了一种解决此问题的新方法。他们将该系统称为 AgentMirror。AgentMirror 并不将破碎的工作流视为一个通过新尝试来修复的简单错误,而是将恢复过程视为对现实的一种严格的、循序渐进的验证。该系统运作的原则是:一旦智能体执行了一个动作,该动作的历史就会成为一个固定的事实点。如果智能体在此之后崩溃或被误导,系统不会要求人工智能来决定发生了什么。相反,它会查看一个经过验证的、关于实际发生了什么的记录,识别出究竟还有哪些任务尚未完成,并在允许任何新动作再次改变世界状态之前,要求提供具体的证明。
研究人员围绕他们称之为“信任前沿”(trusted frontier)的概念构建了这个系统。想象一下在沙滩上画的一条线,它标记了智能体历史记录被确认安全且正确的精确时刻。这条线之前的一切都被接受为真实;这条线之后的一切都是未经验证的。当故障发生时,系统不会让人工智能重写这条线,也不会让它假装错误从未发生。它仅根据直到该线为止的已验证历史来重建智能体的状态。从这一点开始,系统会计算一份“剩余义务”(residual obligations)清单——即智能体仍需完成以结束工作的特定且强制性的任务。然后,系统将这份清单呈现给人工智能作为指南,告诉它还剩下哪些工作,但并不赋予该智能体直接执行这些工作的权力。
关键的创新在于系统如何处理下一步。当人工智能提出一个新的动作建议时,该建议会被视为不可信的。系统会强制该动作通过一个被称为“普通准入”(ordinary admission)的标准安全检查,以确保其允许运行。如果动作执行了,系统并不会立即接受该任务已完成。它会等待一份“运行时收据”(runtime receipt),即由受信任机构颁发的数字证书,用以确认该动作确实已经发生并被正确观察。这份收据必须是“新鲜的”,意味着它是刚刚创建的,并且必须“绑定到当前的信任前沿”,这意味着它不能是旧动作的重放,也不能是来自不同会话的伪造品。只有当这份收据经过验证且与剩余任务中的某一个精确匹配时,系统才会允许智能体的官方进度记录向前推进。
为了测试他们的想法,研究人员使用了一个名为 AgentDojo 的基准测试,该测试模拟了各种任务,并故意引入故障和攻击,以观察智能体的行为。他们将 AgentMirror 系统与其他恢复方法(例如简单地重试最后一步或让智能体通过猜测来摆脱困境)进行了对比。结果显示,AgentMirror 在安全完成任务方面表现得显著更好。它成功地从故障中恢复,且没有允许未经授权的操作溜过;同时,它也防止了智能体落入试图让其重复有害操作的诱导性指令中。这项研究表明,通过将给予人工智能的引导与执行动作的权限分离,并通过要求为每一步提供新鲜证据,即使智能体本身受到损害,系统也能保持一条安全的路径。
研究人员还探讨了如果移除其特定安全规则的部分内容会发生什么。他们发现,如果跳过验证收据的步骤,系统会接受虚假或旧的证据,导致进度错误。如果允许恢复指南充当许可证,系统会让不可信的动作运行。如果不对动作进行是否精确匹配特定任务的检查,系统可能会关闭错误的任务或导致工作未完成。这些测试证实了其流程中每一部分的必要性:没有任何单一检查可以取代其他检查。该系统之所以有效,是因为它强制建立了一条信任链,即人工智能可以提议,但系统负责决策,且只有经过验证的现实才能改变记录。
这项工作并不声称使人工智能变得完美,也不声称解决了所有可能的失败。该系统依赖于初始合同或规则集的正确性;如果规则本身是错误的,系统也会忠实地遵循错误的路径。此外,如果这些动作的证明丢失了,它也无法撤销已经在现实世界中执行的操作。然而,它提供了一个稳健的框架,用于管理事情出错时的时刻。通过将恢复过程视为从一个已知的、安全的态向一个新的、经过验证的状态的严格转换,AgentMirror 提供了一种方法,即使智能体遇到错误或恶意干扰,也能保持安全运行。研究结论指出,实现安全延续的关键不在于更好的猜测,而在于更好的验证。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。