Towards Risk-free AI Agent Deployment
本文认为,实现基于大语言模型(LLM)智能体(agent)的无风险部署,需要系统性地关注其执行轨迹的测试与调试,以应对诸如非确定性和预言机问题(oracle problem)等挑战,并最终提供一份实用的检查清单,并识别出可信智能体集成的关键开放性问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一种新型的劳动者,他们不仅仅是遵循严格的指令列表,而是能够独立思考、计划并采取行动。这些数字工作者通常被称为“智能体”(agents),它们构建在强大的语言模型之上,能够理解请求、决定使用哪些工具,并执行一系列动作来解决问题。它们已经被用于编写代码、审批贷款以及管理银行复杂的业务流程。与传统的计算机程序(其行为类似于计算器——对于相同的输入总是给出完全相同的答案)不同,这些智能体是具有反应性的。它们观察周围环境,根据所见做出决策,然后采取行动,从而创造出一个可以延伸至数十步甚至数百步的事件链。这种灵活性使它们极其有用,但也让它们变得难以预测。当一个标准程序出错时,它通常会立即停止并显示清晰的错误信息。而当一个智能体失败时,它可能会在错误的路径上默默徘徊很长时间,最后才产生一个错误、不安全或有害的结果。由于这些错误可能隐藏在漫长的决策链深处,组织在无法保证其不会引发麻烦之前,往往不敢让这些智能体处理最重要的业务流程。
来自新加坡和美国的科研团队提出了一种新方法,旨在让这些智能体足够安全,以投入实际应用。他们认为,理解并修复这些数字工作者的关键在于记录它们完整的思考过程,且需按步骤进行。他们将这一记录称为“轨迹”(trajectory)。正如人类可能会通过记录日常日记来了解自己为何犯错一样,智能体的轨迹则是其所有思考内容、尝试使用的每一个工具以及从外部世界获得的每一次观察结果的完整日志。研究人员发现,如果只看最终答案,许多失败是不可见的。任务中第一步出现的错误,可能直到第五十步才会显现出来,届时损害已经造成。通过关注这一完整的事件记录,该团队开发了一种系统化的方法来测试和调试智能体,并将“轨迹”视为主要的真相来源。
研究人员确定了阻碍这些智能体安全部署的几个主要障碍。其中一个最大的问题是,通常很难判断一个智能体的答案是否真正正确。在常规软件中,你可以检查输出是否符合特定的预期结果。但在这些智能体身上,解决一个问题可能有多种不同的方式,且“正确”的答案可能会根据背景或提问者而改变。这使得很难建立一种测试机制来判定“这是通过,那是失败”。此外,由于这些智能体使用的模型会生成带有一定随机性的答案,运行两次完全相同的测试可能会产生两个不同的结果。这种不可预测性使得复现错误和修复错误变得困难。研究人员还指出,目前的测试工具是为简单程序设计的,无法轻易检查这些智能体所经历的复杂的多步旅程。他们发现,大多数现有测试仅关注最终结果,忽略了智能体在到达那里之前可能经历的危险偏离。
为了解决这些问题,该团队提出了一个新的框架,将智能体的旅程视为主要的研究对象。他们建议,开发者不应仅仅检查最终结果,而应该构建能够观察智能体整个路径的测试。这包括检查智能体是否选择了正确的工具、其推理在每一步是否合理,以及它是否对环境做出了正确的反应。他们还描述了如何通过追踪失败事件在长链中的根源来调试这些系统。如果一个智能体失败了,系统应当能够查看记录的轨迹,找到决策出错的确切时刻,并以此修复当前的尝试,或者吸取教训以确保此类错误不再发生。研究人员展示了这种方法如何让智能体在实时环境中从错误中恢复,甚至通过记住哪些做法有效、哪些无效,从而随着时间的推移不断提升自身技能。
论文最后为想要使用这些智能体的组织提供了一份实用的清单。在允许一个智能体处理真实的业务任务之前,组织必须确保拥有一套能够记录智能体每一步行动的系统。他们必须定义明确的规则,规定什么样的“旅程”才是成功的,而不仅仅是最终答案的成功。他们需要在模拟现实世界的安全环境中测试智能体,观察过程中是否存在隐藏的失败。一旦智能体开始运行,必须对其进行持续监控,并确保人类随时准备在智能体偏离航道时介入。最后,组织应当利用从每次失败中汲取的教训来更新智能体的记忆,使其在完成每一项任务时都变得更聪明、更安全。研究人员强调,虽然这些智能体前景广阔,但目前还尚未准备好被盲目信任。通过关注其行为的完整记录,我们可以建立起信任的基础,从而让这些强大的工具能够在不危及我们关键系统安全与稳定性的前提下,与我们并肩工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。