Runtime Risk Detection and Control for AI Agents and LLM Applications
本文通过对 AgentGuard AI v2.4.0 进行基于人工制品的案例研究,展示了该研究原型如何实现 AI 智能体的运行时风险检测与控制机制,同时强调了其作为可检查治理工具的效用,并指出了导致无法声称具备生产有效性的特定可复现性缺陷。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机程序不再仅仅是回答问题,而是能够主动进入数字世界去收集信息、做出决策并独立采取行动的世界。这些被称为 AI 智能体(AI agents)。它们就像数字员工,可以通过将许多微小的步骤串联起来,来预订机票、分析数据或控制智能设备。然而,这种新的能力也带来了一种特定的危险。因为这些智能体会阅读互联网上的信息并据此采取行动,一个隐藏在看似无害的网站中的巧妙陷阱可能会诱骗智能体做出有害的行为,例如窃取数据或删除文件。问题的关键在于,等到人类注意到错误时,智能体可能已经造成了损害。为了阻止这种情况,我们需要一种方法在这些智能体工作时进行监视,识别它们何时即将做出风险行为,并在其行动前暂停下来供人类检查。
这是一个名为 AgentGuard AI 的研究项目所应对的挑战。来自印度一所大学的研究人员构建了一个原型系统,旨在作为这些自主程序的“监视器”。他们的目标不是构建一个完美的现实世界安全产品,而是创建一个可以展示如何连接三个关键理念的工作模型:检测风险行为、评估该行为的危险程度以及决定下一步行动。他们想看看是否可以建立一个不仅能发现麻烦,还能为每一次决策保留清晰、不可篡改记录的系统,以便人类稍后可以精确审查发生了什么以及为什么发生。其结果是对一个试图为混乱的 AI 智能体世界带来秩序和人类监督的软件工具进行的详细观察。
他们构建的这个名为 AgentGuard AI 的系统运作起来就像是数字智能体的控制塔。它首先通过观察智能体工作的事件流来进行监控。它会寻找暗示危险的特定模式,例如智能体试图访问秘密文件,或遵循一个可能是陷阱的模糊指令。当它发现可疑情况时,它不仅仅是拉响警报;它还会计算一个风险分值。这个分数并非凭空捏造的一个数字,而是由六个不同因素组成的综合体,包括智能体工具的风险性、系统的安全性以及用户的行为。这些因素被共同加权,从而产生一个最终得分,告诉系统情况有多严重。
一旦计算出风险分值,系统就会进入决策阶段。它可以推荐四种状态:允许智能体继续执行、保持密切观察、限制智能体的权限,或者完全拦截该动作。至关重要的一点是,该系统旨在实现透明化。它记录了从初始警报到最终建议的每一个步骤的详细日志。它允许不同的人承担不同的角色:管理者可以更改规则,研究人员可以进行测试,而审核员可以查看日志以批准或拒绝操作。该系统还包含隐私功能,例如在日志中隐藏敏感的对话部分,并创建了一个数字化的“链条”记录,使得篡改历史记录变得非常困难。
为了测试这个想法是否真的奏效,研究人员进行了一项特定的实验。他们没有使用真实的智能体或真实的黑客。相反,他们使用了一个内置的模拟器来生成二十五个虚假事件。其中一些事件是安全的,而另一些则被设计成看起来像攻击。系统处理了这些事件,并生成了一套完整的证据包,包括原始数据、风险分值、警报和最终决策。研究人员随后仔细检查了这个证据包,将系统在屏幕上显示的内容与保存在数字文件中的内容进行了对比。
检查结果显示,该系统确实能够将所有的环节串联起来。它成功地接收了一个事件,计算了风险,做出了建议,并将证据以可供后续审查的方式保存了下来。这证明了基本的工作流程是可行的。然而,测试也揭示了一些严重的缺陷,使其无法成为一个现成的安全工具。研究人员发现该系统并不具备完美的连贯性。例如,屏幕显示的是一个版本的风险评分规则,但保存的文件却显示了另一个版本。在另一个案例中,系统表示它将拦截一个高风险动作,但保存的记录却显示它只是请求人工审查。这些不匹配意味着,如果你尝试重新运行该实验,可能无法得到完全相同的结果,这对于任何声称具有可靠性的系统来说都是一个重大问题。
此外,该系统缺乏实现真正证明所需的某些基本细节。它没有记录用于生成测试事件的具体随机种子,也没有记录正在运行的计算机代码的确切版本。如果没有这些细节,其他研究人员就无法完全重现实验以验证结果。研究也指出,该系统是作为一个简单的模拟程序运行在单台计算机上,而不是作为一个能够处理现实世界流量的复杂、高速服务。它是一个研究原型,而非成品。
研究人员非常明确地说明了他们的工作实现了什么以及没有实现什么。他们并没有证明其系统能够阻止真实的黑客,也没有证明其优于其他安全工具。他们也没有通过真实的人员来审查警报,以测试该系统是否减轻了工作量或改善了决策。他们所证明的是,他们可以构建一个将检测、评分和人工审查链接在一起的框架。他们展示了创建一个将风险事件与人类决策相连接的数字轨迹是可能的,但也表明,要构建一个一致、可重复且面向现实世界的系统,还需要大量的工作。
这项研究的价值在于其诚实性。研究人员并没有呈现一个经过润色、完美的解决方案,而是提出了一个工作模型,并随后对其进行拆解,以展示其强项与弱点。他们证明了,虽然治理感知型 AI 监视器的理念是合理的,但细节至关重要。一个声称要保护 AI 智能体的系统,必须能够保持其自身的记录准确,确保其规则得到一致应用,并为人类做出决策提供足够的信息。在这些问题得到解决之前,该系统仍然是一个强大的研究工具和未来的蓝图,但尚未成为当下的护盾。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。