← 最新论文
💻 computer science

AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems

AgentFlow 引入了一种以流为中心的策略语言和运行时强制执行框架,通过追踪跨工具和委托边界的敏感数据流来保障 LLM 智能体系统的安全,在成功消除多个基准测试中已确认的破坏行为的同时,保留或提升了任务效用。

原作者: Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字领域,人工智能已从简单的聊天机器人演变为能够代表我们执行复杂任务的得力助手。这些系统通常被称为“智能体”(agents),它们不仅能回答问题,还能阅读文档、搜索网络、访问私有数据库并发送电子邮件。它们充当着中介的角色,连接着用户的意图与互联网上广泛存在的各种工具。然而,这种新水平的自主性引入了一种微妙但危险的漏洞。这种危险并不总是表现为单一、明显的错误,比如智能体不小心删除了一个文件。相反,伤害往往源于一系列看似完全合理的行动序列。一个智能体可能会读取一份机密记录,对其进行总结,然后将该摘要通过电子邮件发送出去。每一步都是被允许的,但这种组合却导致了隐私信息的泄露。这正是研究人员面临的核心挑战:如何确保一个数据路径的重要性与单个步骤本身同样重要的系统安全。

弗吉尼亚理工大学的一个研究小组开发了一种名为 AgentFlow 的新框架,旨在解决这一特定问题。他们的工作重点是追踪信息在智能体工作流中的移动轨迹,而不仅仅是检查单次操作是否被允许。想象一位保安,他不仅检查你是否拥有进入某扇门的钥匙,还会观察你去了哪里、拿了什么东西,以及你是否被允许将该物品带往最终目的地。AgentFlow 正是基于这一原则运行的。它将每一件数据都视为具有描述其敏感性、类别和可信度的标签。如果数据来自不受信任的网站,它就会携带“不受信任”的标签;如果它包含社会保障号码,它就会携带“机密”的标签。随后,系统会观察这些标签在数据从数据库移动到工具,最后移动到电子邮件或公开帖子时的变化过程。

研究人员构建了一种语言,允许系统操作员编写关于这些数据旅程的规则。这些规则可以禁止一份机密摘要到达外部电子邮件地址,或者防止不受信任的网络内容被当作受信任的内部指令来处理。该系统的工作原理是在人工智能与其使用的工具之间放置一个监控器。在智能体被允许调用工具之前,监控器会检查数据的当前状态。它会询问:这些信息来自哪里?它是否经过了净化(sanitized)?智能体是否被允许将其发送到这个特定的地方?如果对其中任何问题的回答为“否”,该操作就会被拦截。这种方法不同于旧的安全方法,旧方法仅关注用户最初是否有权使用该工具。那些旧方法忽略了“安全的工具被用于不安全的数据”这一危险。

为了在部署系统之前确保其规则的严密性,研究人员创建了一个数学验证器。这个工具就像是一个压力测试,通过模拟数千种可能的场景来查看规则是否会被破坏。在测试中,这个验证器成功捕捉到了他们试图误导它的所有不安全的规则变体。当他们将该系统应用于现实世界的模拟任务时,结果令人瞩目。在一组旨在诱导智能体泄露数据或执行未经授权操作的近 950 个测试用例中,该系统将确认的安全违规次数从 33% 降低到了零。在另一组 200 个动态的、类似现实生活的任务中,它消除了 73.5% 的成功攻击,也将失败率降至零。至关重要的是,该系统在实现这些目标时并未破坏智能体完成工作的能力。事实上,在许多情况下,由于安全规则阻止了智能体被数据中隐藏的恶意指令所干扰,智能体反而完成了更多的预期任务。

研究人员谨慎地界定了他们工作的局限性。他们并未声称解决了人工智能的所有可能问题,例如 AI 编造事实或给出错误建议的情况。他们的系统专门设计用于处理通过工具和外部连接进行的数据流。该系统假设安全监控器本身是可信且实现正确的。这项研究专注于一种特定类型的威胁,即攻击者试图通过喂给智能体不受信任的内容(如被污染的网页或恶意电子邮件)来操纵智能体,从而诱导其执行用户从未预期的操作。通过关注数据的路径,AgentFlow 即使在每一个单独步骤看起来都很无害的情况下,也能阻止这些攻击。

评估显示,该系统适用于不同类型的任务,从银行业务、旅行规划到工作空间管理。在一个场景中,有人试图诱导智能体总结私人客户记录并将其发送给攻击者。标准的安全系统可能会允许这封邮件发出,因为智能体拥有发送消息的权限。然而,AgentFlow 察觉到正在被总结的数据是机密的,且电子邮件正发往一个外部地址,且未经过适当的安全检查,因此拦截了该操作。在另一个案例中,攻击者试图让智能体相信一条恶意指令是一项合法的内部政策。系统识别出该指令来自不受信任的来源,并拒绝让智能体据此采取行动。

研究人员还测量了这一安全层对智能体速度的影响。他们发现,添加到每个决策中的时间是微秒级的,相对于 AI 思考和生成响应的时间来说,这种延迟几乎可以忽略不计。这意味着保护措施并不会以牺牲速度或可用性为代价。团队针对多种已知的攻击方法测试了系统,包括那些试图利用工具连接或操纵智能体记忆的方法。在每一次涉及违反既定规则的数据移动攻击中,系统都成功阻止了攻击。

虽然结果令人鼓舞,但作者将其描述为针对特定类型策略执行的初步证据。他们承认,现实世界的应用需要仔细定义什么是敏感数据以及哪些行为是被允许的。该系统不会猜测用户的意图;它只执行被赋予的规则。如果用户希望将不受信任的网络内容发送到公开博客,他们必须明确配置一条允许此类行为的规则。如果没有该特定许可,系统为了安全起见会拦截该操作。这种在严格安全与必要灵活性之间的平衡,是让这些强大的智能体既有用又不危险的关键。

这项工作代表了我们思考如何保障人工智能安全方式的转变。研究人员不再试图预测 AI 可能出错的所有方式,而是构建了一个观察信息流并执行清晰边界的系统。通过追踪数据的来源及其允许的去向,AgentFlow 为现代智能体执行的复杂多步任务提供了一层安全网。它确保了即使智能体被诱导走上了危险的路径,系统也能在伤害发生前终止这段旅程。这种方法为在隐私和安全至上的环境中部署 AI 智能体提供了一条切实可行的路径,将自主行动的潜在风险转化为一个可控且受控的过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →