← 最新论文
💻 computer science

GAAR: Runtime Governance for Scalable Agentic Retrieval and Tool- Orchestrated Enterprise AI Systems

本文介绍了 GAAR,这是一种位于规划智能体与工具执行之间的运行时治理架构,通过广泛的合成基准测试证明,该架构在显著减少策略违规和不安全工具调用的同时,提升了企业级 AI 系统的忠实度和审计合规性,尽管这也会带来轻微的延迟增加。

原作者: Abhradeep Chatterjee

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Abhradeep Chatterjee

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不仅仅是与你聊天,而是能真正地“做事”。它们可以查询你的银行记录、预订机票,或者修复服务器崩溃。这就是“智能体 AI”(Agentic AI)令人兴奋的前沿领域。可以将这些智能体想象成超级聪明的数字实习生。它们建立在一种被称为“检索增强生成”(Retrieval-Augmented Generation, RAG)的基础之上。如果说普通的 AI 像是一个凭记忆回答测试题的学生,那么 RAG 就是允许该学生在回答前翻阅教科书的学生。它在回答之前先查找事实,这使得它的准确性更高。

但问题在于:当你把办公室、大楼甚至银行账户的钥匙交给一个数字实习生时,你需要一个非常严格的经理。你不能仅仅让实习生去猜测他们是否有权打开保险箱。他们需要检查身份证件、核实时间、确认老板是否说了“是”,并确保他们没有仅仅是读到了一个虚假指令。这就是运行时治理(Runtime Governance)的问题。它是指在 AI 工作期间发生的一套规则和检查机制,以确保它不会意外地违法、泄露秘密或做出危险行为。如果没有这个,一个有帮助的 AI 可能会变成一个混乱的 AI。


问题所在:“数字实习生”的“西部荒野”

于是有了 GAAR(治理感知型智能体检索),这是一个旨在成为 AI 智能体那类严厉、高度组织化经理的新系统。该论文背后的研究人员注意到,虽然 AI 智能体在规划多步任务方面变得越来越强,但它们往往过于信任他人。一个智能体可能会发现一份看起来很有用的文档,但如果它是过时的呢?如果询问用户的身份其实并不被允许查看这份文档呢?如果智能体试图使用一个它没有权限触碰的工具(比如发送电子邮件)呢?

过去,我们尝试通过在 AI 说话之后设置“护栏”(比如拦截脏话的过滤器)或使用简单的静态规则来解决这个问题。但作者认为,这些方法就像是在终点线放一个减速带来试图阻止一辆正在超速行驶的汽车。到那时,损害已经造成了。他们还认为,仅仅让 AI 进行“自我修正”是不够的,因为 AI 可能意识不到自己正在违反一项复杂的公司规则。

解决方案:“决策护照”

论文引入了 GAAR 作为一种中间件层——一个位于 AI 的“大脑”(规划器)与其“双手”(它使用的工具)之间的数字检查站。

想象一下,AI 智能体想要执行一项任务,比如“将报告发送给 CEO”。它不是直接去做,而是必须向 GAAR 经理提交一份决策护照。这份护照不仅仅是一个请求,它是一份结构化的文档,包括:

  • 证据: “这是我找到的用来支持这份报告的文件。”
  • 权限: “这是证明请求者有权查看此内容的证明。”
  • 风险检查: “我已经检查了这是否属于敏感话题。”
  • 审计追踪: “这是我即将执行的所有操作的记录。”

随后,GAAR 经理会进行快速审查。它会将护照与规则手册(政策)进行比对。如果证据已过时,护照会被盖上“修改”印章;如果用户没有正确的身份证明,会被盖上“拦截”印章;如果风险过高,则会被送往人工进行“人工审核”盖章。只有当护照被完全盖章并获得批准后,AI 才有权执行该动作。

数据说明(模拟实验)

研究人员不仅构建了这个系统,还在一个大规模的受控模拟环境中对其进行了测试。他们创建了一个虚构的企业环境,包含 12,000 个不同的场景(例如用户要求退款、IT 工作人员尝试重启服务器或经理检查预算)。他们将 GAAR 与其他方法进行了对比,包括标准 AI、带有工具的 AI 以及带有简单规则过滤器的 AI。

以下是他们在这些模拟实验中的表现:

  • 安全第一: GAAR 将“政策违规”(违反规则)从 12.9% 降低到了 5.0%。它还将“不安全工具调用”(使用不该使用的工具)从 8.6% 降低到了 3.6%
  • 可靠的回答: AI 的回答变得更加“忠实”(紧扣其发现的事实),从 0.79 上升到了 0.86
  • 审计痕迹: 最令人印象深刻的是,GAAR 将“审计合规性”(确保每项决策都有记录)从 63.4% 提高到了 96.2%
  • 成本: 为了这种安全性,也付出了微小的代价。获取答案的平均时间从 2.7 秒 增加到了 3.2 秒。作者认为这是一个公平的交易:为了避免重大的安全漏洞,多等半秒钟是值得的。

他们还对系统进行了压力测试,运行了多达 100,000 个回合,以观察它在压力下是否会崩溃。系统速度略有下降,但仍能正常工作,证明了其具备可扩展性。

“假设场景”与局限性

论文还对系统进行了“假设”测试。他们尝试用虚假攻击来欺骗系统,例如伪装成不同的用户(角色冒充)或喂入过时的规则(陈旧政策替换)。GAAR 拦截了大部分此类诡计,检测率在 94% 到 97% 之间。然而,作者非常谨慎地指出,这些都是模拟攻击,而非真实的黑客入侵。他们承认,他们的测试并未涵盖黑客可能用来欺骗系统的所有可能方式,因此这目前还不是一个“已解决”的安全问题。

他们还进行了一项“责任归属”实验(消融研究),以观察 GAAR 的哪个部分最为重要。他们发现:

  • 检查证据是提高回答准确性的关键。
  • 检查权限(你是谁)是阻止不安全操作的关键。
  • 审计追踪对于保留操作记录至关重要。

总结

本文提出,如果我们希望 AI 智能体能在真实公司中工作,我们就不能任由它们横冲直撞。我们需要一个像 GAAR 这样的系统作为守门人,在 AI 采取行动前的每一步都进行检查。他们的模拟结果表明,这种方法是有效的:它让 AI 更安全、更诚实且更易于追踪,而仅仅带来了极小的速度延迟。

然而,作者明确表示:这是一个模拟实验。他们尚未在真实的、活生生的企业环境中测试过。他们建议未来的工作需要观察当真实人类参与其中以及规则实时变化时,该系统表现如何。但就目前而言,GAAR 为驯服未来的“野性数字实习生”提供了一个充满前景的蓝图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →