← 最新论文
💻 computer science

Effective Segregation of Duties in Agentic Enterprise Authorization: Evaluating Shared-Dependence Risk in Maker–Checker Controls

本文引入了“有效职责分离”(Effective Segregation of Duties, SoD)的概念,用以区分 AI 驱动授权中的名义身份分离与实际独立审计,并通过大规模 P2P 基准测试证明,有效的风险缓解依赖于证据中介和异构检查器模型,而非仅仅是主体间的差异性。

原作者: Mohamed Abbas Elmasry

发布于 2026-09-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohamed Abbas Elmasry

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在银行或政府机构等大型组织的领域中,存在着一条保持安全的根本原则:没有任何一个人应该拥有独自发起并完成交易的权力。这一被称为“职责分离”的原则确保了如果一个人犯了错误或试图进行不当操作,第二个人会在任何有害情况发生前将其拦截。几十年来,这一系统依赖于两个不同的人类来互相检查对方的工作。然而今天,许多这些任务正被移交给人工智能智能体(AI agents)。这些是能够阅读文档、做出决策甚至执行财务转账的软件程序。面对的问题不再仅仅是关于是否拥有两个不同的 AI 程序,而是这两个程序是否真正独立。如果这两个智能体都依赖于相同的底层技术、相同的信息来源或相同的思维方式,它们可能会在同一时间犯下完全相同的错误,从而使安全检查变得毫无意义。

最近的一项研究旨在测试这种确切的情景。研究人员创建了一个基于现实世界采购规则的模拟环境,其中一个扮演“制单人”(maker)的 AI 智能体会提出一项采购建议,而第二个扮演“审核人”(checker)的 AI 智能体会决定是否批准该建议。目标是观察审核人未能阻止错误提案的频率。团队测试了设置这两个智能体的不同方式。在某些情况下,两个智能体使用同一种类型的 AI 模型;在其他情况下,它们使用不同的模型。他们还测试了审核人是被允许看到制单人的推理过程,还是必须直接查看原始事实;以及审核人是必须依赖制单人选择强调的信息,还是可以访问未经处理的原始数据。

结果非常显著。当系统处于最高水平的共享依赖状态时——即两个智能体使用相同的 AI 模型,审核人可以看到制单人的推理,且审核人仅看到制单人所选的信息——安全系统失败的次数超过了百分之六十。在这种情况下,第二个智能体只是同意了第一个智能体的错误,导致不安全的交易得以进行。然而,当研究人员通过改变设置来减少这些共享依赖时,结果得到了显著改善。通过为审核人使用不同的 AI 模型、隐藏制单人的推理过程,并让审核人直接访问原始源数据,失败率降至仅略高于百分之十三。这意味着,仅仅拥有两个不同的 AI 智能体是不够的;这两个智能体是如何连接的,以及它们看到了什么,其重要性远超它们的身份本身。

该研究还调查了安全检查阻碍正常工作的频率。一个连合格的提案也会拒绝的安全检查是毫无用处的,因为它会阻碍业务开展。研究人员发现,改进后的设置并没有引起这个问题。那些能捕捉到更多错误提案的系统,并没有显著地拒绝更多的正确提案。这表明,只要设计得当以避免导致共同失效的特定陷阱,构建既严格又高效的 AI 安全检查是可能的。

关于信息如何在两个智能体之间流动,研究提出了一个最重要的发现。最大的改进来自于让审核人直接获取原始证据,而不是依赖制单人提供的摘要。当制单人充当数据的中间人时,失败率要高得多。这表明第一个智能体可能会无意中或有意地过滤掉识别错误所需的关键细节。通过消除中间环节,让第二个智能体看到原始事实,系统变得更加可靠。同样,隐藏第一个智能体的书面解释也有助于减少错误,这表明第二个智能体有时会被第一个智能体的信心或逻辑所左右,而不是坚持事实。

研究人员还测试了将两种不同类型的 AI 模型配对会发生什么。他们发现,为审核人使用不同的模型可以显著降低两个模型在同一个错误提案上同时出错的可能性。然而,他们谨慎地指出,这一结果是针对他们所使用的特定模型组合的。这并不保证任何两种不同的 AI 模型结合在一起都一定能很好地工作,但它证明了混合使用模型是打破共享错误链的一种强有力策略。研究还强调了一个实际挑战:其中一种不同的模型组合更容易出现导致答案无法读取的技术故障。这提醒研究人员,安全性不仅关乎智能,也关乎可靠性。如果安全检查无法产生清晰的答案,它就无法履行职责。

最终,这项工作改变了我们看待自动化系统中安全性的方式。它表明,“两个不同的人”这一旧规则并不自动等同于“两个不同的 AI 智能体”。如果这两个智能体在思维方式、观察对象或构建方式上过于相似,它们很可能会共同失效。真正的安全需要一种刻意的设计,迫使第二个智能体使用不同的工具和不同的信息,从不同的角度来看待问题。研究结论认为,组织不能仅仅因为拥有两个智能体就假设其 AI 安全检查正在起作用。他们必须衡量这些检查的实际表现,确保第二个智能体是真正独立的,并且有能力发现第一个智能体的错误。只有通过将安全性视为一种可衡量的结果,而非仅仅是一个结构性的标签,我们才能信任这些强大的新工具来处理我们最敏感的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →