Governance at the Boundary: How Agent Decomposition Degrades Policy Compliance
本文介绍了 Fiducia-bench,旨在证明将 AI 智能体分解为多个组件会通过在交接边界处削弱关键事实,从而显著降低策略合规性,并导致随模型能力和架构而变化的过度升级与升级不足风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代金融世界中,银行和机构依赖复杂的计算机程序来核查新客户的身份并标记可疑活动。这些被称为“智能体”(agents)的程序旨在遵循严格的规则:如果客户看起来像已知的犯罪分子,智能体必须冻结账户并进行报告;如果客户显然是清白的,智能体必须让他们顺利通过而不受延误。长期以来,工程师们将这些智能体构建为单一、自包含的单元,由其处理从开始到结束的每一个步骤。然而,随着这些系统变得更加复杂,开发人员开始将它们分解为更小、更专业的组件。其中一个组件可能负责查找姓名,另一个可能检查数据库,而第三个则负责做出最终决策。这种被称为“分解”(decomposition)的方法旨在使系统更加有序和高效,就像一个大型工厂中不同的工人处理流水线上特定的部分,而不是由一个人独自完成整个产品的制造。
研究人员最近提出的关键问题是,这种分工协作是有助于还是损害了系统遵循规则的能力。当一项任务在不同的组件之间分配时,信息必须从一个环节传递到下一个环节。如果关键证据在交接过程中丢失或被遗忘,智能体可能会未能阻止犯罪分子,或者可能会错误地指控无辜的人。一组研究人员着手测量这种任务拆分究竟在多大程度上损害了智能体遵守法律的能力。他们不仅仅是询问计算机是否完成了工作,而是询问它是否根据管理金融安全的严格政策正确地完成了工作。
为了寻找答案,研究人员创建了一个名为 Fiducia-bench 的测试场,这是一个基于真实世界银行规则的一百个不同场景的集合。这些场景涉及核查客户身份和寻找洗钱迹象。他们设计这些测试是为了观察当智能体必须跨越一个“边界”——即一个系统向另一个系统移交任务的点——时会发生什么。在某些测试中,智能体在单个循环中独立工作。在另一些测试中,工作被拆分为三个阶段的固定流水线,或者由一个中央协调器管理并向小型子智能体分配任务。研究人员使用了两种不同的计算机模型来进行这些测试:一个强大的开源模型和一个更强大的专有模型。他们密切观察智能体是否发现了重要事实(例如客户出生日期不匹配或与政治敏感人物有关联),以及这些事实是否在到达负责做出最终决策的组件之前得以保留。
结果揭示了一个清晰且令人担忧的模式。当智能体作为一个单一单元工作时,它从未丢失任何发现的信息。然而,一旦工作被拆分为独立的组件,系统就开始丢失关键事实。在利用开源模型的测试中,当工作被划分为三阶段流水线时,系统丢失了超过一半已发现的重要事实。当工作由中央协调器分配给子智能体管理时,系统丢失了更多信息,丢弃了百分之八十五发现的事实。这意味着在绝大多数智能体发现线索的情况下,该线索在到达负责采取行动的部分之前就消失了。更强大的计算机模型表现得好得多,仅丢失了极小比例的事实,但当工作被划分时,它丢失的信息仍然比单独工作时要多。
这种失败最危险的方面在于它在两个方向上都有效,导致了两种相反类型的错误。如果丢失的事实是一个警告信号,智能体就会未能识别风险,让危险客户通过。如果丢失的事实是清白证明,智能体会错误地将安全的客户标记为威胁。研究人员发现,相同的机制——仅仅是在交接过程中遗忘了细节——既可以导致系统过于粗心,也可以导致系统过于偏执。例如,在一种场景中,系统丢弃了一个证明客户清白的事实,导致其不必要地冻结了账户。在另一种场景中,它丢弃了一个证明客户具有风险的事实,导致其放任其离开。做出最终错误的组件并不是那个未能找到线索的组件;失败发生在两个部分之间的沉默之中。
这项研究表明,我们构建这些系统的方式与计算机模型本身的智能程度同样重要。将任务分解为较小的部分这一行为引入了一个特定的失效点,即信息可以在此处泄露。虽然使用更强大的计算机模型可以减少信息丢失量,但并不能完全消除这个问题。研究人员得出结论,目前构建复杂、多部分智能体系统的趋势带有隐藏的代价:它降低了系统遵循维护安全之规则的可靠性。他们暗示,解决方案在于设计更好的方式让这些不同的部分进行沟通,确保在传递接力棒时不会落下任何至关重要的细节。在此之前,我们划分的工作越多,我们就越有可能丢失真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。