A Governed Shared-Kernel Architecture for Persistent, Auditable Multi-Agent Societies Beyond the LLM Session
本文评估了“World 8”,这是一种实验性的共享内核架构,它通过将逻辑角色身份与瞬时会话解耦,来强制执行持久、可审计且可恢复的多智能体治理,并通过广泛的试验证明,虽然通用加固可以解决常见故障,但特定的治理封装对于防止复杂的授权和篡改漏洞是必不可少的。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一种新型系统正在兴起,其中多个计算机程序(通常被称为“智能体”)协同工作以解决问题。这些智能体可以相互交流、使用工具,并做出影响现实世界的决策,例如订购物资或执行金融交易。然而,随着这些系统变得更加持久——运行时间从几分钟延长到几天甚至几周——一个根本性的问题随之而来:我们如何知道谁才是真正的负责人?当一个计算机程序重启,或者互联网连接发生变化时,智能体的数字“身份”可能会丢失或产生混乱。如果一个系统无法清晰地区分临时会话与它所代表的永久实体,它就面临着允许错误行为发生,甚至更糟——让损坏或被劫持的进程继续行使权威的风险。这不仅仅是一个技术故障;这是一个治理问题。它关乎于确保谁能做什么的规则保持清晰且不间断,即使在底层机制发生变化时也是如此。
一位来自德黑兰大学的研究员萨义德·法罗基(Saeed Farokhi)针对一个名为“World 8”的系统进行了一项研究,探讨了这一特定挑战。其目标并非构建一个更聪明的机器人或利润更高的交易算法,而是测试一个特定的架构理念:一套规则是否可以使多智能体社会保持安全和可问责,无论在任何给定时刻是由哪台计算机或软件会话在执行工作?该研究将“逻辑主体”(负责决策的永久身份)视为与“运行时”(实际执行工作的临时环境)不同的事物。正如一个人无论是在咖啡馆还是在董事会发言,其身份始终如一,该系统旨在确保即使在软件会话崩溃并重启时,智能体的权威依然保持完整。研究重点在于一个“受控共享内核”(governed shared-kernel),这是一个位于智能体与外部世界之间的核心规则集,用于验证每一项行动都经过授权,确保没有人冒充他人,并且决策历史不会被秘密篡改。
为了进行测试,研究人员并没有依赖理论论证或小规模案例。他们构建了一个严密的检查程序,旨在通过“证伪法”(即试图破坏自身系统的过程)来测试系统。他们首先创建了一个“加固基准”(hardened baseline),这是一个已经包含了常见安全功能(如检查用户权限是否被撤销,或确保决策不会因意外而重复执行)的标准版本系统。他们将这个基准与新的 World 8 架构进行了 98,000 次模拟试验。结果是发人深省的:对于许多标准安全检查,新系统的表现并不比加固基准更好。这是一个刻意且诚实的发现,表明新架构并非从零开始发明基础安全功能,而是以一种特定的方式将它们结合起来。研究发现,该系统的真正价值在于它如何处理更复杂的、涉及智能体身份混淆或执行环境过时的极端失效情况。
随后,研究人员将同样的规则集应用于两种截然不同的模拟社会:一个管理供应链的公司和一个进行金融决策的交易社会。在每个社会进行的 1,000 次试验中,系统成功维持了相同的行为准则。它确保了“购买提案”并不等同于“最终购买批准”,并且确保在没有经过新鲜、经过验证的权威检查之前,无法执行最终订单。至关重要的是,系统阻止了“陈旧”的行动者(即已被替换或重启的软件实例)继续表现得好像仍由其掌控。它还创建了一个防篡改记录,即每一项决策的数字收据,能够显示是否有人在事后试图更改历史。该系统在两个社会中都通过了所有测试,证明了这些规则可以一致地应用于不同类型的任务,而无需为每项具体工作重新编写。
为了确保这些结果并非模拟代码的人为产物,研究人员在名为 AutoGen 的现有真实软件平台上对系统进行了测试,该平台广泛用于构建多智能体应用。他们在这一独立环境中运行了 2,000 个额外案例。结果显示,World 8 的规则可以叠加在这一标准平台上,以捕捉标准平台所遗漏的特定类型失效。例如,系统成功拦截了利用过期权限窃取审批权,以及在系统从崩溃中完全恢复之前就做出决策的情况。在这些特定场景下,标准系统失效了,但 World 8 治理封装层保持了流程的安全。研究人员还测试了如果故意破坏系统部分组件,安全规则是否能捕捉到错误。在所有案例中,系统都检测到了破坏并停止了行动,防止了故障进程造成损害。
本文的研究结论是谨慎且克制的。作者明确指出,这并不是声称 World 8 系统是人工智能领域的终极解决方案,也不意味着它能保证在任何情况下都实现完美安全。该研究并未证明该系统已准备好用于实时股票市场的商业应用,也未能证明它能防止所有类型的网络攻击。相反,它证明了通过一种特定的规则组合——即将身份与执行环境分离、在行动发生的瞬间检查权威、并保留不可更改的决策记录——可以共同构建一个更稳健、更具问责制的多智能体社会。研究表明,通过专注于“效应的治理”而非仅仅关注智能体的“智能”,可以构建出即使在底层技术发生变化或失效时仍能保持值得信赖的系统。这项工作提供了一个蓝图,指导如何构建数字社会,使其中的权威清晰、证据永久,并确保规则在后台发生任何混乱时依然稳固。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。