Who Governs Autonomous AI Execution? Execution Governance AI (EGA) V9: A Deterministic Runtime Governance Framework for Trustworthy Autonomous Workflows.
执行治理人工智能(EGA)V9 是一个确定性运行时框架,它通过结合回放一致性、溯源验证以及失效封闭式遏制,在不增加语言模型开销的情况下,实现对执行偏差的 100% 检测且零误报或漏报,从而实现可信的自主工作流,同时透明地承认在事后限制和副作用保证方面的特定局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能的世界正站在一个安静但关键的十字路口。多年来,这些系统因其生成文本、编写代码或总结新闻的能力而受到赞誉,充当着能够思考和交谈的强大助手。但一个新的阶段正在开始,这些系统不再仅仅是“说话”,而是开始“做事”。它们被要求执行复杂的任务,例如购买用品、管理数字账户或在不同的软件平台之间协调工作流。这种从生成文字到执行动作的转变引入了一个根本性的问题:当机器开始进行现实世界的操作时,我们如何信任它?如果一名人类员工犯了错误,我们可以审查其工作并予以纠正。但如果一个自主智能体在运行工作流时做出了错误的决策,它可能会瞬间转账、删除文件或将系统锁死。挑战不仅在于让人工智能变得更聪明,还在于构建一个能够实时监控 AI 行为的安全系统,确保其在遵循规则的同时,不会降低运行速度或造成高昂的运营成本。
在这种背景下,研究员边大中(DaeJung Byun)提出了一种名为执行治理人工智能(Execution Governance AI,简称 EGA V9)的新框架。该系统旨在作为这些自主智能体的严格自动化监督者。EGA V9 并没有试图根据概率来猜测 AI 的决策是好是坏,而是采取了不同的方法:它将任务的执行视为一部可以立即回放的录制电影。核心思想是,如果你确切知道 AI 应该做什么,并且拥有它实际做了什么的完美记录,你就能立即发现差异。该系统通过捕捉 AI 采取的每一步骤来运作,从任务开始到结束。然后,它在极短的时间内对这些步骤进行“回放”,以查看结果是否与计划相符。如果 AI 试图偏离轨道,例如使用它不被允许触碰的工具,或者修改交易中的某个数字,系统就会检测到这种不匹配,并在造成伤害之前停止该动作。
研究人员对该框架进行了严格测试,以观察它能否应对现实世界的混乱场景。他们创建了数千个测试情境,从简单的购买物品到复杂的恶意尝试(攻击者试图诱骗系统进行未经授权的购买或绕过安全规则)。在这些测试中,系统被要求处理多达 10,000 个不同的工作流。在所评估的情景中,结果表现得极其一致。该框架成功检测到了这些特定测试中 AI 试图违反规则的所有实例,在这些测试中实现了 100% 的错误捕捉,且从未误将安全的动作标记为危险。它以完美的准确度完成了任务,这意味着在包括那些设计得与合法工作完全一致的最难案例在内的整个测试范围内,既没有误报,也没有漏掉威胁。然而,研究人员澄清说,这些结果描述的是评估场景内的执行偏差检测,不应被解释为对所有运行时安全属性的保证。
这种方法之所以特别值得关注,在于其高效的运行方式。通常情况下,为计算机系统添加安全层会降低速度或需要昂贵的额外计算能力。然而,EGA V9 被设计为可以在与 AI 相同的机器上本地运行,无需向另一台强大的计算机寻求帮助。测试表明,该系统几乎没有增加任何延迟。验证单个步骤所需的时间以千分之一秒计,在最快的检查中约为 0.003 毫秒。此外,该系统不需要任何对驱动 AI 的大语言模型的额外调用,也不需要向外部服务发送额外的请求。这意味着安全检查是即时且“免费”的(在时间和金钱方面),允许 AI 在保持全速工作的同时处于持续监管之下。
该框架由五个协同工作的不同层级构建而成,以创建一个安全的环境。第一层,三位一体核心(Trinity Core),充当记忆体,记录每一次状态变化和动作,以便稍后回放。第二层,溯源层(Provenance Layer),构建因果关系图,追踪究竟是哪个决策导致了哪个动作。如果图中显示链接断裂或步骤缺失,系统就会知道出了问题。第三层,遏制层(Containment Layer),是发现问题时介入的卫兵。如果系统检测到 AI 的行为超出了其规则,该层会立即拦截该动作并隔离工作流,防止损害扩散。第四层为人类操作员提供了一个观察现状的窗口,第五层则允许研究人员在安全受控的环境中测试系统对抗新类型攻击的能力。这些层级共同构成了一个“故障关闭”(fail-closed)系统,意味着如果系统无法确定或检测到威胁,它会默认停止动作而非让其继续进行。
尽管取得了这些令人印象深刻的成果,研究人员仍谨慎地定义了其系统的能力边界。研究确认,该框架在他们测试的特定任务和攻击类型方面表现异常出色,但并未声称它是针对每种可能危险的通用解决方案。例如,虽然系统能有效抑制发生活跃不匹配时的执行过程,但它目前还不具备永久阻止 AI 在威胁消除后再次尝试相同错误动作的能力。它目前也无法保证一系列复杂的动作会精确地仅执行一次而没有重复,这对于金融交易等功能至关重要。此外,虽然系统可以追踪 AI 的内部行为,但如果数据在到达系统之前就已经缺失或被伪造,它还无法完全验证每一项证据的完整性。这些并非当前测试的失败,而是该技术现状的明确界限。
这项工作的意义在于,它证明了我们可以为自主 AI 构建一个快速、廉价且可靠的安全网,而无需改变 AI 本身。通过将执行视为一个确定性的过程——一个可以被回放并以绝对确定性进行验证的过程——研究人员表明,我们不需要依赖猜测来保障这些系统的安全。该系统证明,实现一个能够监视每一步行动、在评估范围内捕捉每一个错误、并在检测到活跃受管请求期间拦截每一个威胁的监督者是可能的,同时几乎不会给计算机性能带来负担。这为那些希望使用强大的 AI 智能体执行实际任务、同时又希望确保任务在安全且正确的情况下完成的组织,提供了一条切实可行的路径。这项工作仍然向外界开放,邀请科学界进行测试、挑战和改进,以验证这些发现并推动自主安全领域的边界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。