Five Primitives for Governing Autonomous AI Agents at Runtime
本文认为,治理自主人工智能智能体需要一种基于五种基本原语——发现、身份、治理、证明和供应链——的运行时控制模型,以应对瞬态、模型驱动和动态发现的智能体所带来的独特挑战,并提出了一种部分实现的架构,该架构在根据策略对行为进行调解的同时,明确承认了相关的性能成本及当前的集成状态。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字世界中,大型组织依赖于代表其执行任务的软件程序。几十年来,这些程序是可预测的:人类工程师编写代码,安装程序,并赋予其一套特定的指令。如果程序需要发送电子邮件或转移资金,它会严格按照指示执行,不多也不少。为了确保这些程序的安全,公司建立了检查其身份并记录其行为的系统,就像保安检查门口的通行证一样。然而,一种改变了规则的新型软件已经到来。这些是自主智能体(autonomous agents),它们不再仅仅遵循固定的脚本,而是利用人工智能来决定下一步该做什么。它们可以在几秒钟内出现又消失,它们可以从大量人类未预先编写的动作中进行选择,而且任何拥有互联网连接的人都可以创建一个。由于这些智能体与旧有的、可预测的程序如此不同,为过去设计的安全系统无法保护它们。
Aurite AI 的一个研究小组投入时间构建了一种在这些不可预测的智能体运行时进行管理的新方法。他们认为,试图通过在启动前固定其代码来控制这些智能体是不可能的,因为智能体会自己在最后一刻决定其行为。相反,他们提议建立一个系统,监控智能体尝试采取的每一个动作,并在其未获授权时将其拦截。为了实现这一目标,他们确定了每一个动作都必须回答的五个核心问题。首先,系统必须知道智能体的存在;第二,必须证明该智能体的身份;第三,必须决定该智能体是否有权执行其请求的操作;第四,必须创建一个任何人稍后都可以检查的永久性、不可更改的记录;第五,必须验证智能体的组成成分,以确保其未被秘密篡改。研究人员构建了一个能够实时回答前四个问题的系统,目前正在将第五个问题作为一个独立的工具进行开发。他们发现,虽然这种方法是必要的,但它也带来了代价:它会略微减慢系统的运行速度,并且需要一个辅助程序与每个智能体协同运行。
研究人员面临的核心问题在于,传统的安全性依赖于在程序启动前准确预知其行为。如果雇佣一名人类员工,会给予其一枚徽章和一份规则清单。如果安装一项服务,会赋予其一份特定的工作说明书。但自主智能体是不同的。它就像一个没有签证就抵达的旅行者,声称自己是公民,然后即兴决定去哪个国家以及在那里做什么。研究人员发现,旧的安全工具是为人类和固定服务设计的,无法处理这种情况。标准的安全性检查可能会验证智能体是否为其所言,但无法阻止智能体选择一个无人预料到的危险行为。同样,一个仅检查批准动作列表的安全守卫,也无法阻止智能体即兴创造出一个新的、有害的行为。研究人员得出结论,治理这些智能体的唯一方法是在它们尝试行动的精确时刻进行干预,在允许其继续执行之前,将其请求与一套规则进行比对。
为了解决这个问题,该团队设计了一个由五个不同部分(或称为原语)组成的系统,这些部分协同工作。第一部分是发现(discovery)。由于智能体可以在任何地方、任何时间出现,系统必须能够找到它们。研究人员意识到,仅仅列出已知智能体是不够的,因为最危险的智能体是那些尚未注册的智能体。他们的系统旨在察觉当一个智能体尝试进行系统无法识别的操作时。系统不仅是直接拦截,还会记录该尝试并提醒人类操作员,操作员随后可以决定此项新动作未来是否应被允许。这使潜在的失败转化为了学习和更新规则的一种方式。
第二部分是身份(identity)。过去,一个程序可能会声称自己是某项特定服务,但研究人员发现,智能体可能会伪造身份。他们的系统要求智能体使用基于其运行位置和组成成分自动生成的数字凭证来证明其身份。这种证明在智能体尝试连接的瞬间进行检查,从而确保系统是在与真实的智能体对话而非冒充者。这种证明是短效且不断变化的,因此即使黑客窃取了凭证,它也会迅速失效。
第三部分是治理(governance),即实际的决策过程。在智能体发送电子邮件或转账之前,必须请求许可。系统会将请求与该组织特定的规则进行比对。如果动作被允许,智能体即可继续;如果不被允许,请求会被立即拦截。这种干预发生在动作发生之前,这是真正控制智能体的唯一途径。研究人员还加入了一个“终止开关”(kill switch),可以在智能体表现异常时立即停止其运行,而无需等待其数字凭证过期。
第四部分是证明(attestation),即关于创建可靠记录的过程。过去,公司会记录其程序的行为日志,但这些日志是由被监控的程序本身编写的。如果一个程序变得失控,它也可以修改日志以掩盖痕迹。研究人员构建了一个系统,将每一个决策都写入一条特殊的、不可更改的记录链。这条链条使用只有组织持有的密钥进行签名,其设计使得任何人(甚至是公司外部的人)都可以验证记录的真实性及其未被篡改。这为在法庭或调查过程中证明事实提供了依据。
第五部分是供应链验证(supply chain verification),即询问智能体究竟是由什么构成的。即使一个智能体已被识别且其行为获得批准,它也可能运行在受损的软件版本上。研究人员已经构建了工具来检查智能体的“成分”——其代码、数据和依赖项——但这些工具目前是作为独立于实时安全检查的工具运行的。虽然研究人员认为这种验证至关重要,因为一个身份明确但基于破碎部件构建的智能体仍然是危险的,但这项特定的检查目前尚未在发生的瞬间拦截动作;它仍是一个独立的开发步骤,而非集成在即时授权过程中的一部分。
研究人员在与几家组织的私下试验中测试了他们的系统。他们发现,五个部分中有四个已经完全建成并投入运行,而第五个部分仍在作为单独的工具进行开发。他们坦诚地说明了这种新方法的成本。由于系统会在每次请求发生前进行检查,这会增加一定的延迟。此外,它还需要一个被称为“边车”(sidecar)的小型辅助程序在每个智能体身旁运行以管理其身份。最重要的是,如果安全系统本身崩溃,为了保持安全,智能体必须停止工作。这意味着,安全系统的故障会导致业务停滞,研究人员认为这种权衡对于防止伤害是必要的。
最令人惊讶的发现之一是,系统还必须对其自身进行治理。研究人员意识到,他们用来管理智能体的工具本身也是自动化程序。他们决定让自己的管理工具也通过与客户智能体相同的安全检查。这意味着系统会检查自身的身份,决定自身的动作是否被允许,并将自身的决策记录在同一个不可更改的链条中。这确保了构建安全系统的人员无法绕过他们为他人制定的规则。
研究人员强调,他们的工作并不是要改变人工智能模型的思维或行为方式。他们假设模型正按预期工作,并专注于管理模型被允许做哪些事情的规则。他们认为,仅仅通过改进模型来解决问题是不够的,因为即使是一个表现良好的模型,也需要对其访问和更改权限进行限制。他们的解决方案是一个实用的框架,组织可以用它来管理这些全新的、不可预测的智能体。通过将问题分解为五个清晰的问题,他们为任何试图将这些强大的工具引入安全、受控环境的人提供了路线图。这项工作尚未完成,系统的第五部分仍在集成中,但其核心理念——即这些智能体必须被实时观察和检查——已被提议为一种必要的架构方法,其设计原理是通过实现过程而非在广泛部署人群中的测量结果来进行验证的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。