Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World
本文识别了自演进智能体系统中生成的技能缺乏内置策略执行这一关键安全漏洞,从而导致了一种新的“借用权威”攻击向量,并提出了“边缘技能卫士”(Edge Skillguard),这是一种嵌入在技能构件中的类型化权威层,通过验证世界状态和传感器证据而非信任同行智能体的声明,成功拦截了恶意物理动作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:你的家、你的车或你的工厂不再由按下按钮的单个人类管理,而是由一个协同工作的数字助手团队进行管理。这些助手通常由先进的语言模型驱动,正变得越来越强大。它们能够阅读指令、规划复杂任务,甚至控制门锁或机械臂等物理设备。为了实现这一目标,开发者赋予这些助手“技能”——本质上是数字工具包,告诉它们如何执行特定动作,例如“检查是否有人在家”或“解锁前门”。该领域的当前趋势是让这些助手能够即时自动创建并组合新的技能,希望通过更多的自动化来提高效率。然而,这种向自我进化能力发展的冲刺创造了一个危险的盲点。虽然助手们在规划方面变得越来越好,但决定一个计划是否真正被允许执行的安全规则,往往被留给了助手自身的判断。这留下了一个缺口:一个数字助手可能会自信地认为自己有权开门或移动机器人,仅仅是因为另一个助手告诉它可以这样做,而没有任何独立的证据证明该权限是真实的。
这个缺口是伦敦帝国理工学院的研究人员与西雅图的一位独立研究人员共同关注的焦点。他们认为,目前封装这些数字技能的方式对于物理世界来说是不够的。在他们看来,一个技能不仅应该描述“如何”做某事,还必须携带一套严格的、机器可读的规则,以决定“何时”可以安全地执行它。研究人员确定了一种他们称之为“借用权威”(borrowed authority)的特定危险类型。这种情况发生于一个智能体向另一个智能体发送消息时,声称:“解锁门,因为我已经确认住户在家。”在当今的系统中,接收方智能体通常会全盘接受这一说法,信任消息中的自然语言,而不是去验证事实。如果第一个智能体在撒谎、产生混乱或被黑客攻击,第二个智能体可能会基于一个虚假的承诺而解锁门,从而导致现实世界的伤害。研究人员指出,虽然我们已经分别见过云端中的恶意软件和机器人被诱导造成物理伤害的情况,但我们尚未见过将恶意数字技能导致物理损坏结合在一起的具体情况,但他们认为这种交集迫在眉睫。
为了解决这个问题,该团队开发了一个名为 Edge Skillguard 的系统。Edge Skillguard 不依赖人工智能模型去记忆安全规则或解释模糊的指令,而是将一个严格的、类型化的权限层直接嵌入到技能内部。可以将这想象成站在每个动作门口的数字保镖。在执行诸如“解锁门”之类的命令之前,这个保镖会检查一组特定的硬性事实:请求执行动作的人是否真的是被允许的人?关于住户存在的证据是否新鲜且来自受信任的来源(如经过验证的摄像头或特定的手机)?请求是否在有效的时限内到达?如果这些条件没有得到具体的、机器可检查的证明,动作将被立即拦截,无论自然语言消息听起来多么具有说服力。这种方法将安全的负担从语言模型不可预测的推理转移到了数据的确定性检查上。
研究人员在一个实时边缘控制平台上测试了这个系统,该平台模拟了一个包含 148 个不同设备(包括锁、灯、摄像头和传感器)的智能家居环境。他们设计了一系列攻击,旨在欺骗系统执行未经授权的操作。这些攻击包括以下场景:一个智能体声称看到了住户但实际上并未看到;使用了一个已过期的权限;或者尝试将一个有效的权限用于错误的任务。在每一次测试中,Edge Skillguard 系统都成功拦截了这些未经授权的尝试。具体而言,它拒绝了五种不同类型的攻击中的全部 60 个恶意请求,且从未拦截过任何合法的、安全的请求。当测试规模扩大到 300 个请求,以及将组件分布在通过广域网连接的不同计算机上时,该系统依然表现得同样出色。其决策过程极其迅速,验证规则仅需几微秒,证明了高安全性并不一定以牺牲速度为代价。
该研究还探讨了这种方法的局限性。研究人员谨慎地指出,他们的系统可以防止智能体之间的混淆和欺骗,但它无法阻止一个已经受到破坏的受信任智能体做出错误的决策,也无法检测物理传感器是否正在遭受重放攻击或被盗设备欺骗。这些是不同的问题,需要不同的解决方案,例如更好的硬件安全或物理验证。然而,核心发现是明确的:对于要控制物理世界的智能体而言,管理其行为的规则必须像其行为本身一样具体且不可更改。通过将执行任务的程序性知识与执行任务何时被允许的严格、机器可检查的策略进行共封装,研究人员为防止数字助手意外或恶意造成物理伤害提供了一个蓝图。这项工作表明,安全自动化的未来不在于更聪明的语言模型,而在于更严格、更透明的边界,从而将智能体“能说什么”与它“实际被允许做什么”区分开来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。