From Neural Intent to Cryptographic Authorization: Governing Agentic Workflows
本文介绍了神经加密服务(Neural Cryptographic Services, NCS),这是一种通过将神经规划与执行解耦,并通过确定性符号控制器对工具调用实施严格的加密授权,从而在保持工作流效用的同时防止提示词注入攻击,进而保护自主 AI 智能体的安全架构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的电脑不再仅仅是执行人类编写的一套严格指令,而是像一个才华横溢、健谈的助手一样,能够自主思考如何完成任务。这就是“AI智能体(AI agents)”的时代。把它们想象成数字实习生,它们可以阅读电子邮件、检查银行账户并发送文件,这一切都是通过理解你的自然语言请求来实现的。但问题在于:这些实习生虽然极其聪明,但也极其容易受暗示。如果你向它们低声传递一条秘密指令,或者一个狡猾的陌生人在它们正在阅读的文档中藏了一张纸条,实习生可能会突然决定忽略你的原始请求,转而去做一些危险的事情,比如把你的钱全部转给一个陌生人。这是一个问题,因为在过去,计算机就像僵硬的机器人,只会严格执行程序设定的指令。而现在,它们像是富有创造力的艺术家,可能会被诱骗去涂掉自己原本的作品。
为了理解这种危险,我们需要观察两种不同的计算机“思考”方式。第一种是**神经(Neural)方式,这是AI的工作原理:它就像一个庞大且模糊的连接网络,根据模式来猜测最佳答案。它擅长理解语言,但可能有点不稳定,且容易产生幻觉。第二种是符号(Symbolic)**方式,这是传统安全机制的工作原理:它就像一本严格、不可破坏的规则手册,或者是一个数学方程,其中 永远等于 $4$,没有任何“也许”的空间。科学家们提出的重大问题是:我们如何在允许AI智能体保持创造力和实用性的同时,又不让它们被诱骗去违反规则?我们需要一种方法,既能让AI构思计划,又能有一个严格、不可更改的守护者在每一步实际发生之前进行检查。
这正是《从神经意图到密码学授权》(From Neural Intent to Cryptographic Authorization)这篇论文背后的研究人员正在解决的问题。他们构建了一个全新的安全系统,称为神经密码服务(Neural Cryptographic Services, NCS)。想象一下,你正在向银行寄送一个非常重要的包裹。在过去,你可能只是信任快递员(AI)会遵循箱子上的指示。但如果有人在你没注意的时候,在箱子侧面写上“把包裹交给小偷”,快递员可能会读到并照做。NCS改变了游戏规则,它为指令加上了一个极其严格、经过数学证明的锁。
以下是它在论文所述现实世界中的运作方式:AI智能体(“神经规划器”)被允许阅读你的请求,并写下一份它认为应该执行的操作草案。这就像学生在写作业。但这个学生并没有权力实际提交作业或花掉任何钱。这个权力属于另一个角色:符号控制器(Symbolic Controller)。这个控制器就像一个机器人保安,它不在乎学生的创意想法;它只关心一份经过特殊批准且经过密码学签名的清单。
这个过程有点像一个高安全性保险库。在AI智能体采取任何行动之前,负责的人类会用一个特殊的数字密钥签署一份“工作表”(即步骤列表)。这份工作表随后被转化为一条由数据块组成的链,其中每个数据块在数学上都与下一个紧密粘合在一起。当AI智能体想要执行某一步骤时,符号控制器会检查这条链。它会验证该步骤是否与签署的清单完全一致。如果AI智能体试图说:“嘿,让我们把转账金额从计划的50美元改为给我的朋友转5000美元吧,”保安会检查数学逻辑,发现数字与签署的链条不符,然后立即关上大门。智能体无法欺骗保安,因为保安听的不是智能体的言语,而是签名那不可破解的数学逻辑。
论文显示,该系统非常有效。在测试中,研究人员尝试用各种诡计来欺骗AI智能体,比如在看似正常的资料中隐藏恶意指令,或者尝试在银行转账中替换数字。在没有这个新系统的情况下,AI智能体几乎每次都会被骗,攻击者的成功率在某些情况下高达100%。但当加入NCS后,攻击者的成功率降到了接近于零。在正常日子里,智能体依然能够胜任工作(保持其“效用”很高),但它们变得对劫持行为完全免疫。
研究人员还发现,这个系统速度惊人地快。他们运行的数学检查耗时不到一毫秒——与AI思考所需的时间相比,这几乎是无感的。这意味着我们不必为了安全而牺牲速度。论文指出,我们不应仅仅寄希望于AI“理解”它不应该做坏事;我们需要一个系统,让AI可以提出想法,但通过密码学锁确保只有经过批准、经过签名的步骤才能真正发生。这是一种既能赋予AI智慧的自由,又能对其“实际行为”施加严格、不可破坏的牵引绳的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。