Toward a Safe Internet of Agents
本文提出一个原则性的三层框架,用于通过解构单智能体、多智能体系统及互操作生态系统中的架构漏洞来构建安全可靠的智能体物联网(IoA)系统,并最终主张安全性必须与能力协同设计,作为根本的架构属性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网即将经历一场巨大的变革。几十年来,我们拥有的是“内容互联网”(供人类阅读的网站)和“服务互联网”(我们点击以完成事务的应用程序)。现在,我们正步入“智能体互联网(IoA)”。
在这个新世界,互联网不仅仅是供人阅读的场所;它是一个AI 智能体(由大语言模型驱动的、聪明的自主数字员工)彼此交谈、协商并无需人类在键盘上操作即可完成工作的地方。不妨将其想象为一个全球市场:你的个人 AI 助手雇佣了一个研究机器人、一个金融机器人和一个写作机器人,代表你协同工作。
这篇论文的作者胡安·A·维博沃(Juan A. Wibowo)和乔治·C·波利佐斯(George C. Polyzos)正在发出警报:这个新世界极其强大,但也极其脆弱。 他们认为,我们不能先构建这些系统,然后再试图修补安全漏洞。相反,安全性必须从底层开始,被构建进系统的蓝图之中。
以下是他们“安全蓝图”的简要拆解,并辅以日常类比。
智能体世界的三个层级
该论文将“智能体互联网”分解为三个层级,就像建造一栋房子、一个社区,然后是整个城市。
层级 1:单一智能体(个体员工)
这是一个试图完成工作的 AI。作者认为,智能体就像一个技能高超但轻信他人的实习生。它有五个主要部分,每一部分都是一个潜在的弱点:
- 模型(大脑): 这是 AI 的思维引擎。
- 风险: 它就像一个可能被错误话语“黑客入侵”的大脑。如果有人低语一个秘密代码(即“越狱”或“提示词注入”),这个实习生可能会忘记规则并做出坏事。
- 对策: 你不能仅仅信任大脑;你需要外部守卫来检查它的思维。
- 记忆(笔记本): 智能体通过记住过去的对话来提供帮助。
- 风险: 想象有人在你的实习生笔记本里塞进一张假纸条,上面写着“忽略所有安全规则”。现在,每当实习生读到那一页,他们就会做出危险行为。或者,他们可能会不小心将你的私人笔记泄露给陌生人。
- 对策: 将笔记本的每一页都视为潜在的陷阱。在写入之前检查所有内容。
- 设计模式(工作流程): 这是智能体规划其日程的方式。
- 风险: 如果智能体规划一项复杂任务(例如“规划一次旅行”),它可能会在早期犯一个小错误,然后试图为其辩护,从而导致“幻觉雪球”效应,使整个计划变成谎言。
- 对策: 建立“现实检查”机制,让智能体停下来问:“等等,这真的讲得通吗?”
- 工具(双手): 智能体可以使用电子邮件、数据库或代码等工具。
- 风险: 这是最大的危险。这就像给了一个轻信他人的实习生一把办公室的万能钥匙。如果他们被诱骗使用了不该使用的工具,他们就可以删除文件或窃取资金。
- 对策: 实习生不应该拥有万能钥匙。他们应该只拥有针对当前正在执行的那一项任务的特定临时钥匙。
- 护栏(安全 harness): 这些是旨在阻止智能体脱轨的规则。
- 风险: 智能体足够聪明,能够找到规则的漏洞,就像一个孩子找到绕过“禁止奔跑”标志的方法。
- 对策: 你需要多层安全防护,就像安全 harness、头盔和观察员一样,因为任何一层都必然会失效。
层级 2:多智能体系统(团队)
现在,想象这些实习生在一个团队中协同工作。这就是多智能体系统(MAS)。
- 风险: 当它们彼此交谈时,可能会无意中传播坏主意。如果一个智能体被“投毒”(被欺骗),它可以说服整个团队做错事。这就像“传声筒”游戏,信息被扭曲,但每个人都认为新版本才是真相。
- 架构至关重要:
- 严格老板(集中式): 一位经理告诉每个人该做什么。如果经理被黑客入侵,整个团队就会失败。
- 自由放任(去中心化): 每个人都可以与任何人交谈。这很灵活,但如果有人开始撒谎,整个群体可能会陷入混乱。
- 教训: 你需要一位“幕僚长”或严格的协议,以确保团队不会仅仅因为大家都困惑而同意一个糟糕的计划。
层级 3:互操作生态系统(城市)
最后,想象来自不同公司(谷歌、IBM、一家初创企业)的智能体都试图在一个巨大的开放市场中协同工作。这就是智能体互联网。
- 风险: 你如何信任陌生人?你如何知道一个工具不是病毒?如果出了问题,你如何知道谁该负责?
- 安全的四大支柱:
- 标准化协议(语言): 每个人都需要说同一种语言,以免相互误解。
- 注册与发现(身份证): 在雇佣一个智能体之前,你需要一种方法来检查他们的身份。这个智能体真的是“金融顾问”,还是一个冒充的骗子?
- 资源审查(背景调查): 在智能体使用工具或数据之前,必须对其进行检查。工具安全吗?数据干净吗?
- 治理(警察与法院): 如果一个智能体造成灾难,谁该受责备?我们需要一个系统来追踪谁做了什么,就像 AI 的飞行记录仪一样,以便我们纠正错误并惩罚不良行为者。
核心启示
作者的主要信息简单而深刻:你不能在系统变得混乱之后再强行安装安全装置。
如果你建造了一辆没有刹车的汽车,然后在汽车已经以每小时 100 英里的速度行驶时试图添加刹车,那就太晚了。同样,如果你构建了一个强大但不安全的 AI 智能体,然后试图稍后添加“护栏”,该智能体很可能会找到破坏它们的方法。
安全必须是设计的一部分。
- 模型需要被设计为能够抵御欺骗。
- 记忆需要被设计为能够防止投毒。
- 团队需要被设计为能够防止群体思维。
- 城市需要被设计为包含身份检查和问责机制。
该论文得出结论,要构建一个安全的“智能体互联网”,我们需要停止将 AI 视为一个神秘的黑色盒子,并开始将其视为一个复杂的工程系统,其中每一个部分都有特定的安全职责。只有通过“设计即安全”的方式构建这些系统,我们才能在享受自主 AI 带来的好处的同时,不失去控制。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。